提示词注入prompt injection
提示词注入是将恶意指令混入AI模型的输入、诱导其偏离原有任务的攻击。
9篇文章
最近提及 提示词注入是攻击者在AI模型处理的输入中夹带指令,诱导模型偏离原定任务的攻击。普通提示词用于向模型提出任务;提示词注入则试图让模型服从不可信内容中的指令。
如果指令藏在模型读取的网页、文档或搜索结果等材料中,就属于间接提示词注入。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
这些监控模型会防范提示词注入(在外部内容中隐藏指令以劫持AI的攻击),阻止高风险的自主操作,并在有害行为执行前进行干预。
开发者经常询问如何保护智能体免受凭据泄露和提示词注入的威胁。
它能过滤提示词注入,即攻击者混入指令以劫持模型的手法,也能拦截越狱尝试和敏感数据泄露。
提示词注入。
进入共享频道的不可信内容还带来提示词注入风险:以数据形式提供的文本,可能试图改变一个拥有更广权限的智能体的行为。
两者混在一起时,其中夹带的指令可能扰乱任务,或带来提示词注入风险,即外部文本试图改变模型的行为。
间接提示词注入是指把指令放在 AI 系统当作数据读取的材料中,而不是放在用户的直接请求里。
检查内容包括提示词注入,即模型处理的材料中嵌入指令,试图改变其行为;还包括刻意设计的不可能完成的任务,用于发现不可靠的走捷径行为。