プロンプトインジェクションprompt injection
プロンプトインジェクションは、AIへの入力に悪意ある指示を紛れ込ませ、動作を変えさせる攻撃。
プロンプトインジェクションは、AIモデルが処理する入力に攻撃者の指示を紛れ込ませ、本来のタスクから逸脱させる攻撃。通常のプロンプトがモデルへの作業指示であるのに対し、信頼できない内容に含まれる指示をモデルに従わせようとする。
ウェブページや文書、検索結果など、モデルが参照する資料に指示を隠す手法を間接プロンプトインジェクションという。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
これらの監視モデルは、プロンプトインジェクション(外部のコンテンツに指示を隠してAIを乗っ取る攻撃)を見張り、リスクの高い自律的な行動を止め、有害な動作が実行される前に介入します。
開発者からは、認証情報の漏えいやプロンプトインジェクションからエージェントをどう守るかという質問がよく寄せられます。
攻撃者が指示を紛れ込ませてモデルを乗っ取ろうとするプロンプトインジェクションのほか、ジェイルブレイクの試みや機密データの漏えいも防ぎます。
プロンプトインジェクション。
信頼できない内容が共有チャンネルに入ってくることは、プロンプトインジェクションのリスクにもなります。
両者が混ざると、埋め込まれた指示がタスクを混乱させたり、プロンプトインジェクション(外部のテキストがモデルの動作を別の方向へ向けようとすること)のリスクを生んだりします。
間接プロンプトインジェクションは、ユーザーからの直接の依頼ではなく、AIシステムがデータとして読む素材に指示を埋め込む手法です。
検証対象には、モデルが処理する素材に埋め込まれた指示によって振る舞いを変えようとするプロンプトインジェクションや、信頼できない近道を探す傾向を明らかにするため、意図的に達成不可能にしたタスクも含まれています。