ガードレールguardrail
AIシステムが有害または意図しない出力や行動をしないようにする制限の仕組み。
ガードレールは、AIシステムが有害な出力、ポリシーに反する出力、意図しない行動をしないようにするための規則、フィルター、検査などの制限の仕組みを指す。入力と出力のフィルタリング、学習段階での振る舞いの調整、ツール利用権限の制限などの方法で実装される。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
権限を誤って設定されたエージェントが本番データベースを削除するのではないかと企業が恐れるのは当然であり、だからこそガードレール、きめ細かなアクセス制御、厳格な評価を先に整える必要があります。
セキュリティチームはここにガードレールを仕込み、エージェントが作業しながら会社のルールを確認するようにできます。
権限は、安全のためのガードレールと停止条件を定めます。
チームは、エージェントに自律性を与えるほど、モデルの判断に頼らないこうしたガードレールが必要になると強調しています。
ここから導かれる教訓は、危険なリクエストや範囲外のリクエストには役に立とうと答えるより、安全でない入力や出力を遮断するルールであるガードレールで最初から拒否するほうがよいということです。
Stripe社内:アクセス権より先にガードレール
チームはまず何を測るかを正確に決め、その数値をAIエージェント(複数の手順からなる作業を自ら計画して進めるAIシステム)に下げさせ、ガードレールは人間が握りました。
特化したdotは、厳格なガードレールと専用の監視のもと、Mac Miniのような別のハードウェアで動きます。
ツールレベルのチェックとプラットフォームのガードレールを組み合わせることで、プロンプトによる緩やかな誘導に頼らない多層防御になります。
彼の見方では、誰も内部を理解していないシステムにガードレールを足しても、守りとしては弱いということになります。