アラインメントalignment
AIにおけるアラインメントは、モデルの目的や振る舞いを人間の意図と安全上の基準に合わせることを指す。
AIにおけるアラインメントは、モデルの目的や振る舞いを人間の意図、価値観、安全上の基準に合わせることを意味する。性能だけでなく、どのように応答し、どのような依頼を拒むべきかも対象となる。
人間のフィードバックを利用した学習やモデルの評価は、アラインメントに取り組む方法に含まれる。AI安全性がシステム全体のリスクも扱うのに対し、アラインメントはモデルの振る舞いに焦点を当てる。一般には、位置や方向などをそろえることも意味する。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
2014年ごろから「alignment」という言葉を使ってきたカリフォルニア大学バークレー校(UC Berkeley)のコンピューター科学教授スチュアート・ラッセルは、この目標そのものが達成不可能だと考えており、その意味でこの用語を少し後悔しているといいます。
安全のため、Dotsは同氏がOpenAIでこれまで最も厳格にアラインメントされ、最も安全なモデルと説明するAstraの上で動きます。
ボズワース氏はAIアラインメント、すなわちAIシステムをユーザーの意図に沿って動かすことを、実務的な問題として捉えています。
Hugging Faceをめぐる事例は、AIアラインメントに関する特定の問題を浮き彫りにしています。
開発者が安全性とアラインメントを検証できないシステムについて、競争を展開の理由にしてはならないと主張しました。
モデルの振る舞いを望ましい方向に導くアラインメントは有益な取り組みですが、その役割は従業員向けの行動規範に近く、システムがどう振る舞うべきかを定めるにとどまります。
Anthropicによると、Opus 5.5は、モデルが意図された振る舞いにどの程度従うかを調べる同社の総合的なアラインメント評価で、過去最高のスコアを記録しました。