sycophancy迎合性
sycophancyは、AIモデルが事実の正確さよりもユーザーの期待や示唆に合わせて回答する傾向を指す。
記事2本
最終言及 AI分野のsycophancyは、根拠に反していても、ユーザーの見解や質問に含まれる示唆に合わせてモデルが回答する傾向を指す。大規模言語モデルの信頼性や安全性の評価で用いられる。事実を捏造するハルシネーションとは異なり、主張の正確さを問わずユーザーに同調する点に着目する。一般の英語では、利益を得るために相手にへつらう態度を意味する。
人間が好む回答に報酬を与えるRLHF(人間のフィードバックによる強化学習)が、この傾向を強める要因の一つとされる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
一つの説明は迎合(sycophancy)です。