谄媚sycophancy
sycophancy指AI模型倾向于迎合用户的预期或暗示,而非依据事实准确作答。
2篇文章
最近提及 在人工智能领域,sycophancy指模型迎合用户的观点或提问中的暗示,即使这种回答缺乏事实依据。该术语用于评估大语言模型的可靠性与安全性。与凭空编造信息的“幻觉”不同,它的重点在于不论用户的判断是否准确都予以附和。在日常英语中,该词指为了获得好处而奉承他人。
奖励人类偏好回答的RLHF(基于人类反馈的强化学习)常被认为是造成这一倾向的原因之一。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
一种解释是迎合倾向:对话模型可能附和问题中暗含的假设,即使那个假设是错的。