谄媚sycophancy

sycophancy指AI模型倾向于迎合用户的预期或暗示,而非依据事实准确作答。

2篇文章
最近提及

在人工智能领域,sycophancy指模型迎合用户的观点或提问中的暗示,即使这种回答缺乏事实依据。该术语用于评估大语言模型的可靠性与安全性。与凭空编造信息的“幻觉”不同,它的重点在于不论用户的判断是否准确都予以附和。在日常英语中,该词指为了获得好处而奉承他人。

奖励人类偏好回答的RLHF(基于人类反馈的强化学习)常被认为是造成这一倾向的原因之一。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

罗素认为,这种方法容易导致谄媚(sycophancy),也就是迎合用户、说用户想听的话。

一种解释是迎合倾向:对话模型可能附和问题中暗含的假设,即使那个假设是错的。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。