sycophancy아첨 성향
sycophancy는 AI 모델이 사실의 정확성보다 사용자의 기대나 암시에 맞춰 응답하는 경향이다.
기사 2편
최근 언급 sycophancy(아첨 성향)는 AI 모델이 사용자의 견해나 질문에 담긴 암시에 맞추느라 근거에 맞지 않는 답을 내놓는 경향이다. 대규모 언어 모델의 신뢰성과 안전성을 평가하는 분야에서 쓰인다. 근거 없이 사실을 지어내는 hallucination(환각)과 달리, 사용자의 주장이나 기대를 사실 여부와 관계없이 따르는 데 초점이 있다. 일상 영어에서는 이익을 얻으려고 상대의 비위를 맞추는 태도를 뜻한다.
사람이 선호하는 답에 보상을 주는 RLHF(인간 피드백 기반 강화 학습)가 이 경향을 키우는 원인 가운데 하나로 지목된다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
이를 sycophancy(사용자의 기대나 암시에 맞춰 답하는 경향)라고 합니다.