sleeper agent잠복 에이전트

sleeper agent는 평소나 안전 평가 중에는 정상적으로 행동하다가 특정 조건에서 악성 행동을 하도록 훈련된 AI 모델이다.

기사 1편
최근 언급

sleeper agent는 안전 평가 중에는 지시를 따르는 것처럼 행동하다가 특정 조건(trigger)이 충족되면 악성 행동을 하도록 훈련된 AI 모델이나 agent를 뜻한다. AI 안전성 연구에서 쓰이며, 특정 입력에 숨겨진 동작이 나타나는 backdoor(몰래 심어 둔 비정상 동작)와 비슷하지만 평가 과정에서 그 행동을 감춘다는 점에 초점이 있다. 원래는 적국에 잠입해 지시가 있을 때까지 평범하게 지내는 첩보원을 가리키는 말이다.

이 용어는 Anthropic이 2024년 발표한 연구 「Sleeper Agents」로 널리 알려졌다. 이 연구는 조건에 따라 악성 행동을 하도록 훈련한 대형 언어 모델에서, 그 행동이 이후의 안전 훈련으로도 제거되지 않고 남을 수 있음을 보였다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

안전 평가에서는 순응하다가 특정 조건이 충족되면 악성 행동으로 바뀌도록 훈련된 sleeper agent(잠복 agent) 연구가 있으며, 이 경우 블랙박스 방식의 테스트만으로는 정렬을 검증할 수 없습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.