prompt injection프롬프트 인젝션
prompt injection은 AI 모델이 읽는 입력에 악의적 지시를 섞어 원래 지시와 다른 행동을 유도하는 공격이다.
prompt injection은 AI 모델이 처리하는 입력에 공격자가 지시를 섞어, 모델이 원래의 작업 지시와 다르게 행동하도록 유도하는 공격이다. 이용자가 작업을 요청하는 일반적인 prompt와 달리, 신뢰해서는 안 되는 내용의 지시를 모델이 따르게 만드는 데 목적이 있다.
웹페이지, 문서, 검색 결과처럼 모델이 참고 자료로 읽는 곳에 지시를 숨기는 방식은 간접 prompt injection이라 한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.
이 항목을 다룬 기사
이 보조 모델은 prompt injection(외부 콘텐츠에 숨긴 지시로 AI를 조종하려는 공격)을 감시하고, 위험한 자율 행동을 멈추며, 해로운 동작이 실행되기 전에 개입합니다.
agent를 쓰는 개발자가 자주 묻는 것은 인증 정보 유출과 prompt injection(외부 콘텐츠에 숨긴 지시로 모델을 속이는 공격)입니다.
Model Armor: 들어오는 prompt와 나가는 응답을 모두 검사해 prompt injection(악의적인 지시를 끼워 넣어 모델을 조종하려는 공격), 탈옥 시도, 민감한 정보 유출을 거릅니다.
prompt injection: README 파일, 이슈, 웹 페이지에 숨긴 지시문이 agent를 속여 사용자가 요청하지 않은 일을 시킵니다.
외부 양식처럼 검증되지 않은 입력이 팀 채널로 바로 들어오면, 그 안의 문구가 넓은 권한을 가진 agent를 조종하려는 prompt injection(데이터에 숨긴 지시로 모델을 오도하는 공격)의 통로가 될 수도 있습니다.
이렇게 되면 prompt injection(외부 자료에 숨은 지시로 모델의 행동을 바꾸도록 유도하는 방식)에 취약해지고, 모델이 작업 범위를 잘못 이해할 수도 있습니다.
가격 안내 페이지를 다루는 사례에서는 외부 내용에 숨은 prompt injection(AI의 동작을 바꾸려는 지시)을 먼저 살피고, 추출한 페이지 내용에 비춰 네 가지 가격 주장을 확인했습니다.
간접 prompt injection, RAG 지식베이스 오염, 악성 모델 파일 익스플로잇이 2026년 대표적인 공격 표면으로 꼽히는 이유입니다.
수천 개의 모의 상황에서 진행한 자동 행동 감사에서도 최고 점수를 기록해 prompt injection(악의적 지시를 입력에 몰래 섞는 공격)에 대한 내성이 강해졌습니다.