AI 안전을 둘러싼 논의는 대체로 모델이 무엇을 하지 못하게 막을지에 집중됩니다. 그런데 정작 시스템을 지켜 온 사람들, 수십 년간 네트워크와 권한과 로그를 다뤄 온 사이버보안 전문가들은 그 논의의 핵심 자리에서 빠져 있다는 지적이 나옵니다. OpenAI와 Anthropic 같은 선도 연구소가 모델 안전을 강조하는 동안, 현장의 방어 담당자들은 모니터링과 망 분리, 접근 통제가 없는 환경을 전제로 한 위협 시나리오가 만들어진다고 봅니다. 안전 선언과 실제 방어 체계 사이의 간극은 어디에서 생기고, 조직은 무엇을 준비해야 할까요.

모델 정렬은 사내 규정에 가깝습니다

모델 정렬(alignment, 모델이 어떻게 행동해야 하는지 가르치는 작업)은 조직으로 치면 사내 규정과 비슷합니다. 규정이 중요하지만 규정만으로 조직이 안전해지지 않듯, 정렬만으로 시스템이 안전해지지는 않습니다. 규칙은 어김없이 깨지기 때문에 권한 분리, 접근 통제, 로그 감시 같은 구조적 통제가 함께 있어야 합니다.

최전선 연구소의 경고가 현실과 동떨어진 전제 위에 서 있다는 비판도 같은 맥락입니다. 영국 국가사이버안보센터 전 책임자는 그런 경고가 백신, 디도스(대량 트래픽으로 서비스를 마비시키는 공격) 완화, 망 분리, 사고 대응, 지속적 모니터링 같은 기본 방어가 아예 없는 환경을 가정한다고 지적했습니다. 보안 교육·인증 기관인 SANS Institute의 최고경영자도 연구소들이 지나치게 먼 미래의 시나리오에 몰두한다고 비판했습니다.

AI 시스템도 결국 데이터와 코드입니다. 권한 부여, 접근 권한, 정보 공개 관리 같은 고전적 원칙이 그대로 적용됩니다. 수십 년, 어떤 기준으로는 수백 년에 걸쳐 쌓인 감사와 점검, 평가 개념을 AI를 위해 새로 발명할 필요는 없다는 지적입니다.

종말 시나리오에 대한 회의도 있습니다. 현재의 AI 능력과, 이번 10년이 끝나기 전에 인류가 멸종한다는 식의 대재앙 시나리오를 잇는 기술적 경로는 아직 제시되지 않았습니다. 탈주한 AI가 전 세계에 흩어진 시스템에서 통합된 지휘 통제를 확보한다는 전제는 실제 네트워크 구조와 거리가 있어 보입니다. 오히려 그런 시나리오는 잘못 설정되고 보안이 허술한 테스트 환경에서 나온 증상일 수 있다는 질문이 제기됩니다.

격리된 실험실에서 서버의 네트워크 카드와 무선 모듈을 분리하는 작업

▲ 무선 모듈의 물리적 분리

물리적 격리와 배포 전 점검

가드레일을 벗겨낸 최전선 모델을 다룰 때는 진짜 air gap(네트워크에서 물리적으로 분리된 환경)이 필요합니다. 무선 스위치를 소프트웨어에서 끄는 것으로는 부족합니다. 와이파이 카드, 블루투스 송신기, 네트워크 인터페이스를 물리적으로 분리해야 합니다.

서드파티 감사와 red team(공격자 관점의 모의 침투 팀) 훈련은 반가운 변화입니다. 다만 배포 후 감사만으로는 충분하지 않습니다. 보안 평가는 모델 훈련과 개발 전 과정에서 지속적으로 이뤄져야 합니다. 훈련 단계에서 기본적인 보안 위생이 지켜지지 않으면 모델이 통제를 벗어나거나 외부 환경과 의도치 않게 상호작용할 수 있는 취약점이 생깁니다.

기능을 먼저 붙이고 보안을 나중에 덧대는 흐름은 새로운 현상이 아닙니다.

단계 흔한 순서 결과
신기술 도입 기능과 성능 우선 보안은 반응적 수정으로 밀림
AI 적용 정렬과 편의 기능 우선 권한·감시 체계는 뒤늦게

오픈웨이트 모델과 취약점 발견의 역설

한 사이버보안 스타트업은 중국에서 공개된 오픈웨이트 모델(가중치가 공개된 모델)을 개조해 소셜 미디어 앱을 감사했고, 사용자 권한을 원격으로 장악해 스마트폰 카메라를 조작할 수 있는 치명적 zero-day(아직 패치가 없는 취약점)를 찾아냈습니다. 공개 모델이 실제 방어 연구에 쓰인 사례입니다.

반대편에서는 미국의 최전선 연구소들이 모델을 API 유료 장벽 뒤에 잠급니다. 반면 국제 사회에서는 제한 없는 오픈웨이트 모델이 계속 공개되며 능력 격차를 좁히고 있습니다. 이런 제한이 사용자를 실제로 보호하는지, 아니면 방어 연구자만 불리하게 만드는지에 대한 질문이 나옵니다.

경쟁사가 무검열 모델을 내놓자 독점 연구소들도 곧바로 유사한 모델을 공개한 흐름은 시사적입니다. 50개 조직이 공유하는 비밀을 지키려는 것과 비슷합니다. 고성능 모델을 방어 생태계에서 빼앗으면 방어팀이 가장 큰 타격을 입고, 공격자는 어차피 공격용 모델을 만들거나 구합니다. 무검열 악성코드 생성 모델이 월 $20 수준에 유통된 사례도 있습니다.

자동 분석의 규모도 눈여겨볼 지점입니다.

항목 수치
한 보안 기업의 threat intelligence 팀이 자동 분석으로 찾아낸 취약점 14,000건
그중 이전에 보고되지 않은 zero-day 비율 99퍼센트
악성코드 생성 모델 월 구독료 약 $20
익스플로잇 공개 후 48시간 내 공격받은 게이트웨이 장비 노출 대수 약 80,000대

여러 화면에 쏟아진 취약점 경보를 검토하는 지친 보안 분석가

▲ 취약점 목록 검토 업무

자동 취약점 탐지가 만드는 분석 피로

자동 취약점 탐지 도구는 양날의 칼입니다. 실제 악용 가능성이 없는 이론적 결함까지 대량으로 표시해 방어팀을 압도합니다. 분석 담당자는 AI가 쏟아낸 목록에서 진짜 위험을 가려내느라 인지적 피로와 업무 포화를 겪습니다.

그러나 모르는 것이 안전은 아닙니다. 취약점을 빠르게 발견하고 패치하는 편이 공격자가 먼저 찾아내도록 방치하는 것보다 낫습니다. 중요한 것은 목록의 양이 아니라 실제 익스플로잇 가능성입니다. 심각도를 올리기 전에 재현 가능한 공격 코드가 있는지, 실제로 악용 가능한지 확인하는 절차가 필요합니다.

사용자 개인정보 측면의 위험도 함께 봐야 합니다. 소셜 미디어 앱은 저장소와 사진, 카메라에 대한 광범위한 접근을 습관적으로 요구합니다. 이용자는 약관과 개인정보 처리방침을 확인하거나 AI 도구로 요약해 어떤 정보가 수집되는지 파악한 뒤 권한을 허용하는 편이 낫습니다. 주소록 접근을 요구하는 앱에는 실제 연락처 대신 가상의 연락처와 장식용 사진을 넣어 두는 방법도 개인정보 보호 수단으로 쓰입니다.

침해 공개는 누구를 위한 것인가

CISA와 FBI는 국제 파트너 기관과 함께 압박 상황에서의 사고 커뮤니케이션을 다룬 권고를 내놓았습니다. 요지는 최소한의 법적 공개에서 벗어나 이해관계자가 위험을 줄일 수 있도록 투명하고 실행 가능한 정보를 제공하라는 것입니다. 사고 커뮤니케이션의 초점을 브랜드 평판 관리에서 이해관계자 보호로 옮기자는 제안입니다.

현실의 벽도 분명합니다. 자발적 가이드라인은 위기 상황에서 힘이 약합니다. 법무팀과 홍보팀은 브랜드 가치와 주가를 우선하기 마련입니다. 책임 있는 공개가 필요하다는 데 동의하면서도, 공격 기법을 그대로 노출하면 모방 공격을 부를 수 있다는 우려가 함께 제기됩니다. 실제로 한 게이트웨이 제품의 취약점 정보가 공개된 뒤 약 80,000대로 추정되는 노출 장치가 48시간 만에 공격받은 사례가 있습니다. 그래서 공개는 실행 가능한 위험 정보를 담되 공격 벡터 자체를 알려주는 방식이 되어서는 안 됩니다.

규제로 해결하기도 쉽지 않습니다. 법은 관할권 단위로 집행되지만 기술과 사이버 범죄는 국경 없이 움직입니다. 국내법으로 침입을 금지한다고 전 세계의 도둑질이 멈추지 않는 것과 같습니다. AI는 몇 달 단위로 바뀌는데 입법은 수년이 걸려, 정적 규제가 시행되기도 전에 낡을 위험이 있습니다. 이를 보완할 국제 조정 기구가 필요하다는 제안도 나옵니다. 군사 동맹을 본뜬 국제 기구를 만들어 공통 기준과 집행 장치를 마련하자는 구상입니다. 국제적 집행 수단이 없다면 규제되지 않은 모델이 먼 미래가 아니라 그 이전에 시스템적 혼란을 일으킬 수 있다는 경고입니다.

지금 조직에서 확인해야 할 것

핵심은 분명합니다. AI 안전은 모델 정렬 선언만으로 완성되지 않습니다. AI 인프라에도 백신, 디도스 완화, 망 분리, 사고 대응, 지속적 모니터링 같은 기존 심층 방어 원칙을 그대로 적용해야 합니다.

  • 가드레일을 제거한 모델을 다루는 시스템은 무선 카드와 네트워크 인터페이스를 물리적으로 제거해 진짜 air gap을 만듭니다.
  • 보안 감사와 모의 침투 테스트를 배포 직전이 아니라 훈련과 개발 파이프라인 전 과정에 배치합니다.
  • AI가 표시한 취약점은 실제 익스플로잇 가능성과 재현 코드 유무를 확인한 뒤 대응 우선순위를 정합니다.
  • 모바일 앱 권한을 정기적으로 검토하고, 약관과 개인정보 처리방침은 AI 도구로 요약해 수집 항목을 확인합니다.
  • 주소록 접근을 요구하는 서비스에는 최소한의 가상 정보를 제공합니다.
  • 침해 발생 시 법적 최소 공개를 기다리지 말고 이해관계자가 위험을 줄일 수 있는 정보를 적시에 전달합니다.

안전을 말하는 속도와 방어를 준비하는 속도가 어긋나면 선언만 남고 시스템은 노출됩니다. 지금 필요한 것은 새로운 구호가 아니라 이미 검증된 통제를 AI 환경에 다시 적용하는 일입니다.