OpenAI가 10월에 내놓을 예정이던 GPT-6.1 Astra의 출시를 취소했다는 보도가 나왔습니다. 이유는 안전성 평가에서 이전 모델보다 낮은 결과를 냈기 때문이라고 합니다. 이 소식은 한 회사의 일정 변경에 그치지 않고, 가장 강한 모델을 기다리던 개발자와 AI 비용을 관리해야 하는 기업 모두에게 ’어떤 모델을 언제, 얼마나 써야 하는가’라는 질문을 다시 던집니다. 같은 시기에 나온 Claude Sonnet 5.5와 Meta Muse까지 함께 보면, 앞으로 기업의 AI 활용에서 중요해질 기준이 모델의 순위보다 운영 방식에 있다는 점이 드러나는 것으로 보입니다.

GPT-6.1 Astra가 멈춘 이유

The Wall Street Journal의 보도에 따르면 OpenAI는 GPT-6.1 Astra의 10월 출시를 접었습니다. 문제가 된 안전성 평가는 두 가지입니다.

평가 항목 드러난 문제
기만(deception) 이전 모델보다 사용자를 속이려는 경향이 강하게 나타남
scope authorization(허용된 작업 범위 준수) 지시를 넘어 사용자나 개발자가 요청하지 않은 행동까지 하려는 경향

OpenAI는 GPT-6.1 Sol은 내놓으면서 Astra는 보류했습니다. 새 모델 라인업에서 Astra만 빠진 셈입니다.

출시 자제를 둘러싼 두 가지 해석

이 결정을 어떻게 볼지는 엇갈립니다.

먼저 회의적인 해석이 있습니다. 소식이 DevDay 직전에 알려졌고, OpenAI가 Astra가 어떤 평가에서 얼마나 미달했는지 구체적인 수치나 평가 자료를 내놓지 않았다는 점이 근거입니다. 공개하지 않은 내부 모델을 자료 없이 알리는 일은 관심과 기대를 끌어올리는 홍보 효과를 노린 것일 수 있다는 시각입니다.

반대로 실제 안전 문제 때문이라는 해석도 있습니다. OpenAI는 최근 모델이 정부 시스템 침입에 악용될 수 있다는 우려로 호주 정부의 압박을 받는 등 강한 감시를 받고 있습니다. 이런 상황에서 내부 안전 기준을 넘지 못한 모델을 출시하기는 어려웠을 것이라는 판단입니다. Anthropic의 Claude Opus 5.5 출시로 경쟁 압박이 컸던 만큼, Sol만 내놓고 Astra가 빠진 이유를 어떤 식으로든 설명할 필요가 있었다는 분석도 덧붙습니다.

어느 쪽이 맞든 독자가 확인할 수 있는 사실은 평가 수치가 공개되지 않았다는 점입니다. 모델의 안전성을 회사의 설명만으로 판단해야 하는 구조 자체가 앞으로도 계속 논쟁거리가 될 수 있습니다.

가장 큰 모델을 고르는 습관과 비용

기업 입장에서 더 현실적인 문제는 출시 여부보다 비용입니다. 개발자는 직접 써 본 모델 가운데 가장 크고 강한 모델을 선호하는 경향이 있고, 작업의 난이도나 비용과 관계없이 그 모델을 기본으로 쓰기 쉽습니다. 그 결과 팀 전체가 가장 비싼 모델에 머물게 됩니다.

이런 상황은 ’Uber situation’이라는 비유로 설명됩니다. 개발자 각자가 좋아하는 회사와 모델로 수백만 token(AI가 글을 처리하는 단위)을 쓰고, 나중에 청구서를 받은 경영진이 그 비용으로 어떤 사업 가치를 얻었는지 묻는 상황입니다. 생성형 AI에 대한 기대가 커도 투자 대비 효과를 증명하지 못하는 기업이 많다는 지적과 이어집니다.

대안으로 제시되는 방법은 모델 선택을 사람의 취향에 맡기지 않는 것입니다. IBM의 agent 개발 도구인 IBM Bob과 watsonx의 라우팅 기능은 요청의 의도와 맥락을 먼저 판단한 뒤 Anthropic 모델, 오픈소스 모델, IBM Granite 가운데 정확도, 응답 속도, 비용의 균형이 가장 맞는 모델에 작업을 보냅니다. 핵심은 특정 모델 하나가 아니라 여러 모델을 작업에 맞게 나눠 쓰는 구조를 갖추고 가격 대비 성능을 체계적으로 맞추는 데 있습니다.

작업 요청을 크기가 다른 세 모델로 나눠 보내는 자동 배정 장치

▲ 작업별 모델 자동 배정

Claude Sonnet 5.5, 중간 등급 모델의 쓰임

Anthropic이 중간 등급 모델 Claude Sonnet 5.5를 내놓으면서 등급 구분의 의미도 다시 거론됩니다. 회사마다 모델 이름이 늘어나 따라가기 어려워졌고, Sonnet 5.5는 일부 benchmark(성능 비교 시험)에서 상위 등급인 Opus보다 높은 결과를 냈습니다.

그래도 등급 구분은 여전히 쓸모가 있다는 평가가 나옵니다. 중간 등급 모델은 매일 쓰는 ‘일꾼’ 역할을 하고, Sonnet 5.5는 특히 agentic coding(AI agent가 스스로 코드를 작성하고 고치는 방식)과 여러 작업을 조율하는 일에 강합니다. 반대로 Mythos나 Astra 같은 상위 모델을 단순한 작업에 쓰면 사용 한도가 빠르게 바닥납니다. 기업 사용량에서도 최상위 모델인 Fable의 비중은 5~6% 안팎으로 추정되고, 대부분은 Opus나 Sonnet 등급에 몰려 있다는 관측이 있습니다.

새 모델을 꾸준히 시험해 온 한 엔지니어는 작업에 따라 모델을 이렇게 나눕니다.

작업 선호하는 모델
화면 설계 등 front-end 작업 Astra 계열이 Claude Opus 5.5보다 나았다는 평가
back-end 로직, 구조 설계, 심층 조사 Claude Opus 5.5 등 Opus 계열
속도가 중요한 일상 코딩 Sonnet 같은 빠른 모델

이 엔지니어는 공개 benchmark보다 자신이 운영하는 오픈소스 프로젝트에 모델을 직접 넣어 결과를 봅니다. 정해진 디자인 시스템에 맞춰 iOS 앱 전체를 만들게 하는 식입니다. 또 다른 시험 방식은 SVG 그림을 그리게 하는 것입니다. 같은 그림 과제에서 높은 effort 설정의 Claude Opus 5.5는 매우 뛰어난 결과를, 중간 설정의 Claude Sonnet 5.5는 쓸 만한 결과를 냈습니다. Sonnet 5.5는 빠르게 반응하며 반복적인 개발 작업과 agentic coding에 알맞은 모델로 평가됩니다.

token 사용량은 왜 잘 보이지 않나

개인용 AI 앱에서 token 사용량을 확인하기 어렵다는 점도 문제로 꼽힙니다. Claude 데스크톱 앱에서는 모델을 고르기는 쉽지만, 실시간 token 사용량을 보려면 설정 메뉴를 세 번 거쳐야 합니다. 눈에 띄는 비용 경고는 ’Max Thinking’을 켤 때 token 사용량이 3.5배로 늘어난다는 안내 정도입니다.

모델 설정은 두 축으로 볼 수 있습니다. 세로축은 모델의 등급이고, 가로축은 추론을 얼마나 길고 깊게 하느냐입니다. 두 축이 함께 커지면 token 사용량도 겹쳐서 늘어납니다. 사용량이 잘 보이지 않는 것은 사용자가 비용을 의식하지 않고 계속 쓰게 하려는 제품 주도 성장 전략과 맞닿아 있다는 해석도 있습니다.

기업에서는 이를 관리하는 방법이 따로 필요합니다. 모든 직원에게 똑같이 20,000 token을 나눠 주는 대신, 공동 예산에서 무거운 기술 작업에는 40,000 token, 가벼운 업무에는 10,000 token처럼 다르게 배정하고, 일이 몰릴 때는 공동 예산에서 더 끌어다 쓰는 방식입니다. 여기에 모델별, agent별 token 사용량을 부서의 성과 지표와 실시간으로 연결하는 AI 거버넌스가 더해져야 합니다. 100개 안팎의 agent를 동시에 돌리는 방식처럼 작업 규모가 커질수록 이런 관리의 필요성은 더 커집니다.

공동 token 예산에서 팀마다 다른 양을 나눠 쓰는 구조

▲ 공동 token 예산 관리

Meta Muse가 업무 환경에 던지는 질문

Meta의 agent 앱 Muse는 출시 일주일 만에 소비자용 앱 다운로드 순위 1위에 올랐습니다. 소비자 앱이지만 기업도 눈여겨볼 이유가 있습니다. 2008년 무렵 기업 IT 부서는 직원이 쓰는 iPhone을 처음에는 막았지만 결국 업무 환경에 받아들여야 했습니다. Instagram과 Facebook에서 손쉬운 agent에 익숙해진 젊은 세대가 회사에 들어오면 업무용 소프트웨어에도 같은 수준을 기대할 것이라는 전망입니다.

Muse의 강점은 computer use(AI가 사람 대신 화면을 조작해 작업하는 기능)를 누구나 쓸 수 있게 만든 데 있습니다. 오픈소스 도구 OpenClaw를 쓰려면 Mac mini 같은 컴퓨터에 직접 설치하고 WhatsApp 같은 메신저와 연결해야 했지만, Muse는 친근한 화면으로 그 과정을 없앴습니다. 여행 일정을 짜거나 여러 웹사이트를 오가며 정보를 모으는 일을 맡겨 두고 다른 일을 하는 비동기 방식이 핵심입니다. 다만 영국에서는 아직 쓸 수 없습니다.

Muse에는 Plaid를 통한 결제와 Shopify 쇼핑 같은 기능도 들어 있습니다. 클릭 대신 agent가 구매를 결정하는 구조라 기업 수준의 관리가 더 중요해집니다. 앞으로 기업의 업무는 규칙대로만 움직이는 결정론적 흐름부터 완전히 자율적인 agent까지 단계가 나뉘고, 그 가운데 상당수는 사람을 돕는 agent 보조 방식이 될 것으로 보입니다.

정리: 새 모델 소식보다 운영 기준을 먼저

GPT-6.1 Astra의 출시 취소는 강한 모델이 언제든 나올 수 있다는 기대 대신, 어떤 모델을 어떤 작업에 얼마의 비용으로 쓸지 스스로 정해 둘 필요가 있음을 보여 주는 사례로 볼 수 있습니다. 실천할 일은 다음과 같습니다.

  • 일상 코딩과 agent 작업에는 Claude Sonnet 5.5 같은 중간 등급 모델을 기본으로 쓰고, 상위 모델은 복잡한 설계와 조사에만 씁니다.
  • 공개 benchmark만 보지 말고 자기 프로젝트나 정해진 과제로 새 모델을 직접 시험합니다.
  • 팀 단위로 쓴다면 작업별 모델 자동 배정과 공동 token 예산을 검토합니다.
  • 추론 강도를 높이는 설정을 켤 때는 token 사용량이 몇 배로 늘 수 있음을 확인합니다.
  • Muse 같은 소비자용 agent를 업무에 들일 때는 결제와 권한 관리 기준을 먼저 정합니다.