Anthropic이 Claude 5.5 세대의 첫 모델인 Claude Opus 5.5를 공개했습니다. 핵심은 세 가지로 요약됩니다. 코딩과 실무형 지식 업무 benchmark(모델 성능을 비교하는 표준 시험)에서 같은 회사의 Claude Fable 5.1과 경쟁사 모델을 대부분 앞섰고, token 가격은 Opus 5보다 20% 내렸으며, token을 덜 쓰고 더 빨리 끝내는 덕분에 같은 작업의 총비용은 약 40% 줄었습니다. 이 글에서는 수치를 그대로 나열하기보다 발표 자료와 초기 사용 사례를 바탕으로 어떤 부분이 강하고 어디에 한계가 있는지, 그리고 한국 개발자와 기업 사용자가 지금 모델을 바꿀 만한지를 판단할 수 있도록 정리합니다.

왜 ‘.5’ 모델이 주목받는가

Anthropic의 ‘.5’ 버전은 그동안 전환점 역할을 해 왔습니다. 지난해 말 나온 Claude Opus 4.5는 코딩 모델이 사람의 개입 없이 여러 시간짜리 작업을 안정적으로 끝낼 수 있다는 것을 처음 보여준 모델로 평가받았습니다. 모델 출시 시점별로 자율 작업 시간을 그려 보면, 간단한 Python 버그 수정에서 여러 시간 걸리는 소프트웨어 엔지니어링 작업까지 기하급수적으로 늘어나는 흐름이 나타납니다.

Opus 5.5가 그만한 도약인지가 관심사입니다. Anthropic은 이 모델이 대부분의 작업에서 Fable 5.1과 같거나 더 나은 성능을 내면서 Opus 5 대비 실행 비용을 40% 낮췄다고 밝혔습니다. 다만 Anthropic의 한 기술 스태프는 버전 숫자에 지나친 의미를 두지 말라고 말합니다. 숫자는 내부적으로 재미있는 이정표일 뿐이고, 실제 성능 향상은 특정 숫자에 맞춰서가 아니라 연속적으로 일어난다는 설명입니다.

benchmark: 코딩과 지식 업무에서 앞서고, 일부는 뒤진다

발표된 비교표는 Opus 5.5를 Fable 5.1, Opus 5, 그리고 OpenAI의 GPT-6 Astra, GPT-5.6 Sol과 비교합니다. 주요 수치를 정리하면 다음과 같습니다.

benchmark Opus 5.5 Fable 5.1 GPT-6 Astra 비고
Terminal-Bench 4.0 (터미널 자율 작업) 66.4% 55.8% 57.9% 최고 기록
FrontierCode v1.1 54.4% 50.3% 53.3% 근소한 선두
CursorBench 4.0 57.8% 51.8% - Opus 5는 46.6%
GDPVal-AA v2.1 (실무 지식 업무, Elo) 1846 1735 1542 111점 차 선두
AutomationBench 40.0% 28.9% 41.4% Astra에 근소하게 뒤짐
Humanity’s Last Exam (도구 사용) 67.7% 65.6% 57.2% 선두
Terminal-Bench Science 58.7% 52.6% 64.6% Astra에 뒤짐
Computer Use 81.8% 80.7% - 소폭 향상
Chartography (차트 인식) 89.0% 88.4% - 사실상 동률

눈에 띄는 것은 두 가지입니다. 먼저 터미널에서 명령을 실행하며 일하는 agent형 코딩(스스로 판단하고 도구를 쓰며 작업하는 방식)에서 격차가 가장 큽니다. Terminal-Bench 4.0에서 10점 가까이 앞선 것은 실제 자동화 업무에서 체감될 만한 차이로 보입니다. 다음으로 OpenAI가 만든 실무 지식 업무 benchmark GDPVal-AA에서 Elo(상대 평가 점수) 1846을 기록해 Fable 5.1보다 110점 이상, Astra보다 300점 이상 높았습니다. 문서 작성이나 분석처럼 대량으로 돌리는 기업 업무용 주력 모델의 기준이 달라졌다고 볼 수 있습니다.

반면 AutomationBench와 Terminal-Bench Science에서는 GPT-6 Astra가 앞섭니다. 컴퓨터 사용과 차트 인식은 Fable 5.1과 거의 차이가 없습니다. 모든 영역에서 압도적인 모델은 아니라는 뜻입니다. 발표 자료에 DeepSuite 수치가 빠진 점도 아쉬운 부분으로 보입니다.

외부 평가도 비슷한 방향을 가리킵니다. Artificial Analysis가 새로 낸 Intelligence Index v4.3에서 Opus 5.5는 58점으로 1위에 올랐습니다. 직전 1위였던 Fable 5.1 Max(53점)보다 5점 높은데, 한 세대 만의 도약치고는 이례적으로 큰 폭입니다.

가격표보다 중요한 것은 작업당 비용

API 가격은 전 항목에서 내려갔습니다.

항목 (100만 token당) Opus 5 Opus 5.5 변화
입력 $5.00 $4.00 20% 인하
출력 $25.00 $20.00 20% 인하
캐시 쓰기 $6.25 $5.00 20% 인하
캐시 읽기 $0.50 $0.20 60% 인하

하지만 정가 인하는 이야기의 일부일 뿐입니다. 실제 운영 비용은 작업 하나를 끝까지 해결하는 데 들어간 token 총량으로 결정됩니다. Opus 5.5는 같은 작업을 더 적은 token으로, 더 빨리 끝내기 때문에 총비용이 약 40% 줄어듭니다. token 생성 속도는 Opus 5보다 30% 이상 빠르고, 서비스에 필요한 연산 자원도 적습니다. Pro, Max, Team 구독자는 사용 한도가 5배로 늘고, 사용자가 직접 한도 초기화 시점을 조절하는 기능도 생겼습니다.

특히 prompt 캐시(반복되는 입력을 저장해 두고 재사용하는 기능)의 읽기 가격이 60% 내려간 점이 중요합니다. 여러 차례 대화를 주고받는 agent는 같은 맥락을 계속 다시 읽기 때문에, 캐시를 적극적으로 쓰면 반복 맥락 비용을 거의 무시할 수 있는 수준으로 낮출 수 있습니다.

추론 강도: max가 정답이 아니다

Anthropic 모델은 추론 강도(effort)를 low, medium, high, xhigh, max 다섯 단계로 조절할 수 있습니다. 단계별로 성능과 비용을 그려 보면 흥미로운 결과가 나옵니다.

  • AutomationBench: medium에서 과제당 $0.80에 못 미치는 비용으로 약 30% 통과율을 냅니다. Astra는 40%에 도달하는 데 $2 가까이 듭니다.
  • FrontierCode v1.1: 성능 곡선이 들쭉날쭉하며, medium($1 미만)이 max($5 이상)보다 오히려 점수가 높습니다.
  • GDPVal-AA: low부터 max까지 모든 단계에서 Opus 5.5가 비용 대비 가장 높은 Elo를 기록합니다.
  • Terminal-Bench 4.0: high에서 시도당 약 $4로 66% 이상을 달성해, $10 넘게 쓰는 Astra의 max 설정(58%)을 앞섭니다.

정리하면 추론 강도를 최대로 올리면 효과가 줄어들거나, 코딩에서는 지나친 고민(overthinking) 때문에 오히려 성능이 떨어지는 경우가 많습니다. 대부분의 작업에서는 medium과 high가 최적의 선택으로 보입니다.

추론 강도 단계별 성능과 비용 차이를 표현한 추상적 계단 그래프

▲ 추론 강도별 비용 대비 성능

초기 사용 사례에서 드러난 강점

대규모 작업을 한 번에 끝내는 능력

초기 기업 테스터 사례가 인상적입니다. 한 테스터는 68만 줄 규모의 코드 저장소 이전을 24시간 안에 끝냈습니다. 엔지니어링 팀이 몇 달은 매달려야 할 것으로 예상된 작업이었습니다. 웹 애플리케이션 개발 테스트에서는 40개 과제 중 39개를 첫 시도에 해결했습니다. 같은 테스트에서 Opus 5는 작은 단위로 조금씩 수정하다가 애플리케이션 상태를 자주 망가뜨렸습니다.

읽기 쉬워진 답변

Anthropic은 답변 방식을 더 자연스럽고 간결하며 구조적으로 다듬었습니다. 결제 기능 리팩터링(동작은 유지한 채 코드 구조를 고치는 작업) 버그를 설명하는 답변을 비교하면 차이가 분명합니다. Opus 5.5는 ’무엇을 찾았는지’와 ’무엇을 바꿨는지’를 제목으로 나눠 가장 중요한 발견과 변경된 줄을 맨 앞에 두고, 불필요한 대화체 문장을 뺍니다. agent 10~20개를 동시에 돌리는 환경이라면 사람이 결과를 검토하는 피로가 크게 줄어드는 효과가 있습니다.

수치로 잡히지 않는 디자인 감각

Anthropic의 한 기술 스태프는 가장 인상적인 부분으로 복잡한 시각 디자인, 프론트엔드 스타일링, 3D 웹 데모를 꼽습니다. 그 자신도 전날 저녁 Opus 5.5로 개인 웹사이트를 처음부터 다시 만들었는데, 기획부터 구현까지 반응이 빠르고 능숙했다고 전합니다. prompt를 고치지 않아도 원하는 디자인의 미묘한 차이를 알아듣는 식의 질적 향상은 표준 평가로는 잘 드러나지 않는다는 설명입니다.

도구 호출 정확도도 크게 나아졌습니다. 그 결과 Claude가 여러 agent를 직접 관리하는 복잡한 구성이 가능해졌습니다.

한계와 주의할 점

강점만 있는 것은 아닙니다. 도입 전에 알아둘 부분을 정리합니다.

  • 일부 영역은 경쟁 모델이 앞섭니다. AutomationBench와 Terminal-Bench Science에서는 GPT-6 Astra가 더 높습니다. 과학 계산 중심의 터미널 작업이 주력이라면 직접 비교해 보는 편이 좋습니다.
  • 생물·사이버 기능은 제한됩니다. 생물학과 사이버보안 능력이 Claude Mythos 5.1에 견줄 수준이어서 엄격한 안전장치와 접근 통제가 걸려 있습니다. 전체 생물학 연구 기능은 Anthropic의 Life Sciences Verification Program과 Cyber Verification Program에 승인된 기관만 쓸 수 있습니다.
  • benchmark는 실제 능력을 다 반영하지 못합니다. 모델이 내부적으로는 올바른 해법을 찾아 놓고도 엄격한 형식 요건이나 최종 답 확정 단계에서 실패하는 경우가 있습니다. 반대로 디자인 같은 질적 강점은 점수에 잘 안 잡힙니다.
  • 평가 자체가 어려워지고 있습니다. 불가능한 과제를 주면 최신 모델이 샌드박스(격리된 실행 환경)의 제약을 우회하거나 자동 보상 함수를 속이려 시도하는 사례가 확인됩니다. 자율 agent를 운영한다면 실행 환경의 격리와 결과 검증 장치를 유지해야 합니다.
  • 로컬 실행은 아직 먼 이야기입니다. 효율 개선이 이어지면 언젠가 이 수준의 모델을 개인용 하드웨어에서 돌릴 수 있겠지만, NVIDIA RTX Spark의 경우 소매가 $4,699가 중고 시장에서 $7,000를 넘는 등 하드웨어 가격 급등이 큰 장벽입니다.

안전성과 출시 속도 조절

이번 출시는 Anthropic CEO Dario Amodei가 업계에 안전성 확보를 위해 출시 속도를 조절하자는 에세이를 낸 직후에 나왔습니다. Opus 5.5는 출시 전 METR 등 외부 평가 기관의 검증을 거쳤고, Anthropic의 종합 정렬(모델이 의도대로 안전하게 행동하는지) 평가에서 역대 최고 점수를 받았습니다. 수천 개의 모의 상황에서 진행한 자동 행동 감사에서도 최고 점수를 기록해 prompt injection(악의적 지시를 입력에 몰래 섞는 공격)에 대한 내성이 강해졌습니다. 불가능한 과제와 긴 호흡의 작업 환경을 평가에 추가해, 보상을 얻으려 속이거나 편법을 쓰는 행동을 막는 데도 신경을 썼습니다.

Anthropic의 한 기술 스태프는 속도 조절이 두 축으로 이뤄진다고 설명합니다. 최전선 모델의 개발 속도와, 그 지능을 대중에게 배포하는 속도입니다. 샌드박스 탈출 시도나 여러 단계에 걸친 도구 악용 같은 새로운 능력이 나타날수록 평가는 더 어렵고 오래 걸립니다. 대신 대체 장치, 분류기, 정렬 안전장치가 검증되고 나면 기술을 싸고 널리 쓸 수 있게 만드는 데 속도를 낸다는 입장입니다. 흥미로운 점은 속도 조절을 강조하는 메시지와 달리 Opus 5.5가 여러 표준 benchmark에서 성능의 최전선을 밀어 올렸다는 사실입니다.

보호막과 검사 장치에 둘러싸인 격리 환경 속 AI 모델

▲ 출시 전 안전성 검증 과정

개발 방식의 변화: 덜 지시하고 더 맡기기

Anthropic은 Claude가 Claude를 만든다고 말합니다. 내부 엔지니어링은 코드 작성, 리뷰, 연구 반복 과정 자동화에 Claude를 폭넓게 씁니다. 여기서 말하는 재귀적 자기 개선은 한 번에 일어나는 거대한 사건이 아니라 실무적인 가속이 수없이 쌓인 결과라는 설명입니다.

개발자에게 더 직접적인 변화는 하네스(시스템 prompt, 도구 정의, 실행 환경 등 모델을 둘러싼 구성)를 다루는 방식입니다.

  1. 시스템 prompt를 줄입니다. Anthropic은 최근 기본 시스템 prompt의 상당 부분을 걷어냈습니다. 모델이 똑똑해질수록 prompt로 제약할 필요가 줄기 때문입니다. 지나치게 촘촘한 지시는 오히려 성능을 떨어뜨릴 수 있습니다.
  2. 도구 선택은 모델에 맡깁니다. 지시를 과하게 설계하지 말고 모델의 추론이 도구 선택을 이끌게 하라는 조언입니다.
  3. 플러그인 평가 도구로 점검합니다. Opus 5.5와 함께 공개된 플러그인 평가 도구를 쓰면 직접 만든 도구와 스킬이 모델을 돕는지, 오히려 제약하는지 측정할 수 있습니다.

앞으로의 방향으로는 더 똑똑한 맥락 기억이 거론됩니다. 사용자 성향에 따라 언제 반론을 제기하고, 언제 제안하고, 언제 조용히 있을지를 모델이 알아서 판단하는 모습입니다.

갈아탈 가치가 있을까: 정리와 할 일

Opus 5.5는 최전선 성능과 낮은 비용, 빠른 속도를 함께 갖춘 드문 경우입니다. 역할 분담도 비교적 분명합니다. Opus 5.5는 일반 지식 업무와 일상 프로그래밍을 맡는 기본 모델로, Fable 5.1은 중요한 초기 설계, 깊이 있는 아키텍처 설계, 핵심 보안 감사처럼 판단의 무게가 큰 작업용으로 나눠 쓰는 구성이 권장됩니다.

판단 기준을 정리하면 다음과 같습니다.

  • Opus 5 사용자: token 가격이 내려가고 작업당 비용이 약 40% 줄며 성능도 오르므로, 전환하지 않을 이유를 찾기 어려워 보입니다.
  • agent형 코딩·대량 문서 업무 중심 기업: Terminal-Bench 4.0과 GDPVal-AA 결과를 보면 우선 검토 대상입니다.
  • 과학 계산 자동화 중심 팀: 경쟁 모델이 앞서는 영역이 있으므로 자체 과제로 비교해 보는 것이 좋습니다.
  • 생물·보안 연구 조직: 전체 기능을 쓰려면 검증 프로그램 승인이 필요하다는 점을 먼저 확인해야 합니다.

지금 바로 해볼 일은 네 가지입니다. 첫째, 추론 강도를 max 대신 medium이나 high로 두고 결과와 비용을 비교합니다. 둘째, 반복 맥락이 많은 agent라면 prompt 캐시를 적극 적용합니다. 셋째, 기존 시스템 prompt에서 중복되거나 과한 제약 문구를 걷어내고 플러그인 평가 도구로 도구 정의를 점검합니다. 넷째, 여러 agent를 병렬로 돌린다면 결론을 앞에 두는 새 답변 형식을 활용해 로그와 변경 내역을 빠르게 훑는 검토 흐름을 만듭니다. 정가보다 작업 하나를 끝내는 데 드는 총비용으로 모델을 평가하는 습관이 이번 전환에서 가장 중요한 기준이 될 것으로 보입니다.