Anthropic이 2026년 9월 28일 출시한 Claude Sonnet 5.5는 코딩 평가인 Terminal-Bench 4.0에서 Claude Opus 5.5보다 높은 점수를 기록했습니다. API 가격도 입력과 출력 등 주요 항목에서 절반입니다. 다만 이를 ‘코딩 작업을 언제나 절반의 비용으로 더 잘 처리한다’는 뜻으로 받아들이면 안 됩니다. 다른 코딩 평가에서는 Claude Opus 5.5의 점수가 더 높고, 작업에 투입하는 추론량을 높이면 Claude Sonnet 5.5의 작업비가 크게 늘어나는 경우도 있습니다.

코딩 평가는 한 종목에서 앞서고, 다른 종목에서는 뒤집힙니다

Terminal-Bench 4.0에서 Claude Sonnet 5.5는 최대 effort(작업에 투입하는 추론량을 조절하는 설정)로 70.6%를 기록했습니다. 같은 평가에서 Claude Opus 5.5의 점수는 54.4%입니다. 이전 모델인 Claude Sonnet 5의 점수는 10.2%여서, 새 모델의 개선 폭도 두드러집니다.

코딩 평가 Claude Sonnet 5.5 Claude Opus 5.5
Terminal-Bench 4.0 70.6%·최대 설정 54.4%·설정 미기재
FrontierCode v1.1 49.4%·High 설정 54.4%·설정 미기재
CursorBench 4.0 52.9%·High 설정 57.8%·설정 미기재

FrontierCode v1.1과 CursorBench 4.0에서는 반대로 Claude Opus 5.5의 점수가 높습니다. 세 평가 모두 Claude Opus 5.5의 effort 설정은 밝혀져 있지 않으므로, 설정까지 같은 조건의 비교로 읽어서는 안 됩니다. 이런 한계를 감안하면 Terminal-Bench 4.0 한 종목의 결과만으로 코딩 전반의 우위를 단정하기는 어렵습니다. 어떤 유형의 코딩 작업을 평가하느냐에 따라 선택 근거가 달라집니다.

세 가지 코딩 평가에서 두 모델의 순위가 달라지는 모습

▲ 평가별 코딩 성능 차이

절반인 것은 주요 API 단가이지 모든 작업비가 아닙니다

API 요금은 100만 token(모델이 처리하는 텍스트 단위)당 다음과 같습니다. 여기서 캐시 쓰기는 재사용할 내용을 저장하는 작업이고, 캐시 읽기는 저장된 내용을 다시 사용하는 작업입니다.

요금 항목·100만 token당 Claude Sonnet 5.5 Claude Opus 5.5
캐시 읽기 $0.20 $0.20
캐시 쓰기 $2.50 $5.00
입력 $2.00 $4.00
출력 $10.00 $20.00

캐시 쓰기·입력·출력 단가는 Claude Sonnet 5.5가 정확히 절반이지만, 캐시 읽기 단가는 같습니다. 따라서 ‘절반의 비용’은 모든 요금 항목에 적용되는 말이 아닙니다. 실제 청구액도 각 항목을 얼마나 쓰는지에 따라 달라질 수 있습니다. 특히 모델이 한 번의 작업에서 쓰는 token이 많아지면, token당 가격이 낮다는 사실만으로 작업비까지 낮다고 판단할 수 없습니다.

Claude Sonnet 5.5가 Claude Sonnet 5보다 일반적인 작업에서 약 30% 빠르고 비용은 약 30% 낮다는 수치는 또 다른 비교입니다. 이는 Claude Opus 5.5 대비 주요 API 단가가 절반이라는 가격표와 구분해서 읽어야 합니다.

최대 effort는 평가에 따라 득실이 갈립니다

Terminal-Bench 4.0에서는 Claude Sonnet 5.5의 effort를 높일수록 점수가 거의 직선적으로 상승해 최대 설정에서 최고점에 도달합니다. 그러나 그때의 평균 시도 비용은 $12.54로, Claude Opus 5.5의 최대 설정 평균 시도 비용 $11.24보다 높습니다. API 단가는 낮아도 이 평가의 최대 설정에서는 시도당 비용이 더 든 셈입니다.

FrontierCode v1.1의 결과는 최대 설정을 더 신중하게 봐야 하는 이유를 보여 줍니다.

  • High 설정: 점수 49.4%, 작업당 비용 $0.42
  • 최대 설정: 점수 46.2%, 작업당 비용 $21

이 평가에서는 최대 설정으로 올리자 비용이 50배가 됐지만 점수는 3.2%포인트 낮아졌습니다. CursorBench 4.0에서도 Claude Sonnet 5.5의 점수는 High 설정 52.9%, 최대 설정 51.5%로 내려갔습니다. 다만 Terminal-Bench 4.0에서는 최대 설정이 최고점이므로, 최대 설정이 언제나 불리하다고 일반화할 수도 없습니다. 평가 과제별로 성능과 사용량을 함께 확인해야 합니다.

추론량을 높였을 때 비용은 늘고 성과는 낮아지는 상황

▲ 설정에 따른 작업비 변화

먼저 High로 시험하고 작업당 비용을 확인합니다

Claude Sonnet 5.5는 Terminal-Bench 4.0 같은 과제에서 높은 점수를 내면서 입력·출력 API 단가는 Claude Opus 5.5의 절반입니다. 일상적인 코딩 작업에서 유력한 선택지로 보이지만, FrontierCode v1.1과 CursorBench 4.0의 결과까지 감안하면 모든 코딩 작업에서 더 정확하거나 저렴하다고 말할 수는 없습니다.

모델을 고를 때는 자신의 코딩 과제를 High 설정으로 먼저 시험하고 점수나 결과물뿐 아니라 작업당 비용도 기록하는 편이 좋습니다. 더 높은 effort가 필요하다면 Extra High와 최대 설정을 각각 비교한 뒤 선택할 수 있습니다. 특히 최대 설정은 token 사용량이 크게 늘어날 수 있으므로 가격표보다 실제 작업비를 기준으로 판단해야 합니다. 고위험 보안·생물학 관련 요청은 Claude Sonnet 5로 자동 전환될 수 있어, 해당 분야의 결과를 확인할 때는 사용된 모델이 달라질 수 있다는 조건도 염두에 둬야 합니다.