Claude Sonnet 5.5は、あるコーディングベンチマークでClaude Opus 5.5を上回り、入力トークンと出力トークンの料金も半分です。ただし、この2つの事実は、あらゆるコーディング作業のコストが半分になることを意味しません。キャッシュ読み取りの料金は両モデルで同じであり、作業に使う計算量によって総コストは大きく変わり得ます。したがって実務上の比較では、チームが実際に使うeffort設定での精度と支出の両方を見る必要があります。

AnthropicはClaude Opus 5.5の1週間後、2026年9月28日にClaude Sonnet 5.5をリリースしました。新モデルは、一般的なワークロードでClaude Sonnet 5より約30%高速で、コストは約30%低いとされています。これは前世代のSonnetとの比較であり、Claude Opus 5.5とのトークン単価の比較とは別の話です。

コーディングの結果はテストによって異なる

エージェント型コーディングのベンチマークは、複数のステップを要するソフトウェア作業をAIシステムがどう処理するかを測るものです。Terminal-Bench 4.0では、Claude Sonnet 5.5が最大effortで70.6%に達し、Claude Opus 5.5の54.4%を上回りました。同じテストでClaude Sonnet 5は10.2%にとどまっており、前世代からの改善も大きいといえます。しかし、比較に含まれるほかの2つのコーディングベンチマークでは、Claude Opus 5.5が上回っています。

3本のソフトウェアテストのレーンで、色の異なる2つの経路の順位がテストごとに入れ替わる様子

▲ コーディングテストごとに異なる結果

この結果は、どちらかのモデルがコーディング全般で優れているという主張を裏づけるものではありません。テストごとに結果が異なり、Claude Sonnet 5.5自体のスコアもeffort設定、つまり1回のリクエストに使う計算量によって変わります。

コーディングベンチマーク Claude Sonnet 5.5 Claude Opus 5.5
Terminal-Bench 4.0 最大effortで70.6% 54.4%
CursorBench 4.0 High effortで52.9%、最大で51.5% 57.8%
FrontierCode v1.1 High effortで49.4%、最大で46.2% 54.4%

Terminal-Bench 4.0では、effortを中程度から最大へ上げるにつれてClaude Sonnet 5.5のスコアが伸びています。一方でCursorBench 4.0とFrontierCode v1.1は、この傾向をあらゆるコーディング作業に当てはめるべきではない理由を示しています。どちらも最大effortのSonnetのスコアがHigh effortより低いためです。Terminal-Benchでのリードは注目に値しますが、1つのベンチマークだけでは、チーム自身のソフトウェア作業で両モデルがどう順位づけられるかは判断できません。

トークン単価が半分でも作業コストは半分にならない

APIはトークン、つまりモデルが処理・生成するテキストの単位ごとに課金します。Claude Sonnet 5.5の公表料金は、キャッシュ書き込み、入力トークン、出力トークンでClaude Opus 5.5のちょうど半分です。キャッシュ読み取り、つまり保存済みの入力の再利用は、両モデルで同じ料金です。

API料金区分 Claude Sonnet 5.5(100万トークンあたり) Claude Opus 5.5(100万トークンあたり)
キャッシュ読み取り $0.20 $0.20
キャッシュ書き込み $2.50 $5.00
入力 $2.00 $4.00
出力 $10.00 $20.00

この料金表から「コストは半分」という説明が当てはまるのは3つのトークン区分であり、あらゆるワークロードの請求総額ではありません。作業の使用量にキャッシュ読み取りが含まれていれば、その部分は安くなりません。また、ある設定でモデルが消費するトークンが大幅に増えれば、単価が低くても、完了した試行1回あたりのコストが下がるとは限りません。

中程度の計算の流れが高い目標に届き、より大きな流れがコスト容器を満たしながら低い目標にとどまる様子

▲ effort、精度、作業コスト

ベンチマークのコストを見ると、この違いがはっきりします。Terminal-Bench 4.0の最大effortでは、Claude Sonnet 5.5の平均コストは試行1回あたり$12.54で、トークン単価が低いにもかかわらず、最大設定のClaude Opus 5.5の$11.24をやや上回ります。FrontierCode v1.1では、Claude Sonnet 5.5はHigh effortで作業1件あたり$0.42、スコアは49.4%です。最大effortにするとコストは作業1件あたり$21に上がり、スコアは46.2%に下がります。このテストではコストが50倍になって結果は悪化したことになりますが、コーディング作業全般の価格予測ではありません。

そのため、Claude Sonnet 5.5をコーディング作業で評価する際は、最大よりHigh effortから始めるほうが有用です。Extra High effortも試す価値のある選択肢ですが、公表されたFrontierCodeのコストとスコアの比較はHighと最大の間のものです。どちらかの設定を本番環境の最適解とみなす前に、チーム自身の作業で結果を確かめる必要があります。

より広い費用対効果の評価

関係するワークロードはコーディングだけではありません。44の職種にまたがる知識労働の評価であるGDPval-AAでは、Claude Sonnet 5.5のスコアは1844で、Claude Opus 5.5の1846に迫り、Claude Sonnet 5の1449を上回っています。この結果から、日常業務では低いトークン単価が魅力的に映るかもしれません。ただし、コーディングベンチマークでの差が解消されるわけでも、作業単位のコスト削減が裏づけられるわけでもありません。

安全対策の設定も、どのモデルがリクエストを処理するかに影響します。リクエストが高リスクのサイバーセキュリティや生物学に関する安全策に引っかかると、AnthropicのシステムはClaude Sonnet 5.5からClaude Sonnet 5へ切り替えます。こうした分野で許可された作業を評価する組織は、結果を解釈する際にこの可能性を考慮する必要があります。

切り替える前に確認すべきこと

Claude Sonnet 5.5はTerminal-Bench 4.0で高い結果を示し、大半のトークン区分で料金も低い一方、ほかのコーディングテストではClaude Opus 5.5が上回っています。コーディングのワークフローでは、まず代表的な作業で、effort設定を明示したうえで両モデルを比較することから始めましょう。公表されたトークン単価だけでなく、精度、使用トークン数、試行1回あたりの総コストを記録します。最大effortが役立つと決めつける前にHigh effortを試し、節約額を見積もる際はキャッシュ読み取りの使用量も含めます。そうして初めて、低いAPI料金が、重要な作業の請求額の低下につながるかどうかを判断できます。