Claude Opus 5.5は、コーディングや知識労働に取り組む開発者にとって、より高性能で、コストも抑えられる可能性がある選択肢です。ただし、最も高価な設定が最適とは限りません。Anthropicによると、同等のタスクをこなす総コストはClaude Opus 5より40%低くなります。ベンチマークの結果と初期の利用テストは切り替えを本格的に検討する根拠になる一方、目立つスコアだけでなく、実際に完了した作業を測るべき理由も示しています。
性能が伸びた領域と、そうでない領域
Claude Opus 5.5は、モデルがツールを使って複数段階の開発タスクを進めるエージェント型コーディング向けに設計されています。ターミナルを使うコーディングと知識労働の評価では、Claude Fable 5.1を大きく上回ります。Eloスコアは性能比較に使う相対的な評価値です。GDPVal-AAのレーティングは高いほど、その評価で優れた結果を示します。
| 評価 | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 53.3% |
| GDPVal-AA v2.1 | 1846 Elo | 1735 Elo | 1542 Elo |
| AutomationBench | 40.0% | 28.9% | 41.4% |
| Terminal-Bench Science | 58.7% | 52.6% | 64.6% |
| ツール使用ありのHumanity’s Last Exam | 67.7% | 65.6% | 57.2% |
重要なのは、個々の順位よりも全体の傾向です。Claude Opus 5.5は、一般的なターミナル作業、FrontierCode、GDPVal-AA、ツール使用ありのHumanity’s Last Examで比較対象を上回ります。一方、AutomationBenchとTerminal-Bench ScienceではGPT-6 Astraが優位です。別の評価であるCursorBench 4.0では、Opus 5.5が57.8%、Claude Fable 5.1が51.8%、Claude Opus 5が46.6%でした。コンピューター操作とグラフ認識の改善幅はそれぞれ81.8%対80.7%、89.0%対88.4%と小さく、改善の度合いはタスクによって異なることがうかがえます。
コストはトークン単価だけでは決まらない
API(アプリケーション・プログラミング・インターフェース)は、ソフトウェアからモデルへリクエストを送る仕組みです。APIの料金は、モデルが読み取り、生成するテキストの単位であるトークンに基づいて計算されます。Claude Opus 5.5は、掲載されている各トークン単価がClaude Opus 5より低くなっています。
| 100万トークン当たりの料金 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 入力 | $4.00 | $5.00 |
| 出力 | $20.00 | $25.00 |
| プロンプトキャッシュの読み取り | $0.20 | $0.50 |
| プロンプトキャッシュへの書き込み | $5.00 | $6.25 |
プロンプトキャッシュは、再利用できる文脈を保存し、リクエストのたびにすべてを処理し直さずに済むようにする仕組みです。キャッシュの読み取り料金は60%、通常の入力・出力料金は20%下がりました。Anthropicによると、Opus 5.5のトークン生成速度もOpus 5より30%超速くなっています。同等のタスクで総コストが40%低いという同社の説明には、定価の引き下げだけでなく、使用トークン数の減少と実行時間の短縮も反映されています。この数字は報告された比較結果であり、どの導入環境でも達成できる削減率ではありません。Pro、Max、Teamの契約者は、利用上限も5倍になります。

▲ 推論の労力とタスクのコスト
推論に割く労力、つまり回答のためにどれだけ検討するかも、コスト計算を変えます。設定はlow、medium、high、extra-high、maxの5段階です。AutomationBenchでは、medium設定の合格率は約30%で、コストは1タスク当たり$0.80を大きく下回ります。GPT-6 Astraは40%に達しますが、コストは1タスク当たり$2.00近くかかります。Terminal-Bench 4.0では、Opus 5.5のhigh設定は1回の試行当たり約$4.00で正答率が66%を超えます。一方、Astraの最大設定は1回当たり$10.00超で約58%です。
推論に多くの労力を割けば、必ず答えがよくなるわけではありません。FrontierCode v1.1では、コストが$1.00未満のOpus 5.5のmedium設定が、$5.00超のmax設定を上回ります。性能は労力に応じて一様に上がるのではなく、ばらつきがあります。標準設定を選ぶチームにとっては、maxよりmediumやhighの方が有望な出発点です。ただし、適切な設定はタスクと、失敗した試行にかかるコストによって変わります。
初期の実務テストで分かったこと
ベンチマークだけでは、アプリケーションの中でモデルがどう振る舞うかは十分に分かりません。初期の企業向け事例の一つでは、テスターが68万行のコードリポジトリを24時間未満で移行しました。フルスタックのWeb開発テストでは、Claude Opus 5.5が40件中39件のタスクを初回の試行で完了しました。いずれも注目に値する個別の結果であり、別の組織のリポジトリやアプリケーションで同じ結果が出るという予測ではありません。
変更内容を確認しやすいことも、実務上の変化です。請求処理のリファクタリングに関する修正の説明を比較すると、Opus 5.5は会話調の文面から始めるのではなく、調査結果とコードの変更点を冒頭に示しました。複数のエージェントが同時に作業する場合、この形式は人が変更を確認する助けになる可能性があります。ビジュアルデザイン、フロントエンドのスタイリング、3D Web制作の改善も有望に見えますが、こうした品質は単一のベンチマークスコアでは捉えにくいものです。
モデルを取り巻く設定も重要です。ハーネスとは、モデルが動作するためのシステム指示、ツール定義、実行環境の組み合わせです。Opus 5.5では、適切なソフトウェアツールを選んで使うツール呼び出しが改善しています。Anthropicはデフォルトのシステムプロンプトの一部を簡素化し、カスタムツールやスキルがモデルの助けになるか、制約になるかを検証するプラグイン評価スイートを公開しました。開発者にとっての実践的な教訓は、指示やツールの説明を増やせば結果がよくなると決めつけず、既存の内容をテストすることです。
導入には安全管理も欠かせない
Anthropicによると、Opus 5.5は、モデルが意図された振る舞いにどの程度従うかを調べる同社の総合的なアラインメント評価で、過去最高のスコアを記録しました。公開前のテストには、外部評価者、自動化された振る舞いの監査、長時間にわたるシナリオも含まれました。検証対象には、モデルが処理する素材に埋め込まれた指示によって振る舞いを変えようとするプロンプトインジェクションや、信頼できない近道を探す傾向を明らかにするため、意図的に達成不可能にしたタスクも含まれています。

▲ モデルの安全対策と評価
Anthropicは、生物学とサイバーセキュリティに関する高度な能力に厳格な安全対策とアクセス制御を適用しています。一部の能力は、同社のLife Sciences Verification ProgramとCyber Verification Programを通じて承認された組織だけが利用できます。導入を検討する企業は、コーディング性能が向上しても、こうした管理策を考慮し、自社のツールや権限の下でモデルがどう振る舞うかを評価する必要があります。
切り替えをどう判断するか
Claude Opus 5.5の強みが最も生きるのは、日常的なコーディングや知識労働を担う標準モデルとしての用途です。複数の主要な評価で結果が向上し、API料金は下がり、トークン生成も速くなりました。ただし、すべてのテストで首位というわけではありません。初期の利用事例だけでは、別のワークフローをどれほど安定してこなせるかも分かりません。重要な計画策定、アーキテクチャ設計、重要度の高い監査にClaude Fable 5.1を使っているチームは、一度にすべて切り替えるのではなく、それらのタスクを個別に比較するとよいでしょう。
試験導入の方法は明快です。現在のワークフローから代表的なタスクを選び、mediumとhighの推論設定で実行します。完了した作業と人によるレビューの負担を確認し、成功したタスク当たりの総コストを既存モデルと比較します。アプリケーションが同じ文脈を繰り返し使うなら、プロンプトキャッシュも計算に含めます。カスタムツールに依存するなら、プラグイン評価スイートを使い、長い指示文が今も役に立っているかを見直します。こうした測定結果は、ベンチマークでの優位性や低いトークン単価だけよりも、確かな切り替え判断につながります。