Googleが9月30日に発表したGemini 4 Argonは、企業の知識業務、ソフトウェア開発、サイバーセキュリティ防御で最先端の性能を打ち出したモデルです。発表したのは、Google DeepMindのシニアバイスプレジデントでGoogleのチーフAIアーキテクトを務めるKoray Kavukcuoglu氏です。Googleが公表したベンチマーク表では、Argonは業務や自動化のタスクで明確に先行していますが、すべての項目で上回っているわけではありません。しかも現時点では一部のセキュリティ防御担当者を除いてほとんど誰も使えないため、以下の数値の多くはGoogleの自己申告です。Argonがどこで先行し、どこで後れを取っているのか、費用はどうか、そしてGoogleが社内ですでに何に使ったのかを整理します。

スコア表:エージェント業務で先行、コーディングは拮抗

GoogleはArgonをGPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5と比較しました。

ベンチマーク Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Vals Index(知識業務) 68.9% 63.1% 65.8% 67.0%
AutomationBench 51.3% 41.4% 31.4% 42.5%
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6%
Harvey Legal Agent Benchmark 19.6% 5.4% 6.7% 3.8%
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Vibe Code Bench 91.9% 89.6% 90.3% 90.3%
FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Terminal-Bench 4.0 57.4% 58.2% 57.9% 66.4%

差が最も大きいのは、エージェント(複数ステップのタスクを自律的にこなすAIシステム)が実際の業務を担う分野です。知識業務、業務の自動化、財務分析、法務がそれにあたります。法務エージェントのベンチマークでは、競合モデルが3.8%から6.7%にとどまるなか、Argonは19.6%を記録しました。コーディングは評価が分かれます。DeepSWE v1.1とVibe Code Benchでは首位ですが、FrontierSWE v2ではGPT-6 Astraに及ばず、コマンドラインでの作業を測るTerminal-Bench 4.0ではClaude Opus 5.5に大きく引き離されています。圧勝ではなく、トップ集団と肩を並べたと見るのが妥当です。

独立した評価も同じ方向を示しています。Artificial Analysisの評価では、高い推論設定で動かしたArgonが、エージェント型のSaaSワークフローを測るAutomationBench-AAで78%を記録して首位に立ち、Terminal-Bench 4.0でも52%と上位に迫りました。特定のベンチマークで点数を稼ぐように調整したというより、能力が全般的に向上した結果に見えます。

出力上限100万トークンと導入価格

Argonは1回の応答で最大100万トークンを生成でき、これは従来の上限6万4,000トークンの16倍です。トークンは、モデルが読み書きする文章の小さな単位です。出力上限は、モデルが一度に読める入力の量や、セッションをまたいで引き継がれる記憶とは別のものです。長い推論や、複数ファイルにまたがる大規模なコード変更を一度に生成する場面で意味を持ちます。

APIの導入価格は、入力100万トークンあたり$2、出力100万トークンあたり$10で、キャッシュされた入力は95%割引になります。発売時の価格のため、長くは続かない可能性があります。

短い紙片と非常に長い紙片を並べて出力するAIの中核

▲ 大きく広がった出力上限

GoogleがすでにArgonで成し遂げたとすること

Google社内では、すでに数千人のエンジニアが開発と研究でArgonを使っています。Googleが挙げる例は次のとおりです。

  • 量子コンピューティング: 量子アルゴリズムの量子ビットとゲートの資源を最適化する作業で、Argonは公表済みの基準を40分で40%上回りました。
  • データセンターのメモリ: Argonのエージェントがフリート全体のプロファイリングデータを分析し、300TiBを超えるメモリを空けました。最終的な削減量は500TiBから1PiBと見込まれています。Googleの規模では、ごく小さな最適化でも大きな節約につながります。
  • Rustへの移行: エージェントがCとC++のコードをメモリ安全なRustへ移しており、GoogleのOSであるFuchsiaのZirconカーネルでは80万行を超えるコードが対象になりました。
  • 動画のデコード: Googleのオープンソース動画デコーダーlibgav1では、エージェントが既存のRust移植版を見直し、3万2,000行のSIMDコードを置き換えました。出力される映像は同一のまま、以前のRust移植版より2.7倍速く動きます。

libgav1での作業は、こうしたエージェントの働き方をよく表しています。エージェントはプロファイルに基づく実験を何度も繰り返し、コンパイラーの出力を調べて、コンパイラーが自動でベクトル化できるようにRustコードを作り直しました。ベクトル化とは、ループを多くの値を一度に処理する命令に変換することです。仮説を立て、測定可能な目標で検証し、うまくいったものを残す作業を昼夜を問わず続ける様子は、アンドレイ・カルパシー氏が説明した自動化された研究ループに似ています。ただし、これらはGoogle自身が示した成果であり、多くの試行の中から最もうまくいった例が選ばれている可能性もあります。

速度計が上がるそばで、ループ状にコードを磨き上げるロボットたちとサーバーラック

▲ 実験を繰り返すコード最適化

まだ試せない理由

Argonは段階的に提供されています。現時点で使えるのは、GoogleのFairwind Programに参加する信頼できるサイバー防御担当者に限られ、これは米国政府の公開前モデルアクセスの手続きと連携しています。次に対象となるのはUltraプランの有料API利用者で、個人の開発者や一般のユーザーは待つ必要があります。

そのため、独立した開発者がGoogleの数値を自分で確かめることもまだできません。初期の結果は有望に見えますが、Gemini 4が実際にどれほど優れているのかの結論は、幅広い独立した実地検証を待つ必要があります。

待つあいだにできること

Argonは、自動化と知識業務で明確な強みを示し、コーディングでは接戦を演じながら、Googleを再びトップ集団に押し上げました。利用が広がる前に、次の準備をしておくとよいでしょう。

  1. 業務の自動化、財務分析、法務文書など、Argonのリードが最も大きいタスクを最初の試験候補として選びます。
  2. コマンドラインで動くコーディングエージェントに使う予定なら、同じタスクでClaude Opus 5.5やGPT-6 Astraと比べるテストを準備します。
  3. 発表時のベンチマークはGoogle自身の結果として扱い、利用できるようになったら実際の業務で確かめ直します。
  4. 入力100万トークンあたり$2は導入価格なので、予算には余裕を持たせます。
  5. 大規模なコード生成など、非常に長い出力が必要な作業を洗い出しておきます。100万トークンの上限で、一度にできることが変わる可能性があります。