Googleは9月30日にGemini 4 Argonを発表し、さまざまな評価で競合モデルを上回るベンチマーク表を示しました。ただし現時点で利用できるのは、指定されたサイバー防御の担当者だけです。同じ時期にOpenAIは個人向けエージェント基盤のDotsをChatGPTに組み込み、AnthropicはArgonとまったく同じ価格でClaude Sonnet 5.5を公開しました。ここでいうエージェントとは、ユーザーに代わって複数の手順からなる作業をこなすAIシステムのことです。これらの発表を合わせて見ると、競争の焦点はベンチマークのスコアから、モデルのエージェントがどれだけ確実にツールを使えるか、そして人々が毎日実際に仕事をするアプリはどこか、という二つの問いへ移りつつあるようです。GoogleがArgonで開発者の支持を取り戻すには、この両方に説得力のある答えを示す必要がありそうです。

まだ一部の人しか試せないモデル

Google自身のベンチマーク表では、Gemini 4 Argonは複数の評価項目で競合を上回っています。しかし利用できるのはごく一部のセキュリティ防御担当者に限られるため、外部の人がその数値が実際の業務でも通用するかを確かめる現実的な手段はありません。最先端のモデルがまず一握りのユーザーにだけ公開される場合、それ以外の人は発表時の数値をうのみにせず、幅広い実際の利用経験が出そろうのを待つほうが賢明です。

慎重になるのには前例があります。Gemini 3とGemini 3.1も、ベンチマーク表では強い印象を与えたものの、日々の業務ではユーザーを失望させました。Argonも公開後にじっくり使い続けた結果で判断するほうが安全そうです。

価格には競争力があります。Argonの導入価格は、入力100万トークンあたり$2、出力100万トークンあたり$10です。トークンとは、モデルが読み書きするテキストの小さな単位です。これはClaude Sonnet 5.5と同じ価格です。

モデル 入力(100万トークンあたり) 出力(100万トークンあたり)
Gemini 4 Argon $2 $10
Claude Sonnet 5.5 $2 $10
Claude Opus 5.5 $4 $20

Claude Sonnet 5.5の価格はClaude Opus 5.5の半分ですが、エージェントによるコーディングのベンチマークであるTerminal-Bench 4.0では70.6%を記録し、64.4%のOpus 5.5を上回りました。Argonが本当に最先端の性能を出すなら、この価格は妥当です。ただし同時に、強力なライバルがすでに待ち構える価格帯に入ることにもなります。

宿題はツール呼び出し

Geminiが本当に競争力のあるモデルを出したのは、2026年1月のGemini 3が最後だったといえそうです。Gemini 3は、アプリのうちユーザーが目にする部分であるフロントエンドのコード生成は得意でしたが、モデルが外部のツールを呼び出して作業をこなす能力であるツール呼び出しが苦手でした。ツール呼び出しが頼りにならなければ、自律的に動くエージェントを作るのは難しく、この弱点がGeminiの足を引っ張りました。GoogleのAIコーディングツールAntigravityが広く普及しなかったのも、開発者や創業者が基盤となるGeminiモデルを日々の仕事で信頼できなかったためとみられます。

一方で、Geminiにははっきりした強みもあります。動画をそのまま入力として受け付け、1本の動画を10秒ほどで取り込んで深く分析でき、これは競合する最先端モデルにはまねできない点です。とはいえ、その強みだけでは十分ではありませんでした。2026年を通じて、Googleは創業者や高度な知識労働者が毎日頼りにするモデルをまだ出せていないようです。

フォルダー、封筒、ターミナルなどのツールのアイコンにケーブルをつなぐAIロボット。一部のケーブルは外れている

▲ エージェントのツール呼び出し

エージェントが根を下ろすアプリ

競合各社は、自社のアプリをエージェントが仕事をする場所に変えつつあります。OpenAIのDotsは、ChatGPTのデスクトップアプリの中にそのまま組み込まれています。ユーザーはスマートフォンのChatGPTアプリから音声でDotsを呼び出し、作業を任せられます。するとDotsはSlackとメールでチームメンバーに状況を伝え、必要に応じてOpenAIのコーディングツールCodexのセッションを開いて、Webページのモックアップを作ります。Dotsを動かす高速なモデルは、CodexやGPTモデルに作業を引き渡すまでプランのクレジットを消費しません。OpenAIはDotsと合わせてChatGPT Spaceも投入し、そこでは人とエージェントが同じ文書を一緒に編集します。

Anthropicは、ClaudeのProjectsで、メインのエージェントがタスクごとに別のスレッドを開き、複数の仕事を同時に進められるようにしました。これらのスレッドはクラウドでも、ユーザーのMac上でも動かせます。ChatGPTとClaudeに加えて、GrokBotとCursorも専用のデスクトップアプリを用意しています。

対照的に、GoogleのAI機能はAntigravity、Geminiアプリ、Google AI Studio、NotebookLMに分散しており、新しいモデルをどこで使えばよいのかがはっきりしません。OpenAIは逆の道を選び、ChatGPTのデスクトップアプリを最優先にすることで、新しいモデルが出るたびにユーザーが迷わず向かえる場所を用意してきました。Googleが機能を一つのアプリにまとめない限り、Argonが強力でも、ユーザーがとどまる理由を示すのは難しいかもしれません。

文書、チャット、コードをまとめた一つのデスクトップアプリと散らばった小さな画面、そして迷うユーザー

▲ 一つにまとめたアプリと分散したツール

今やるべきこと

Gemini 4 Argonは歓迎すべき競争相手ですが、ベンチマークだけで期待を膨らませるより、慎重に見守るべき存在です。実践的な手順をいくつか挙げます。

  1. 新しいモデルは、ベンダーのベンチマーク表ではなく、自分の仕事で継続して使った結果で判断します。
  2. Argonが公開されたら、ツール呼び出しが欠かせないエージェント作業から試し、以前のGeminiの弱点が直っているかを確かめます。
  3. 素早い動画分析が必要なら、Geminiの強みは今すぐ活用できます。
  4. エージェントツールは、モデルのスコアだけでなく、毎日仕事をするアプリとどれだけなじむかで選びます。
  5. 同じ価格帯のClaude Sonnet 5.5と、コストと品質を並べて比べる準備をしておきます。