Google Antigravityは、93のAIコーディングエージェントを12時間にわたって連携させ、DOOMが動くオペレーティングシステムのカーネルを構築しました。使用したモデルはGemini 3.5 Flashで、処理したトークンは26億、費用はAPIクレジットで$1,000未満でした。大規模な並列コーディング作業が目に見える成果に結び付いた具体例といえます。ただし、それだけで同じ作業が次の実行でも確実に成功する証拠にはなりません。
カーネル構築で示されたこと
カーネルとは、コンピューター上でプログラムを動かすための中核となるソフトウェアです。今回の目標は、カーネルをゼロから作り、その上でDOOMを動かすことでした。人間はコードを書いていません。完成したカーネルでゲームが動く様子は、Google I/Oで披露されました。
| 項目 | 報告された結果 |
|---|---|
| コーディングエージェント | サブエージェント93 |
| 所要時間 | 12時間 |
| モデルへのリクエスト | 1万5,000回超 |
| 処理したテキスト | 26億トークン |
| APIクレジット | $1,000未満 |
トークンとは、モデルが読み込んだり生成したりするテキストの単位です。これらの数字は今回の実行の規模を示すもので、今後のプロジェクトの価格や完了までの時間を見積もるものではありません。費用の数字はAPIクレジットを対象としたもので、プロジェクトのそれ以外のコストをすべて計上したものではありません。

▲ 共通のカーネルに向けた並列作業
この成果に意味があるのは、コードファイルを一つ生成すれば済む作業ではなかったからです。複数のエージェントが何時間にもわたり、共通の成果物に向けて作業する必要がありました。DOOMが動いたという実証は、生成したファイルの数よりも進捗を示す強い根拠になります。ただし、カーネルに求められる機能のごく一部を確かめたにすぎません。
Antigravityが作業を連携させる仕組み
Google Antigravityには、/teamコマンドで呼び出すAgent Teamsモードがあります。エージェントとは、テキストで回答を返すだけでなく、タスクに向けて実際に行動できるAIシステムを指します。リードエージェントが依頼内容を評価し、足りない条件があれば確認したうえで、専門のサブエージェントに作業を割り振ります。サブエージェントは、独立したコード作業領域であるワークツリーと隔離された実行環境で、同時並行に作業できます。リードエージェントは、進捗を追跡するための専用インターフェースを組み立てることもできます。
これは、Antigravityが大規模なタスク向けに用意している構成です。カーネル構築について報告された数字からは、実行中の役割分担や作業の割り当て、連携の判断をすべて把握することはできません。確かなのは、このプロジェクトでサブエージェント93とGemini 3.5 Flashが使われたことです。Antigravity 2.0では、コード編集環境であるIDEと、並行作業を監督する独立したAgent Managerが分離されています。
並列処理を考えれば、12時間で1万5,000回を超えるモデルリクエストが発生したことも説明がつきます。ただし、すべてのリクエストがカーネルの完成に貢献したわけではなく、エージェントを増やせば常に結果が良くなるわけでもありません。タスクの分割、協調、エラー処理は、マルチエージェントシステムにとって今も改善の余地が大きい領域です。
実証の成功は再現性の検証ではない
完成を示す最も明確な根拠は、Google I/Oのライブデモでこのカーネル上でDOOMが動いたことです。そこから導けるのは限定的な結論で、生成されたシステムの一つが、デモの環境でゲームを動かしたということです。リソースの合計値は、その実行で消費した量を表しています。

▲ 実証された結果と未検証の論点
再現性を判断するには、ビルド手順、環境の仕様、テストマトリクス、繰り返し実行した結果が必要ですが、一度のデモではそれらは得られません。こうした情報がなければ、同じプロセスがどの程度の頻度で成功するのか、別のチームが同じ条件で結果を再現できるのかを、この事例から評価することはできません。また、一本のゲームが動いただけでは、ほかのプログラムでの挙動や継続的な利用といった、カーネル全体の品質は確かめられません。これはデモで示された範囲の限界であって、カーネルがそうしたテストに失敗したという意味ではありません。
Google DeepMindは、Antigravityを別の種類の並列作業、つまりモデル評価結果の比較にも使っています。このワークフローでは、リサーチ用のエージェントが結果の差を説明する仮説をおよそ100件提示し、サブエージェントがそれらを同時に検証します。システムが作業の委任を重視する理由がよく分かる例ですが、カーネルの成果とは別の話であり、その再現性を裏付けるものではありません。
今後に生かすべきこと
DOOMの事例は、連携したコーディングエージェントの集団が、報告された時間とAPIクレジットの範囲内で、実際に動作する成果を出したことを示しています。Antigravityのチームはこれを、長時間にわたるエージェント作業が現時点で経済的に成り立つ証拠と位置付けています。一方で、カーネルを毎日数百〜数千ドルかけて生成するのはまだ現実的ではないことも認めています。再現性やソフトウェア全体の品質については、重要な疑問が残ったままです。エージェントが構築した同様のプロジェクトを評価する際は、実際に示された動作とリソースの数字を切り分けて確認し、一度の成功を信頼できる手法と見なす前に、ビルドの詳細、テスト、繰り返し実行の結果を確かめるべきです。