インタラクティブな3Dシーンの生成テストで、GPT-6 SolがGPT-5.6 Solに対して最も一貫して示した強みは速度です。両モデルに同じプロンプトを与え、推論レベルを最大にしたところ、新モデルは比較したすべてのシーンをより早く完成させ、見た目も概ね優れていました。ただし、トークン使用量が常に少なかったわけではなく、このテストからタスク当たりの費用は分かりません。モデルの切り替えを検討するなら、出力品質とともに所要時間と実際の支出も確認する必要があります。
比較で測定したこと
OpenAIはGPT-6 Solを、最上位モデルであるGPT-6 Astraより下の階層に位置付けています。GPT-5.6 Solとの比較では、カメラ視点、動く物体、調整可能な操作項目などを要件とする、コードで構築する3Dシーンの同一プロンプトを両モデルに与えました。どちらも、回答により多くの処理を費やせる最大の推論レベルで実行しています。トークン数はキャッシュ済みトークンを含む処理済みテキストの単位を合計したもので、所要時間は各実行の開始から終了までを測っています。
これらは負荷の高いコーディング課題であり、ソフトウェア開発能力のすべてを測るものではありません。見た目はもっともらしくても、ページ上のスライダーを動かした際に、ブラウザベースの3DグラフィックスであるWebGLの表示がリアルタイムに変わらない場合があります。そのため、比較では操作要素が機能するかどうかも考慮しています。

▲ 3Dシーンの所要時間比較
所要時間とトークン数を見ると、速度とトークン使用量を分けて追うべき理由が分かります。以下の表でMは100万トークンを表します。
| シーン | GPT-5.6 Sol:トークン数、所要時間 | GPT-6 Sol:トークン数、所要時間 |
|---|---|---|
| ゴールデンゲートブリッジ | 9.4M、1時間4分 | 4.7M、11分35秒 |
| カッパドキアの気球 | 13.1M、53分52秒 | 4.0M、9分58秒 |
| ストーンヘンジ | 9.5M、53分49秒 | 3.5M、11分42秒 |
| ミズダコ | 7.8M、48分39秒 | 6.6M、9分51秒 |
| モネの「睡蓮」 | 9.4M、47分15秒 | 17.1M、25分26秒 |
| バベルの塔 | 9.3M、50分10秒 | 20.3M、24分28秒 |
| 雨の庭 | 4.6M、48分46秒 | 6.9M、14分16秒 |
| マンハッタンの空撮風シーン | 7.0M、1時間41分 | 24.2M、44分24秒 |
ゴールデンゲートブリッジのプロンプトでは、大気の表現を調整する操作項目と、交通量を調整できる車両が求められました。GPT-6 Solの所要時間は5分の1未満で、使用トークン数は半分でした。橋の形状はより整い、水面の反射も強く、操作への反応も良好でした。一方、GPT-5.6 Solのシーンは許容できる出来でしたが、より平板でした。カッパドキアとストーンヘンジでも、トークン数の減少と待ち時間の大幅な短縮に加え、地形や石の配置により説得力がありました。
速くてもトークン数が少ないとは限らない
タコの課題は、トークン数を待ち時間の代わりの指標にできないことを特に明確に示しています。GPT-5.6 Solは780万トークンを使い、48分39秒かかりました。GPT-6 Solも比較的近い660万トークンを使いましたが、9分51秒で完了しました。新モデルの結果では腕の巻き方がより自然で、胴体もダイナミックに動いていました。一方、旧モデルの腕は硬い動きでした。
時間差の説明として考えられるのは、GPT-5.6 Solがコードの一部を繰り返しテスト・再確認することに時間を費やし、最終的なシーンの完成に同程度の進展がなかった可能性です。これは実行結果からの解釈であり、各作業に何分かかったかを示す時間の内訳ではありません。それでも、トークン数が比例して増えていなくても経過時間を監視することが重要な理由にはなります。
いくつかのプロンプトでは、トークン節約の傾向が逆転しました。「睡蓮」のシーンでGPT-6 Solは1710万トークンを使用し、GPT-5.6 Solの940万トークンを上回りましたが、所要時間は47分15秒ではなく25分26秒でした。新モデルはスイレンの葉と橋の反射を備えた、絵画のような池を移動できる形で生成しました。旧モデルの出力は平板で、タイル状の要素にまとまりがありませんでした。バベルの塔とマンハッタンでも、GPT-6 Solはより多くのトークンを使いながら早く完了しました。これらのケースでは、増えたトークンはシーンの細部の充実に使われており、トークン消費量が減ったことを示すものではありません。
時間面の優位性には幅がありました。待ち時間が約5分の1になった実行もあれば、「睡蓮」とバベルの塔のように、以前の約半分の時間で完了した実行もあります。このばらつきから、どのような課題でテストするかが重要だと分かります。単一の割合ですべてのプロンプトを表すことはできません。
費用は別の問題
複数の工程をこなすAIシステムを対象とした別のエージェントタスク比較では、タスク当たりの費用の中央値と正味のタスク改善率が次のように報告されています。対象の課題は異なり、推論レベルもMaxとHighが混在しています。そのため、これらの数値はモデル選択の参考情報であり、上記のシーンについて測定した費用ではありません。
| モデルと設定 | タスク当たりの費用の中央値 | 正味のタスク改善率 |
|---|---|---|
| Claude Fable 5.1(Max) | $4.40 | +13.7% |
| GPT-6 Astra(Max) | $3.94 | +12.7% |
| Claude Opus 5(High) | $2.07 | +10.3% |
| GPT-5.6 Sol(High) | $1.03 | +8.0% |

▲ エージェントタスクの費用と性能
GPT-6 SolがClaude Opus 5に迫る性能をより低価格で発揮できる場合、タスク当たりの費用は約$0.40になる可能性があります。これは推定であり、この比較で測定された数値ではありません。同様に、シーンのテストで得られたトークン数と完了時間から、別のユーザーが異なるタスクで支払う金額を確定することはできません。実務上の問いは、対象の仕事に設けられた時間と費用の範囲内で、許容できる結果が得られるかどうかです。
切り替えるかどうかの判断
GPT-6 Solは、今回の複雑な3Dコーディング用プロンプトでは待ち時間を大幅に短縮し、比較した出力にも目に見える品質向上があったとみられます。一方、トークン削減は一貫しておらず、費用面で優位になるという予測も測定による確認が必要です。推論レベルを最初から最大にするのではなく、実際の用途を代表するタスクをLowまたはMediumで試し、現在使っている設定と比較してください。総トークン数、経過時間、タスクの実費、操作項目が機能するかどうかを記録します。不要な待ち時間や費用を増やさず、求める品質を満たすモデルと設定を選ぶことが重要です。