GPT-6 Lunaは、要求水準の高い一連の開発課題で、実用に足るブラウザソフトウェアと、プレイできるC++の3Dゲーム2本を生成しました。最も優れていたのは最初に生成されたスケートボードゲームで、エラーなくコンパイルでき、トリック、レールグラインド、スコア計算を備えていました。一方で、弱点も同じくらい重要です。ブラウザ上のデスクトップは開くまでにコード修正が必要で、ラリーゲームは見た目ほどハンドリングに説得力がありませんでした。Lunaは、人が実行し、確認し、改良していくソフトウェアの低コストな出発点として最も役立つとみられます。

低価格でカバーできる範囲

OpenAIはGPT-6 LunaをGPT-6ファミリーの軽量モデルと位置付けています。API価格は、モデルが処理・生成するテキストの量を測る単位であるトークン100万個あたりで示されています。

モデル 入力価格(100万トークンあたり) 出力価格(100万トークンあたり)
GPT-6 Luna $0.10 $0.50
GPT-6 Sol $2.00 $10.00
GPT-6 Astra $10.00 $50.00

これはAPI利用の料金で、ChatGPT Proのサブスクリプション料金ではありません。Lunaはテキストと画像の入力に対応し、コンテキストウィンドウは1,050,000トークン、最大出力は128,000トークンです。公表されている知識のカットオフは2026年5月19日です。公開されたDeepSWEの結果では、最大の推論強度でLunaが66.6%を記録し、GPT-5.6 Lunaの62.2%を上回りました。ただし、このベンチマーク結果が個別のプロジェクトで同じ改善を保証するわけではありません。

1回の修正が必要だったブラウザデスクトップ

推論強度を最大に設定したうえで、GPT-6 Lunaにブラウザベースのデスクトップ、日常的なアプリ数種、アニメーションする壁紙、動作する3Dミニゲーム2本を1つのHTMLファイルにまとめるよう求めました。報告された生成時間は45分13秒でしたが、そのうち約40分は対話型の権限確認で承認を待っていた時間です。

最初のファイルは表示されませんでした。JavaScriptの構文エラーでページが止まったためです。ブラウザのコンソールエラーを渡すと、Lunaは3分45秒で修正を出しました。修正後のデスクトップには、検索できるアプリランチャー、ローカル時計、壁紙の操作、メール、メモ、電卓がそろっていました。メモはブラウザにテキストを保存し、電卓はボタンが大きすぎるぎこちない配置ながら計算はできました。

空白のメール、メモ、電卓のパネルと、ローポリゴンのドライブゲーム、抽象的な壁紙が並ぶブラウザ画面

▲ アプリとゲームを備えたブラウザデスクトップ

ゲームは2本とも動きました。1本はローポリゴンの街を車で走って荷物を集めるゲーム、もう1本は三人称視点で障害物をよけるゲームです。集中タイマーも用意され、作業時間中は壁紙が切り替わりました。操作しやすい複数アプリを1つのファイルにまとめるという中心の目標は達成しましたが、一部のウィンドウ操作はぎこちなく、ドライブゲームにはウィンドウ内で終了する操作がありませんでした。実務上の教訓は、起動に失敗した生成アプリを完成品ではなくデバッグ作業として扱うことです。コンソールエラーを確認してモデルに戻し、修正後のファイルを試します。

2本のC++ゲーム、それぞれ異なる強み

ネイティブコードで最もはっきりした成果は、街の一区画を舞台にした単一ファイルのスケートボードゲームでした。Lunaはゲーム開発ライブラリのRaylibを使わないよう求められ、代わりにグラフィックスとウィンドウ処理にOpenGL、GLU、GLUTを使うビルド手順付きのC++コードを出しました。コードはエラーなくコンパイルできました。9分50秒の生成時間で、スロープ、レール、アニメーションするスケーター、オーリー、フリップ、スピン、自動グラインド、コンボ得点を備えたプレイ可能なシーンが完成しました。Lunaはコンパイルを自ら実行せずビルドコマンドをユーザーに渡したため、ビルドの成功は別途確認する必要がありました。

2本目のネイティブプロジェクトであるDustline Rallyは23分8秒かかりました。RaylibではなくSDL2とOpenGLを使い、メニュー、コース図、走行できるコースを備えていました。木々や高低差のある道を走りながら、追従カメラとコックピット視点を切り替えられます。しかし車はリアルなステアリングやタイヤの挙動で応答するのではなく、道路の経路に吸い付くように動きました。一部の計器は動かず、コースの一部は宙に浮いて見えました。動作する3Dドライブのプロトタイプではあるものの、完成したドライビングシミュレーションではありません。

その後、スケートゲームの見た目を刷新した版では、雨、音声、ネオン照明、走るタクシーが加わりました。この改良にはGPT-5 Luna Maxが使われたため、追加部分をGPT-6 Lunaの最初のビルドの成果とみなすべきではありません。最初のビルドだけでも、Lunaのより重要な強み、つまりコンパイルしてプレイできる本格的なゲームの土台を生成する力は示されています。

3Dサイトで見えた目視確認の手間

一連の制作課題のうち別のウェブサイト課題では、3Dグラフィックス用JavaScriptライブラリのThree.jsを使い、腕時計を紹介する1ページのサイトが作られました。ページでは手続き的に生成した腕時計モデルを選べ、スライダーを動かすと時計が部品の層ごとに分かれます。完成までの時間は38分57秒でした。

暗い台座の上で文字盤、針、風防などの層に分解された一般的な3D腕時計

▲ 3D腕時計モデルの分解表示

操作自体は機能しましたが、初期表示の文字盤では数字の位置がずれていました。針も最初は見当たりませんでしたが、分解表示のスライダーを動かすと、ほかの形状の下に隠れていたことが分かりました。この違いは確認作業で重要です。欠けているように見える部品も、3D面の重なり順や位置によって隠れているだけかもしれません。このページは完成した商品ページではなく、機能する出発点でした。なお、最初のブラウザデスクトップやネイティブゲームの課題とは異なり、最終的なウェブサイトのビルドがGPT-6 Lunaだけによるものかははっきりしないため、Lunaの性能を正確に測る材料にはなりません。

Lunaが向いている用途

コーディングと3Dの一連の課題を終えた後も、月額$200のChatGPT Proアカウントでは週間の利用枠が100%残っていると表示されました。消費した枠は1%未満でした。これはあるアカウントのサブスクリプション表示であり、APIの請求額でも、別の作業量で同じ割合に収まる保証でもありません。

ツールを選ぶ開発者にとって、対話的に動くコードを安く動かすことが目的で、検証に時間をかけられる場合には、GPT-6 Lunaが有力な選択肢になります。生成されたブラウザ用ファイルを実行し、ネイティブプロジェクトをコンパイルし、操作性、物理挙動、3Dの層の見え方を確認してから作り込みを進めます。APIの低価格は試作の繰り返しに魅力的ですが、構文エラー、ラリーゲームの挙動、ばらつきのある見た目の細部は、テストと改良が依然として欠かせないことを示しています。