OpenAIは2026年10月6日、開発中の最先端モデルであるフロンティアモデルのうち、未公開の社内モデルが書いた数学の原稿722本を公開しました。成果の数は8月の約10件から9月の100件超、10月第1週の722本へと、毎月およそ10倍のペースで増えています。ただし、本当に注目すべきは件数ではないかもしれません。最先端の数学では、難しいのが証明を見つけることから、その証明を確かめて理解することへと移り始めています。

OpenAIが公開したもの

「Sharing AI progress in mathematics」と題した発表とあわせて、OpenAIは722本の原稿、モデルの推論過程の記録、新たな予想、Leanによる形式化をGitHubの公開リポジトリに置きました。Leanは、証明をコンピューターが1行ずつ検査できるコードに書き換える形式証明言語です。リポジトリでは原稿が372のファミリーに整理されています。

公開に先立ち、OpenAIはInstitute for Advanced Studyの独立した諮問グループであるAdvisory Group on Mathematics and Artificial Intelligenceに相談し、成果を共有するための基準と公開の提言をまとめました。

時期 公開した成果
2026年8月 10問について約10件の成果
2026年9月 ナビエ・ストークス関連の成果と、ほかの100問超の成果
2026年10月6日 17分野にわたる原稿722本

OpenAIによると、成果1件あたりの計算量は、ChatGPT Proが約3時間考えるのとほぼ同じでした。原稿は素数の分布や代数学から、プラズマ物理、量子回路まで17の分野にまたがります。一人の数学者が40年をかけて代数幾何学の一角を前に進めることと比べると、その差は歴然です。

同じく注目すべきなのは、このシステムが数学専用のエンジンではない点です。メールの下書きを書き、コードを組み、短い詩をつくるのと同じ種類の汎用の大規模言語モデルが、分野ごとの調整なしにこれらの分野をこなしました。

光る原稿フォルダーが群ごとに並ぶ巨大な棚に、ロボットアームが新しいフォルダーを収めている

▲ AIが書いた数百本の数学原稿

目を引く三つの成果

このモデルは、リーマン予想やP対NP問題を完全に解いたわけではありません。生み出したのは、長年の難問に対する部分的な前進の数々です。

準リーマン予想の境界0.875

リーマン予想はゼータ関数の零点がどこにあるかを扱い、素数がどのように分布するかに直結します。ベルンハルト・リーマンが1859年に目標としたのは0.5の臨界線です。人間の数学者はこれまで1.0の線を除外し、零点が存在しうる領域を少しずつ狭めてきました。今回のモデルは、ゼータ関数とすべてのディリクレL関数について、どこでも成り立つ0.875という固定された境界を確立しました。

この種の境界は、霧に包まれた山にたとえるとわかりやすくなります。登山者には頂上が見えませんが、ある地点までたどり着けば、山が少なくともその高さはあると証明できます。0.875の線は、いま確実に到達した高さにあたります。

バーチ・スウィナートン=ダイアー予想

バーチ・スウィナートン=ダイアー(BSD)予想は、楕円曲線の解を扱います。モデルは、Selmer corankが0または1で定義される幅広い曲線のクラスについて、完全な公式を導きました。

ゴールドフェルド予想

ゴールドフェルド予想は、有理数上の楕円曲線が、有理数解を有限個しか持たないものと無限個持つものとに半々に分かれるとするものです。モデルは、解析的階数が予測どおり50対50に分かれるところまでの橋渡しを完成させました。

いずれの成果も、Clay Mathematics Instituteのミレニアム懸賞問題の賞金$100万を主張するものではありません。賞金には完全な証明が必要だからです。それでも、これらの問題に対する1970年代後半から1980年代以来最大の構造的な前進といえるかもしれません。

新たなボトルネックは検証

深い内容の論文が1日に722本も公開されれば、すぐに問題が生じます。こうした成果を評価できる専門知識を持つ数学者は、世界に数百人からせいぜい1,000人ほどしかいません。人間が書いた原稿1本を査読するのにも、通常は数週間から数か月かかります。

Leanはこの構図の一部を変えます。証明が形式化されている部分では、機械がその論理を自動で検査できるからです。数学の中心的な問いが「証明できるか」から「検証し、理解できるか」へと移りつつあるのはこのためです。

ただし注意点があります。722本の原稿は、数学界による本格的な査読をまだ経ていません。一部には微妙な誤りやハルシネーション、つまりもっともらしいが誤った内容が含まれている可能性があります。そうした誤りも、モデルの推論がどこで崩れるかを示すという点で役に立ちます。証明の90%以上が正しいと確認されれば、今回の公開は数学史上最大のブレークスルーに数えられる可能性があります。

この進め方を誰もが歓迎しているわけではありません。数学界の批判者たちは、通常の学術的な手続きを経ずに722件の自動生成された成果をネットに公開したことに強く反発しました。フィールズ賞受賞者25人は公開書簡に署名し、AIが数学を人間の営みから産業的な検証作業に変えてしまうおそれがあると警告しました。書簡は、数学の目的が世代を超えて理解を積み重ねる人間の共同体を維持することなのか、それとも検証済みの予想をAIシステムに供給し続けることなのかを問いかけています。コンピューター科学者のスコット・アーロンソンも、OpenAIがナビエ・ストークス方程式の解の存在と滑らかさの問題を含むほかの重要な未解決問題の解を握っているといううわさが数学者の間で流れていると指摘しています。

天井まで積み上がった書類の山を、長い机で数人の数学者が確認し、一人がノートパソコンを使っている

▲ 人間の査読を待つ原稿

なぜ数学なのか、なぜいまなのか

OpenAIが数学に力を入れているのは、モデルを比べるための標準的なテストであるベンチマークが飽和したためとみられます。未証明の数学には、結果を客観的に確かめられるという得がたい性質があります。そのため、最先端の知能を試す場として適しています。

その成果はAIそのものにも返ってきます。OpenAIのある研究者は、純粋数学のブレークスルーが機械学習のアルゴリズム、行列乗算、AIチップの設計の改善につながると論じています。GoogleのAlphaEvolveやSakana AIの研究は、自動的な発見がすでに次世代のAIシステムの設計を形づくっていることを示しています。成果が毎月10倍のペースで増え続けるなら、同じ手法を機械学習の研究に応用することで、AI研究所自身の仕事も加速する可能性があります。

次は生物学と医学かもしれない

数学が最初に影響を受けるのは、証明が形式的で、コンピューターで検証できるからです。生物学と医学は現実世界での試験に頼るため、時間がかかり、自動化も難しくなります。その意味で、数学は実証科学がこれから直面することを早めに示すシグナルになりえます。

将来のモデルが、主要な病気を対象にした新しい薬の化合物を722種類提案したと想像してみてください。検証の負担は、証明を確かめるよりはるかに重くなります。社会は、人間の理解の速さに合わせてAIの発見を遅らせるか、仕組みを深く理解していなくても先に進めるかを選ばなければならないかもしれません。高度なAIの研究を安全性の保証が得られるまで止めるべきかについても、研究者の意見は分かれています。

その根底には、さらに深い問いがあります。AIは人間の理解を引き上げるのか、それとも人間がついていけない地点まで先に進んでしまうのか。チンパンジーは道具として使われる棒や骨は理解できても、火や車輪、ヘリコプターになると理解が途切れます。いま最先端の数学を理解している人は、ごくわずかです。ChatGPTのようなツールは難しい考え方を説明できますが、AIの発見が、人間がもはや追跡も検証もできない地平を越えてしまう現実的なリスクがあります。

注目すべき点と、いまできること

AIはいま、人間が確かめられるよりはるかに速く数学の成果を生み出しており、検証が律速段階になっています。実践的なポイントは次のとおりです。

  • 個々の論文の出来だけでなく、数か月にわたる成長曲線を見ます。
  • 関心のある分野があれば、OpenAIの公開リポジトリで原稿、推論過程の記録、Leanのコードを見てみます。
  • 難しい論文はChatGPTのようなツールでわかりやすい言葉に分解してもらい、その成果にLeanによる形式検証の裏付けがあるかを確かめます。
  • 数学界の検証がどうなるかを追います。正しいと確認される証明の割合が、今回の公開が本当に意味するところを決めることになりそうです。
  • 数学の変化を、生物学や医学、そしてAI研究そのものの先行指標として捉えます。