研究の現場でAIをめぐるルールが、いくつもの方面で同時に動いています。わずか1週間のうちに、OpenAIはEU AI Actに対応するためAIが書いた文章に目に見えない透かし(ウォーターマーク)を埋め込む計画を示し、新しい研究は最近の米国STEM分野の博士論文の30%近くにAIが書いた文章が含まれていると報告しました。英国の研究資金ネットワークは、AIツールが人の審査より先に助成金申請のほぼ半数を不採択にしたことを謝罪し、arXivは過去最多の月を受けて投稿数に上限を設けました。共通するのは難しい問いです。学術界はAIが書いた成果物をどう見分けるべきか、そしてどこまでの判断を機械に任せるべきか、という問いです。

OpenAIのテキスト透かし、数学の文章では検出しにくい

2026年10月6日、OpenAIはEU AI Actのもとでのテキストの来歴(プロベナンス)に関する方針を公表しました。ここでいう来歴とは、ある文章がどこから来たかの記録です。APIの顧客は目に見えない透かしを検出するツールを利用でき、ChatGPTなどの一般向けツールは欧州のユーザー向けにこの信号を埋め込み始めます。

透かしは、モデルがトークン(言語モデルが読み書きする文章の小さな単位)を選ぶ際にわずかな統計的な偏りを加える仕組みです。人の目には見えませんが、検出ツールはこの偏りを測定できます。OpenAI自身のベンチマークは、この信号がいかに壊れやすいかを示しています。

テスト条件 検出率
心理学の文章、400トークン 94.3%
数学の文章、200トークン 36.5%
単語の10%を同義語に置き換え 92%から66%に低下
単語の25%を同義語に置き換え 17%に低下

文章が短い場合や数式が多い場合は検出力が大きく下がり、通常の編集でもさらに弱まります。OpenAIは透かしにできないことも明言しています。人がどれだけ貢献したかを測ること、内容が正確かどうかを確かめること、法的な著作者や責任を決めることはできません。透かしが示すのは、モデルが関わったということだけです。

この限界が重要なのは、検出結果が誤って解釈されやすいからです。AIで下書きを整えた学生と、研究そのものをAIに任せた学生が、同じ信号を出すこともあります。大学などが透かしの検出を不正の証拠として扱えば、AIを下書きの補助として使った誠実な学生が罰せられるおそれがあります。

米国STEM博士論文の30%近くにAIの文章

全米経済研究所(NBER)が2026年10月に出したワーキングペーパーは、米国のSTEM分野の博士論文にAIが書いた文章がどれほど含まれているかを測定しました。2023年より前には検出例がありませんでしたが、その後は割合が急速に高まりました。

時期 AIの文章が検出された博士論文の割合
2023年 1.7%
2024年 5.5%
2025年 18.8%
2026年5月まで 29.4%

分野別ではコンピューターサイエンスと数学が36%で最も高く、工学が35%で続きました。英語を母語としない学生や、ランキングが低い博士課程の学生では利用率が大幅に高くなっています。第二言語で密度の高い専門的な文章を書く留学生にとって、言語モデルで表現を整えるのは理解できる選択だといえそうです。

目を引くのは進路に関する結果です。AIが生成した文章を含む博士論文を書いた修了者は、大学のテニュアトラックに残るより産業界に進む傾向が大幅に強くなっていました。ただし、AIの利用が進路を変えたことの証明にはなりません。もともと産業界を目指していた学生が、従来の博士論文の規範をあまり気にしなかっただけかもしれません。

AIの助けを借りた博士論文を抱え、大学とオフィスビルへの分かれ道に立つ修了者

▲ 博士論文で増えるAIの文章

AIの選別ツールが助成金申請の半数を先に不採択に

英国研究・イノベーション機構(UKRI)が資金を出すサイバーセキュリティ研究ネットワークは、研究資金の公募をAIによる自動選別(トリアージ)ツールにかけました。ツールは179件の申請を7つの基準で採点し、人の審査員が目を通す前にほぼ半数を不採択にしました。

何週間もかけて複雑な研究計画を練り上げた研究者たちは強く反発しました。ネットワークは謝罪し、影響を受けたすべての申請を再評価すると約束しました。

この件は、研究評価でAIに任せられる範囲の境界がどこにあるのかを示しているようです。AIは書式、スペル、文法、言い回し、相互参照といった表面的なチェックは得意です。一方で、新しい仮説や専門性の高い研究手法を評価するには深い分野の理解が必要で、現在のモデルにはそれが備わっていないように見えます。専門家の審査なしにソフトウェアに資金配分を決めさせれば、研究者が申請書に注いだ労力を無駄にし、人の専門性を軽んじることになりかねません。

AI検出ツールのスコアを理由に査読を辞退

査読(ピアレビュー)の現場でも同じ緊張が生じています。2026年10月5日、オーストラリアのWestern Sydney Universityの非常勤教授が、査読依頼を辞退したことをXに投稿しました。理由は、AI検出ツールの無料版で原稿の要旨を調べたところ、すべてAIが生成したと判定されたことでした。この投稿は70万回以上閲覧されました。

不満が生まれるのはよく分かります。査読者は無報酬で働いており、手間をかけずに自動生成された投稿に時間を割くべきではありません。しかし、多くの研究者が反論しました。AI検出ツールは精度が低いことで知られ、人が書いた文章を機械が書いたものと判定することも少なくありません。文の構造や言葉選びを少し変えるだけで判定が覆ることもあり、検出はいたちごっこになっています。あるコメントは、検出ツールの判定を理由に論文を退けるのは、著者が電卓を使ったという理由で物理学の原稿を拒むようなものだと例えました。

AIが生成した投稿を警戒するのは妥当です。ただ、欠陥のある検出アルゴリズムをうのみにするのは行き過ぎだといえそうです。

arXiv、月4万件を超えて投稿数に上限

2026年10月1日、プレプリントサーバーのarXivは、個々の投稿者が登録できる論文の数に上限を設ける新しい投稿数制限ポリシーを施行しました。きっかけは、AIの文章作成ツールによる投稿量の急増です。

月 arXivへの投稿数
2016年9月 9,869件
2024年9月 20,569件
2026年9月 40,363件(過去最多)

かつては、タイピングの速さやアイデアをまとめるのにかかる時間が、一人が発表できる量の自然な上限になっていました。生成AIがその上限を取り払い、一人の著者が1カ月に数十本の論文を書けるようになりました。その負担はarXivのボランティアのモデレーターにかかります。2026年9月だけで、スタッフとモデレーターは9,000件近いサポートチケットに追われ、サイト全体で掲載が遅れました。

研究者やモデレーターの多くはこの上限を支持しています。Rutgers Universityの数学教授は、著者はプレプリントサーバーに大量に投稿するのではなく、月に最も優れた2本を選ぶべきだと主張しました。この制限は、ボランティアに支えられた基盤の崩壊を防ぐ妥当な応急策といえそうです。

じょうごから流れ込む大量の原稿と、閉じ始めたゲートの前で疲れたボランティアのモデレーター

▲ プレプリントサーバーへの投稿急増

OpenAIの数学原稿719本に数学者が反発

OpenAIは透かしの方針と同じ日に、社内のフロンティアモデルが書いた数学の原稿719本を372のファミリーに分けたGitHubリポジトリを公開しました。数学者のワーキンググループはテレンス・タオのブログに声明を掲載し、この公開は研究の規範を無視したものであり、検証されていない論文の山を求めた人は誰もおらず、一度にすべてを放出したのは学術的な貢献ではなく企業の力の誇示だと主張しました。この反発が倫理と検証をめぐる正当な懸念を反映したものなのか、数学の仕事の中核を機械に奪われることへの不安なのかは、まだ答えの出ていない問いです。

研究者と研究機関がいま取るべき行動

AI検出ツールはまだ信頼できる判定役ではなく、AIは研究の質に対する専門家の判断に代わることはできません。研究者と研究機関は、次の明確なポイントに沿って行動できます。

  • 透かしやAI検出ツールの結果だけを不正の証拠として扱わない。短い文章や数式の多い文章は特に判定が難しい。
  • 透かしは著作者を決めないことを覚えておく。提出した内容の正確さには、人間の著者が全面的に責任を負う。
  • 生成AIは文体の推敲、文法チェック、書式の調整、下書きの構成に使い、検証されていない科学的主張の作成には使わない。
  • 英語が母語でない場合は、AIを翻訳と表現の補助として公然と使い、研究手法と中身は自分のものとして保つ。
  • arXivなどのプレプリントサーバーには、下書きを大量生産するのではなく、質の高い少数の論文を投稿する。