围绕科研领域AI使用的规则,正在多个方面同时发生变化。短短一周之内,OpenAI公布计划,为满足EU AI Act的要求在AI生成的文本中嵌入不可见水印;一项新研究发现,美国近期STEM博士论文中近30%含有AI撰写的段落;英国一家科研资助网络因AI工具在人工审阅前就否决了近一半的资助申请而公开道歉;arXiv则在月投稿量创下纪录后对投稿数量设限。这些事件背后是同一个难题:学术界应如何识别AI撰写的成果,又该把多少判断交给机器?

OpenAI文本水印在数学文本上效果不佳

2026年10月6日,OpenAI发布了依据EU AI Act处理文本来源(provenance)的方案。这里的来源指的是一段文本出自何处的记录。API客户可以使用一款检测不可见水印的工具,ChatGPT等面向消费者的产品也将开始为欧洲用户嵌入这一信号。

这种水印的原理是在模型选择token(语言模型读写文本的小单位)时加入轻微的统计偏差。人眼看不出这种偏差,但检测工具可以测量出来。OpenAI自己的基准测试显示了这一信号有多脆弱:

测试条件 检测率
心理学文本,400个token 94.3%
数学文本,200个token 36.5%
10%的词替换为同义词 从92%降至66%
25%的词替换为同义词 降至17%

文本较短或公式较多时,检测效果明显减弱,普通的编辑修改也会进一步削弱信号。OpenAI还明确说明了水印做不到的事情:它无法衡量人类贡献了多少,无法确认内容是否准确,也无法认定法律意义上的作者身份和责任。它只能表明有模型参与其中。

这一局限之所以重要,是因为检测结果很容易被误读。用AI润色草稿的学生和把研究本身外包给AI的学生,可能产生同样的信号。如果高校把水印命中当作学术不端的证据,那些把AI当作写作辅助工具的诚实学生就可能受到处罚。

美国近30%的STEM博士论文含有AI写作

美国国家经济研究局(NBER)2026年10月发布的一篇工作论文,测算了美国STEM博士论文中AI撰写文本出现的频率。2023年之前,研究人员没有检测到任何此类文本;此后这一比例迅速攀升:

时期 可检测到AI写作的博士论文占比
2023年 1.7%
2024年 5.5%
2025年 18.8%
截至2026年5月 29.4%

计算机科学和数学以36%居首,工程学以35%紧随其后。非英语背景的学生以及排名较低的博士项目的学生,使用率明显更高。对于用第二语言撰写高密度专业文章的国际学生来说,借助语言模型推敲措辞似乎是可以理解的选择。

职业去向方面的发现尤为引人注目。论文中含有AI生成文本的毕业生,进入产业界的可能性明显高于留在学术界走终身教职轨道。不过,这并不能证明使用AI改变了他们的职业道路。原本就打算进入产业界的学生,可能只是不太在意传统的博士论文规范。

借助AI完成博士论文的毕业生,站在通往大学和写字楼的岔路口

▲ 博士论文中AI写作的增加

AI筛选工具先行否决一半资助申请

一家由英国研究与创新署(UKRI)资助的网络安全研究网络,用一款自动化AI分诊(triage)工具处理其资助申请。该工具按照7项标准为179份申请打分,在任何人工评审查看之前就否决了其中近一半。

花了数周时间打磨复杂研究计划的研究人员强烈反对。该网络随后道歉,并承诺重新评估所有受影响的申请。

这一事件似乎表明了AI参与科研评审的边界所在。AI擅长表层检查:格式、拼写、语法、措辞和交叉引用。而评判一个新颖的假说或小众的研究方法,需要深厚的领域理解,目前的模型似乎并不具备。让软件在没有专家评审的情况下决定资助,可能白白浪费研究人员投入申请的心血,也会贬低人类的专业判断。

审稿人凭AI检测分数拒审论文

同行评审(peer review)也面临同样的矛盾。2026年10月5日,澳大利亚Western Sydney University的一位兼职教授在X上发帖,表示已拒绝一份审稿邀请。给出的理由是,一款AI检测工具的免费版判定该稿件摘要完全由AI生成。这条帖子的浏览量超过70万次。

这种不满不难理解。审稿人是无偿工作的,不应把时间耗费在敷衍了事的自动生成稿件上。但许多学者提出了反驳。AI检测工具出了名地不准确,经常把人写的文字判定为机器生成。只需改动几处句式或用词,判定结果就可能反转,检测因此变成了一场猫鼠游戏。一位评论者打比方说,凭检测工具的结论拒绝论文,就好比因为作者用了计算器而拒绝一篇物理学稿件。

对AI生成的投稿保持警惕是合理的,但盲目相信有缺陷的检测算法,似乎就走得太远了。

arXiv月投稿量破4万后设限

2026年10月1日,预印本平台arXiv开始实施新的投稿限流政策,限制单个投稿者可发布的论文数量。起因是AI写作工具推动的投稿量激增:

月份 arXiv投稿数
2016年9月 9,869篇
2024年9月 20,569篇
2026年9月 40,363篇(历史最高)

过去,打字速度和整合思路所需的时间,天然限制了一个人能发表多少成果。生成式AI打破了这一上限,如今单个作者一个月就能产出几十篇论文。压力落在了arXiv的志愿审核员身上。仅2026年9月,工作人员和审核员就要处理近9,000张支持工单,全站的论文发布普遍延迟。

学者和审核员大多支持这一限制。罗格斯大学的一位数学教授认为,作者应当每月挑选自己最好的两篇论文,而不是向预印本平台大量灌稿。这一限制看来是防止志愿者支撑的基础设施崩溃的合理权宜之计。

大量稿件从漏斗涌向几位疲惫的志愿审核员,闸门正在关闭

▲ 预印本平台投稿激增

数学家反对OpenAI公开719篇数学稿件

就在发布水印方案的同一天,OpenAI公开了一个GitHub仓库,收录其内部前沿模型撰写的719篇数学稿件,分为372个系列。一个数学家工作组在陶哲轩的博客上发表声明,认为此次发布无视科研规范,没有人要求过这样一大批未经验证的论文,一次性全部抛出是企业实力的展示,而非学术贡献。这种反对究竟反映了对伦理与验证的正当担忧,还是对机器接管数学工作核心环节的不安,目前仍无定论。

研究人员和机构现在应该做什么

AI检测工具还不是可靠的裁判,AI也无法取代专家对研究质量的判断。研究人员和机构可以依据以下几点行动:

  • 不要仅凭水印或AI检测结果认定学术不端。短文本和公式密集的文本尤其难以判断。
  • 记住水印并不决定作者身份。人类作者对所提交内容的准确性负全部责任。
  • 将生成式AI用于润色文风、检查语法、调整格式和搭建草稿结构,而不是用来生成未经验证的科学论断。
  • 如果英语不是母语,可以公开地把AI用作翻译和措辞辅助,但研究方法和实质内容要由自己掌握。
  • 向arXiv等预印本平台投稿时,选择少量高质量论文,而不是批量生产草稿。