arXiv论文有39%像AI写的?这个数字不能直接当成学术不端证据

摘要:Unslop对12750篇arXiv论文的检测显示,2026年初接近39%的论文被标记为机器写作,计算机科学过去12个月比例达到65%。这些数字可以说明AI辅助写作正在扩散,却不能直接作为学术不端或AI代写证据。

2026年7月,一项针对arXiv论文的检测结果引发讨论。

检测工具Unslop分析了2021年至2026年间的12750篇论文。结果显示,2026年初一度有接近39%的论文被标记为“机器写作”;最近一个完整季度的比例约为32%。在计算机科学领域,过去12个月的标记比例达到65%。

看到这些数字,很容易得出一个结论:arXiv上已经有大量论文由AI代写。

这项分析本身没有提供这样的证明。

它测量的是论文语言与机器生成文本的相似程度。被标记的论文可能由模型生成,也可能经过较重的AI润色,还可能是人类作者使用了与模型相似的学术表达。

研究团队在方法说明中也强调,检测得分不能判断具体作者如何完成论文,更不能单独作为指控某位研究人员的依据。

因此,这次争论涉及两个问题。

第一个问题是,学术论文中使用大模型的比例是否快速上升。

第二个问题是,我们有没有可靠工具准确判断一篇论文由谁写成。

现有证据对第一个问题给出了较明显的趋势,对第二个问题仍然缺少稳定答案。

12750篇论文是怎么检测的

Unslop从十个学科组中抽取论文。

从2023年1月至2026年7月,每个学科每月抽取约25篇论文,同时加入2021年和2022年的八个月份作为对照,总样本量为12750篇。

检测使用论文首次提交的PDF版本,避免一篇2023年提交、2026年修改的论文把后来的语言带回早期样本。分析对象是论文正文,而非仅看摘要。研究者称,同一篇论文的摘要可能只得到不到20%的机器写作分数,正文却超过70%。

对照组的作用很关键。

ChatGPT于2022年底公开推出。研究者把2021年和2022年的论文视为大模型普及前的人类文本,再调整检测阈值,让这些论文中只有0.4%被误判。

随后,研究者使用同一阈值检测后续年份。

结果曲线在2021年和2022年保持较低水平,ChatGPT推出后开始上升,2026年初达到约39%的阶段高点。

从时间变化看,大模型对学术写作的影响很难忽略。

但这个方法仍然依赖一项假设:2021年的人类学术语言,可以作为2026年人类学术语言的稳定参照。

四五年间,论文主题、作者构成、常用词汇和写作习惯都可能变化。研究人员大量阅读AI辅助文本后,也可能在没有调用模型的情况下吸收其中的表达方式。

检测器看到的是语言变化,无法独立判断变化由哪一种原因造成。

65%代表“像机器写”,不代表65%的论文全部由AI生成

这次传播最广的数字来自计算机科学。

在2025年7月至2026年7月的样本中,计算机科学论文有65%超过检测阈值;定量生物学为56.3%,电子工程与系统科学为51.3%,经济与金融为47%。数学只有0.7%。

不同学科间的巨大差距,可能与大模型使用习惯有关。

计算机科学研究人员更早接触代码助手和语言模型,使用AI整理摘要、修改英文和补充相关工作也更方便。

但检测器本身也存在学科适应差异。

数学论文包含大量公式、定义和“定理—证明”结构。删除公式与参考文献后,可供模型判断的自然语言较少。Unslop承认,数学论文得分低,既可能说明该领域使用AI较少,也可能说明检测器难以识别这种写作形式。现有数据无法区分两种解释。

同样的问题也可能影响计算机科学。

一篇论文可能在实验部分引用大量模型输出,或者展示提示词、对话示例和生成结果。这些内容本来就来自模型,检测器有可能将其计算到整篇论文的机器写作比例中。

Hacker News讨论中,有运营arXiv论文网站的用户表示,他们在实际检测中见过论文因为包含大模型输出示例而被标记。

所以,65%更适合表述为:

在这批计算机科学样本中,65%的论文语言超过了该检测器设定的“机器文本相似”阈值。

把它改写成“65%的计算机论文由AI生成”,已经超出了数据能够支持的范围。

检测器如何判断一段文字像AI

Unslop没有只依靠一种特征。

其方法说明显示,检测器使用约35000份文档训练,包括2019年的arXiv摘要和论文段落、维基百科、软件文档、互联网标准文档,以及由DeepSeek、Gemini、Llama、OpenAI和Anthropic等模型生成或处理的文本。

系统组合了三个判断模块。

第一个模块是小型神经文本分类器,分析文本的语义和整体模式。

第二个模块检查词汇和常见表达,观察作者选择了哪些词以及如何组织短语。

第三个模块分析句子长度、标点、功能词和写作节奏等风格特征。

三个模块的结果再交给一个较小的分类器合并,形成最终分数。

在研究者自己的测试集中,当学术人类文本误报率设为0.4%时,检测器可以识别约85%的AI学术文本。

这个成绩看起来很高,但仍有两个限制。

一是测试数据和实际论文分布不同。

研究者知道哪些训练样本由AI生成,也知道生成时使用的模型和提示词。现实中的作者可能多次修改模型输出,将不同模型生成的内容拼接,再加入人工写作。

二是不同模型的识别率相差明显。

方法说明显示,该检测器对部分模型生成内容识别效果较好,对Claude文本的识别率低于一半。研究者也没有完成当前版本的全面改写攻击和对抗测试。

因此,漏检和误报会同时存在。

学术写作本来就具有高度模板化特征

论文语言与日常表达不同。

研究人员通常使用固定结构:

介绍研究背景;

说明现有方法的不足;

提出一种解决方案;

列出实验结果;

讨论局限与未来工作。

许多学术短语已经使用几十年,例如:

“结果表明”;

“值得注意的是”;

“在这一背景下”;

“本文的主要贡献包括”;

“该方法具有一定局限性”。

大模型从大量论文中学习,也会频繁使用这些表达。

检测器因此面临一个循环问题:它通过学术论文学习什么是人类写作,又通过大模型输出学习什么是机器写作,而大模型本身也接受过学术论文训练。

某些表达属于学术共同体,某些表达受到模型推动,两者很难划出固定边界。

非英语母语作者受到的影响更加明显。

他们往往使用较规范、较保守的句式,或者借助语法检查和翻译软件改善英文。这些特征可能与模型生成文本重合。Unslop也将非英语母语的科学写作列为已知误报风险。

一旦检测结果与毕业、投稿、职称和学术声誉挂钩,哪怕只有较低误报率,也可能伤害具体个人。

旧论文测试不能完全解决误报问题

这次研究把2021年和2022年的论文作为人类写作基线,并把总体误报率压到0.4%。

这种设计比直接使用商业检测器扫描论文严谨一些。

它仍然只能说明:检测器很少把这批早期论文判成AI写作。

它不能证明检测器对2026年的纯人类写作仍保持相同误报率。

学术语言会随研究热点改变。

例如,大模型、智能体、基础模型、检索增强生成等词汇在2021年没有今天普遍。新领域论文可能共享相似结构和术语,检测器可能把这种研究潮流当成机器风格。

人类写作也会受到阅读材料影响。

当大量论文经过AI润色后,新研究人员会学习这些论文的语言。即使他们后来独立写作,文本仍可能带有类似特征。

这被Hacker News讨论者称为人类文本与模型文本的“趋同”。

在这种情况下,检测器识别到的可能是一种时代风格,而非某次具体的模型调用。

机器文本可以主动绕过检测

文本检测还有一个结构性问题。

只要检测规则可以被测试,生成模型就可以根据分数反复修改输出。

Hacker News有用户做了一个简单实验:先让模型生成文章,再要求模型根据检测得分持续改写。原始文本被判为97%的机器写作,优化后下降到1%,文本内容仍然完全由模型生成。

2026年7月发布的一项ELOQUENT检测竞赛研究也发现,改变生成文本的年代语体和结构风格,可以显著绕过经过对抗训练的检测器。研究者报告,部分方法的逃逸率比以往策略高约50倍。

这意味着,AI文本检测容易进入长期对抗。

检测器找到某种语言特征后,模型开发者或使用者可以针对这些特征改写。检测器重新训练后,又会出现新的绕过方式。

对于普通作者,检测器可能很敏感。

对于主动规避的人,检测效果反而更差。

如果高校和期刊把某个检测阈值设为处罚依据,结果可能鼓励作者花时间“降AI率”,而不是提高研究质量。

早期研究已经发现学术写作风格发生变化

Unslop的结果并非第一项相关分析。

2024年,斯坦福大学等机构的研究人员分析了arXiv、bioRxiv和Nature旗下期刊的950965篇论文,使用语料库层面的统计方法估算大模型修改痕迹。

研究发现,计算机科学论文中的大模型影响比例最高可达17.5%;数学和Nature期刊相对较低,最高约为6.3%。这项方法估计的是整体语料变化,不判断单篇论文作者身份。

另一项研究分析了约100万篇arXiv论文摘要,通过词频变化估算ChatGPT风格的渗透程度。研究者在特定提示词和模型版本作为基准的条件下,估计计算机科学领域约35%的摘要出现了类似语言特征。

这些研究采用不同方法,得出的比例也不同。

17.5%、35%、39%和65%不能直接互相比较。

有的检测摘要,有的检测全文;有的估计语料库整体变化,有的给单篇论文打分;有的统计“受模型修改”,有的统计“机器写作风格”。

它们共同支持一个较稳妥的判断:

大模型已经大量进入学术写作过程,计算机科学领域的变化尤其明显。

它们没有提供一个可以精确统计“多少篇论文由AI代写”的统一工具。

AI润色和AI代做研究需要分开处理

论文使用AI,可能包含多种情况。

作者完成研究和初稿后,让模型修改英文语法;

作者用模型压缩摘要或调整段落结构;

作者让模型整理相关研究,但逐条核实引用;

作者让模型生成整段文字,再进行人工修改;

作者让模型生成实验解释、数据或参考文献;

作者没有完成相应研究,直接提交模型拼出的论文。

这些行为的风险差别很大。

使用工具改进第二语言表达,与伪造实验数据不能放在同一层级处理。

学术诚信关注的核心内容包括:

研究是否实际完成;

数据是否真实;

分析能否复现;

引用是否准确;

作者是否理解并承担论文责任;

重要的工具使用是否按照规则披露。

仅凭文字风格,无法回答这些问题。

一篇语言完全由作者手写的论文,也可能包含伪造数据和错误结论。一篇经过大模型润色的论文,也可能建立在扎实实验和完整记录之上。

期刊和学校需要明确允许哪些辅助用途、哪些用途必须披露、哪些任务不得交给模型。

模糊地禁止“使用AI”,会让正常润色与学术造假混在一起。

检测器可以用于筛查,不能独立定罪

AI文本检测仍有一些用途。

期刊可以用它发现需要进一步检查的稿件;

编辑可以重点核实异常引用、重复表达和无法解释的实验结论;

学校可以把检测结果作为与学生沟通的起点;

研究机构可以观察某个领域的整体写作变化。

检测器更接近风险提示工具。

在涉及具体人员时,还需要其他证据:

文档修改记录;

实验原始数据;

代码提交历史;

研究笔记;

引用核查结果;

作者对方法和结果的解释;

不同版本论文之间的变化。

如果一名学生能够说明研究过程,提供资料并解释每一步推理,仅凭检测器的高分很难证明违规。

反过来,一篇论文即使检测结果很低,也不能排除作者使用了模型。经过人工改写、翻译或针对性优化后,模型文本很容易逃过检测。

高分不能直接证明使用AI,低分也不能证明没有使用AI。

学术管理要从检测文字转向核查研究过程

大模型普及后,学术机构很难继续把论文成品当作唯一证据。

更可靠的管理方式,是要求研究过程留下可核查记录。

实验数据应保存来源和处理步骤;

代码应记录版本和修改历史;

重要分析应能够重新运行;

引用应能够追溯到原始文献;

模型辅助完成的关键任务应进行披露;

作者需要对论文中的每个结论负责。

对学生作业,可以增加口头解释、分阶段提交、课堂写作和过程记录。对研究论文,可以强化数据审查、代码复现和引用核验。

这些方法会增加管理成本,却比一个“AI概率”更接近学术质量本身。

39%可以作为趋势信号,不能作为人数统计

Unslop分析提供了一组值得关注的数据。

12750篇论文的检测曲线在ChatGPT推出后明显上升,计算机科学等领域的变化幅度很大。结合此前的大规模研究,可以判断AI辅助写作已经广泛进入科研活动。

但“2026年初39%的arXiv论文被检测器标记”与“39%的论文由AI代写”是两句话。

前一句是检测结果。

后一句是作者身份和写作过程判断。

从前一句走到后一句,需要独立验证、可复现方法以及更多关于作者工作流程的证据。

AI文本检测器可以帮助观察行业变化,也可以提示人工检查。它无法承担审判工具的角色。

学术机构更需要防范的,是虚假数据、错误引用、无法复现的实验和作者不理解自己署名的内容。

至于一句话由人敲下,还是经过模型润色,只有放回完整研究过程里,才有判断价值。

参考资料

Unslop:《How we measured AI writing across arXiv, and where the measurement breaks》,2026年。

Unslop:《How our AI-text detector works》,2026年。

Weixin Liang等:《Mapping the Increasing Use of LLMs in Scientific Papers》,2024年。

Mingmeng Geng、Roberto Trotta:《Is ChatGPT Transforming Academics’ Writing Style?》,2024年。

Dima Galat、Marian-Andrei Rizoiu:《Structural shifts in AI writing bypass state-of-the-art detectors》,2026年。

分享到