摘要:Unslop对12750篇arXiv论文的检测显示,2026年初接近39%的论文被标记为机器写作,计算机科学过去12个月比例达到65%。这些数字可以说明AI辅助写作正在扩散,却不能直接作为学术不端或AI代写证据。

2026年7月,一项针对arXiv论文的检测结果引发讨论。
检测工具Unslop分析了2021年至2026年间的12750篇论文。结果显示,2026年初一度有接近39%的论文被标记为“机器写作”;最近一个完整季度的比例约为32%。在计算机科学领域,过去12个月的标记比例达到65%。
看到这些数字,很容易得出一个结论:arXiv上已经有大量论文由AI代写。
这项分析本身没有提供这样的证明。
它测量的是论文语言与机器生成文本的相似程度。被标记的论文可能由模型生成,也可能经过较重的AI润色,还可能是人类作者使用了与模型相似的学术表达。
研究团队在方法说明中也强调,检测得分不能判断具体作者如何完成论文,更不能单独作为指控某位研究人员的依据。
因此,这次争论涉及两个问题。
第一个问题是,学术论文中使用大模型的比例是否快速上升。
第二个问题是,我们有没有可靠工具准确判断一篇论文由谁写成。
现有证据对第一个问题给出了较明显的趋势,对第二个问题仍然缺少稳定答案。
12750篇论文是怎么检测的
Unslop从十个学科组中抽取论文。
从2023年1月至2026年7月,每个学科每月抽取约25篇论文,同时加入2021年和2022年的八个月份作为对照,总样本量为12750篇。
检测使用论文首次提交的PDF版本,避免一篇2023年提交、2026年修改的论文把后来的语言带回早期样本。分析对象是论文正文,而非仅看摘要。研究者称,同一篇论文的摘要可能只得到不到20%的机器写作分数,正文却超过70%。
对照组的作用很关键。
ChatGPT于2022年底公开推出。研究者把2021年和2022年的论文视为大模型普及前的人类文本,再调整检测阈值,让这些论文中只有0.4%被误判。
随后,研究者使用同一阈值检测后续年份。
结果曲线在2021年和2022年保持较低水平,ChatGPT推出后开始上升,2026年初达到约39%的阶段高点。
从时间变化看,大模型对学术写作的影响很难忽略。
但这个方法仍然依赖一项假设:2021年的人类学术语言,可以作为2026年人类学术语言的稳定参照。
四五年间,论文主题、作者构成、常用词汇和写作习惯都可能变化。研究人员大量阅读AI辅助文本后,也可能在没有调用模型的情况下吸收其中的表达方式。
检测器看到的是语言变化,无法独立判断变化由哪一种原因造成。
65%代表“像机器写”,不代表65%的论文全部由AI生成
这次传播最广的数字来自计算机科学。
在2025年7月至2026年7月的样本中,计算机科学论文有65%超过检测阈值;定量生物学为56.3%,电子工程与系统科学为51.3%,经济与金融为47%。数学只有0.7%。
不同学科间的巨大差距,可能与大模型使用习惯有关。
计算机科学研究人员更早接触代码助手和语言模型,使用AI整理摘要、修改英文和补充相关工作也更方便。
但检测器本身也存在学科适应差异。
数学论文包含大量公式、定义和“定理—证明”结构。删除公式与参考文献后,可供模型判断的自然语言较少。Unslop承认,数学论文得分低,既可能说明该领域使用AI较少,也可能说明检测器难以识别这种写作形式。现有数据无法区分两种解释。
同样的问题也可能影响计算机科学。
一篇论文可能在实验部分引用大量模型输出,或者展示提示词、对话示例和生成结果。这些内容本来就来自模型,检测器有可能将其计算到整篇论文的机器写作比例中。
Hacker News讨论中,有运营arXiv论文网站的用户表示,他们在实际检测中见过论文因为包含大模型输出示例而被标记。
所以,65%更适合表述为:
在这批计算机科学样本中,65%的论文语言超过了该检测器设定的“机器文本相似”阈值。
把它改写成“65%的计算机论文由AI生成”,已经超出了数据能够支持的范围。
检测器如何判断一段文字像AI
Unslop没有只依靠一种特征。
其方法说明显示,检测器使用约35000份文档训练,包括2019年的arXiv摘要和论文段落、维基百科、软件文档、互联网标准文档,以及由DeepSeek、Gemini、Llama、OpenAI和Anthropic等模型生成或处理的文本。
系统组合了三个判断模块。
第一个模块是小型神经文本分类器,分析文本的语义和整体模式。
第二个模块检查词汇和常见表达,观察作者选择了哪些词以及如何组织短语。
第三个模块分析句子长度、标点、功能词和写作节奏等风格特征。
三个模块的结果再交给一个较小的分类器合并,形成最终分数。
在研究者自己的测试集中,当学术人类文本误报率设为0.4%时,检测器可以识别约85%的AI学术文本。
这个成绩看起来很高,但仍有两个限制。
一是测试数据和实际论文分布不同。
研究者知道哪些训练样本由AI生成,也知道生成时使用的模型和提示词。现实中的作者可能多次修改模型输出,将不同模型生成的内容拼接,再加入人工写作。
二是不同模型的识别率相差明显。
方法说明显示,该检测器对部分模型生成内容识别效果较好,对Claude文本的识别率低于一半。研究者也没有完成当前版本的全面改写攻击和对抗测试。
因此,漏检和误报会同时存在。
学术写作本来就具有高度模板化特征
论文语言与日常表达不同。
研究人员通常使用固定结构:
介绍研究背景;
说明现有方法的不足;
提出一种解决方案;
列出实验结果;
讨论局限与未来工作。
许多学术短语已经使用几十年,例如:
“结果表明”;
“值得注意的是”;
“在这一背景下”;
“本文的主要贡献包括”;
“该方法具有一定局限性”。
大模型从大量论文中学习,也会频繁使用这些表达。
检测器因此面临一个循环问题:它通过学术论文学习什么是人类写作,又通过大模型输出学习什么是机器写作,而大模型本身也接受过学术论文训练。
某些表达属于学术共同体,某些表达受到模型推动,两者很难划出固定边界。
非英语母语作者受到的影响更加明显。
他们往往使用较规范、较保守的句式,或者借助语法检查和翻译软件改善英文。这些特征可能与模型生成文本重合。Unslop也将非英语母语的科学写作列为已知误报风险。
一旦检测结果与毕业、投稿、职称和学术声誉挂钩,哪怕只有较低误报率,也可能伤害具体个人。
旧论文测试不能完全解决误报问题
这次研究把2021年和2022年的论文作为人类写作基线,并把总体误报率压到0.4%。
这种设计比直接使用商业检测器扫描论文严谨一些。
它仍然只能说明:检测器很少把这批早期论文判成AI写作。
它不能证明检测器对2026年的纯人类写作仍保持相同误报率。
学术语言会随研究热点改变。
例如,大模型、智能体、基础模型、检索增强生成等词汇在2021年没有今天普遍。新领域论文可能共享相似结构和术语,检测器可能把这种研究潮流当成机器风格。
人类写作也会受到阅读材料影响。
当大量论文经过AI润色后,新研究人员会学习这些论文的语言。即使他们后来独立写作,文本仍可能带有类似特征。
这被Hacker News讨论者称为人类文本与模型文本的“趋同”。
在这种情况下,检测器识别到的可能是一种时代风格,而非某次具体的模型调用。
机器文本可以主动绕过检测
文本检测还有一个结构性问题。
只要检测规则可以被测试,生成模型就可以根据分数反复修改输出。
Hacker News有用户做了一个简单实验:先让模型生成文章,再要求模型根据检测得分持续改写。原始文本被判为97%的机器写作,优化后下降到1%,文本内容仍然完全由模型生成。
2026年7月发布的一项ELOQUENT检测竞赛研究也发现,改变生成文本的年代语体和结构风格,可以显著绕过经过对抗训练的检测器。研究者报告,部分方法的逃逸率比以往策略高约50倍。
这意味着,AI文本检测容易进入长期对抗。
检测器找到某种语言特征后,模型开发者或使用者可以针对这些特征改写。检测器重新训练后,又会出现新的绕过方式。
对于普通作者,检测器可能很敏感。
对于主动规避的人,检测效果反而更差。
如果高校和期刊把某个检测阈值设为处罚依据,结果可能鼓励作者花时间“降AI率”,而不是提高研究质量。
早期研究已经发现学术写作风格发生变化
Unslop的结果并非第一项相关分析。
2024年,斯坦福大学等机构的研究人员分析了arXiv、bioRxiv和Nature旗下期刊的950965篇论文,使用语料库层面的统计方法估算大模型修改痕迹。
研究发现,计算机科学论文中的大模型影响比例最高可达17.5%;数学和Nature期刊相对较低,最高约为6.3%。这项方法估计的是整体语料变化,不判断单篇论文作者身份。
另一项研究分析了约100万篇arXiv论文摘要,通过词频变化估算ChatGPT风格的渗透程度。研究者在特定提示词和模型版本作为基准的条件下,估计计算机科学领域约35%的摘要出现了类似语言特征。
这些研究采用不同方法,得出的比例也不同。
17.5%、35%、39%和65%不能直接互相比较。
有的检测摘要,有的检测全文;有的估计语料库整体变化,有的给单篇论文打分;有的统计“受模型修改”,有的统计“机器写作风格”。
它们共同支持一个较稳妥的判断:
大模型已经大量进入学术写作过程,计算机科学领域的变化尤其明显。
它们没有提供一个可以精确统计“多少篇论文由AI代写”的统一工具。

AI润色和AI代做研究需要分开处理
论文使用AI,可能包含多种情况。
作者完成研究和初稿后,让模型修改英文语法;
作者用模型压缩摘要或调整段落结构;
作者让模型整理相关研究,但逐条核实引用;
作者让模型生成整段文字,再进行人工修改;
作者让模型生成实验解释、数据或参考文献;
作者没有完成相应研究,直接提交模型拼出的论文。
这些行为的风险差别很大。
使用工具改进第二语言表达,与伪造实验数据不能放在同一层级处理。
学术诚信关注的核心内容包括:
研究是否实际完成;
数据是否真实;
分析能否复现;
引用是否准确;
作者是否理解并承担论文责任;
重要的工具使用是否按照规则披露。
仅凭文字风格,无法回答这些问题。
一篇语言完全由作者手写的论文,也可能包含伪造数据和错误结论。一篇经过大模型润色的论文,也可能建立在扎实实验和完整记录之上。
期刊和学校需要明确允许哪些辅助用途、哪些用途必须披露、哪些任务不得交给模型。
模糊地禁止“使用AI”,会让正常润色与学术造假混在一起。
检测器可以用于筛查,不能独立定罪
AI文本检测仍有一些用途。
期刊可以用它发现需要进一步检查的稿件;
编辑可以重点核实异常引用、重复表达和无法解释的实验结论;
学校可以把检测结果作为与学生沟通的起点;
研究机构可以观察某个领域的整体写作变化。
检测器更接近风险提示工具。
在涉及具体人员时,还需要其他证据:
文档修改记录;
实验原始数据;
代码提交历史;
研究笔记;
引用核查结果;
作者对方法和结果的解释;
不同版本论文之间的变化。
如果一名学生能够说明研究过程,提供资料并解释每一步推理,仅凭检测器的高分很难证明违规。
反过来,一篇论文即使检测结果很低,也不能排除作者使用了模型。经过人工改写、翻译或针对性优化后,模型文本很容易逃过检测。
高分不能直接证明使用AI,低分也不能证明没有使用AI。
学术管理要从检测文字转向核查研究过程
大模型普及后,学术机构很难继续把论文成品当作唯一证据。
更可靠的管理方式,是要求研究过程留下可核查记录。
实验数据应保存来源和处理步骤;
代码应记录版本和修改历史;
重要分析应能够重新运行;
引用应能够追溯到原始文献;
模型辅助完成的关键任务应进行披露;
作者需要对论文中的每个结论负责。
对学生作业,可以增加口头解释、分阶段提交、课堂写作和过程记录。对研究论文,可以强化数据审查、代码复现和引用核验。
这些方法会增加管理成本,却比一个“AI概率”更接近学术质量本身。
39%可以作为趋势信号,不能作为人数统计
Unslop分析提供了一组值得关注的数据。
12750篇论文的检测曲线在ChatGPT推出后明显上升,计算机科学等领域的变化幅度很大。结合此前的大规模研究,可以判断AI辅助写作已经广泛进入科研活动。
但“2026年初39%的arXiv论文被检测器标记”与“39%的论文由AI代写”是两句话。
前一句是检测结果。
后一句是作者身份和写作过程判断。
从前一句走到后一句,需要独立验证、可复现方法以及更多关于作者工作流程的证据。
AI文本检测器可以帮助观察行业变化,也可以提示人工检查。它无法承担审判工具的角色。
学术机构更需要防范的,是虚假数据、错误引用、无法复现的实验和作者不理解自己署名的内容。
至于一句话由人敲下,还是经过模型润色,只有放回完整研究过程里,才有判断价值。
参考资料
Unslop:《How we measured AI writing across arXiv, and where the measurement breaks》,2026年。
Unslop:《How our AI-text detector works》,2026年。
Weixin Liang等:《Mapping the Increasing Use of LLMs in Scientific Papers》,2024年。
Mingmeng Geng、Roberto Trotta:《Is ChatGPT Transforming Academics’ Writing Style?》,2024年。
Dima Galat、Marian-Andrei Rizoiu:《Structural shifts in AI writing bypass state-of-the-art detectors》,2026年。