科技

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%

来源:丹巴新文网
三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%

新智元披露信息

惊人一事实浮出水面:三分之一arXiv论文出自AI之手?

近期一份unslop的研究在海外引发热议。

过去一年间,计算机科学专业65%的新论文,被其检测器检出问题。

网友为此创造了特定说法——「大泔水时代」。

但同期数学论文仅0.7%被标记。

ChatGPT一出,曲线急剧飙升

这项研究团队扫描了12750篇arXiv论文,时间从2023年1月至2026年7月。

选取十个学科,每领域每月抽约25篇全文分析。

对照组则选自2021至2022年,那是ChatGPT尚未面世的纯粹人工时期。

数据显示,2021至2022年标记率维持在0.4%;ChatGPT面世后,曲线数月内急速上升。

最近一个季度标记率达到32%,2026年初峰值更逼近39%。

按学科细分,计算机科学最为严重,标记率高达65%。

要知道在ChatGPT问世之前,这一数字仅有0.2%。短短三年,增幅超过300倍。

定量生物56.3%、电气工程51.3%、经济金融47%紧随其后。

应用物理34%、统计31.3%、凝聚态24%、高能物理14%、天体物理10.7%。

数学以0.7%位列最后。

同一检测设备,同一论文数据库,差异达近百倍。

究竟是数学家坚持手工写作?或机器面对数学公式时完全失效?

末位0.7%令人费解

其实答案已藏于unslop报告之中。

想象一下标准数学论文结构:满页符号公式定理与证明,英语文字内容稀少。

偏偏该检测器只分析文字。它关注句子构造、用词特征、段落布局。

数学论文仅剩的几行文字,多是「设X为某某」「由引理3可推导」这类固定句式,与训练时接触的科学英语差别巨大。

研究者自己也坦言现存局限:

数学0.7%数据意义有限。可能数学家少用AI,也可能检测器无法识别数学论文,两者难以区分。

对照组样本量也偏小。每个学科仅200篇ChatGPT前论文,按0.4%误报率,2000篇仅8篇被标记,精度不足。

还需认识到检测器存在的盲区。因此这些数字都是下限,实际比例可能更高。

竞争激烈的领域,更依赖AI

究竟谁在使用AI写作论文?

斯坦福团队两年研究揭示答案。

2024年3月,Weixin Liang团队首次将其检测范围扩大至同行评审:ICLR 2024审稿意见显示约10.6%的句子经LLM大幅修改。论文尚未检测,审稿人已先行使用。

2025年8月,该团队将样本增至112万篇论文,研究成果发表于《自然·人类行为》。

表明截至2024年9月,CS论文摘要中LLM修改比例高达22.5%。使用最频繁的,是预印本发布最活跃、竞争最激烈领域的研究者。

越是竞争激烈的领域,使用越广泛。

此处AI写作已演变成军备竞赛:同行都在借助AI提升效率,纯人工写作者节奏明显落后。

难怪一份在X平台流传的报告配文开头便是:「提示词:写一篇能发arXiv的论文。」

它嗅的是风格,非技术

不过需注意,65%数据并非直接定罪。

研究者声明检测器无法区分「AI语法润色」与「全文机器生成」,它只识别文本中的机器特征强度。

所以65%的准确表述是「65%论文风格显露AI痕迹」,而非「65%论文系AI创作」。

问题在于,这种机器痕迹人类也可能留下。

某资深学者曾对自己多年前发表的论文

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~