Aioga
AI资讯 / 论文研究
返回 AI资讯

ArXiv上超30%新投稿文本特征与AI撰写一致

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-20T18:28:23.600Z热度 74

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),...

论文研究Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。

计算机科学领域最高(65%),数学领域最低(0.7%)。 检测器在0.4%假阳性率下可识别85%的AI学术文本。

中文正文 · AI 翻译

我们评分了12,750篇arXiv论文的全文,发现大约三分之一的新论文读起来像是机器写的。以下是方法、结果以及对局限性的诚实说明。

Share of new arXiv papers flagged as machine-written, 2021 to 2026, at a threshold calibrated so pre-ChatGPT papers flag at 0.4%. The eight slate points are the pre-LLM control months; the band is a bootstrap 95% interval.
Share of papers flagged as machine-written by field, over the 12 months to July 2026 (about 300 papers per field).

有一种标题类型叫做“X的N%现在是AI”,大多数都不值得读,因为数字背后的检测器也会误判一些真正的人类写作作品。如果一个工具标记40%的新论文为机器写作,但也标记了20%的ChatGPT出现之前的论文,那么真正值得关注的故事其实是没人提到的那20%。

所以我们围绕这一质疑建立了研究。我们的检测器,如此处描述:/blog/how-our-ai-text-detector-works,针对学术写作进行了校准;在0.4%的假阳性率下,它可以清除99.6%的真实预LLM科学文本,并检测出85%的AI学术文本。我们以这个假阳性率为基准。我们选取了2021年和2022年提交的论文,这些是在ChatGPT之前,被视为真实的人类作品,并设置标记阈值,使得正好0.4%的论文触发它。这个线就是底线。我们报告的每个数字都是超过预LLM真实写作阈值的论文比例,这个阈值构造上为0.4%。ChatGPT之前的年份则充当内置对照:如果增长是检测器的假象,2021年和2022年的标记率会和2026年一样高。第一张图显示事实并非如此。

我们抽样了十个领域组,每个领域每月大约25篇论文,从2023年1月到2026年7月,加上2021年和2022年的八个月控制数据,总计12,750篇论文。对于每篇论文,我们提取了第1版PDF,因此2026年修订的论文不会将现代文本泄露到其2023年的位置。我们评分的是全文,而非摘要,因为摘要低估了信号:我们曾看到同一篇论文摘要得分不到20%,而正文得分超过70%。每个报告的数据都带有自助法95%的置信区间。

标记比例在2021年和2022年保持在0.4%的水平,在ChatGPT发布后的几个月内开始上升,并以两个波段攀升到最近一个完整季度约32%,在2026年初达到接近39%的峰值。各领域间的差异很大,可以通过表格和第二张图看出。下列数值分别为各领域截至2026年7月的12个月内被标记的比例,以及其预LLM控制水平。

计算机科学领先约65%。数学最低,接近0.7%,限制部分解释了其低值难以解释的原因。控制列是每个领域2021到2022年标记率在三个敏感性设置下的平均值;上升幅度最大的领域并非预LLM控制水平最高的领域,因此较高的起点并不能解释这种上升。

控制样本量。每个领域的ChatGPT前控制为200篇论文。在0.4%的标记率下,整个2,000篇控制论文中仅有八篇被标记,分布在十个领域中,因此每个领域单一阈值的控制率是粗略的。汇总下限估计良好,也是研究的锚定点,但每个领域的控制水平只是近似值,更大的控制样本也无法解决这个问题:要在每个领域确定一个千分之一的标记率,需要每个领域数千篇控制论文,而2023年前的arXiv数量不具备。

低分可以表示低采纳率或检测器盲点。数学是最明显的案例。数学论文以符号和定理-证明结构为主,一旦删除方程和引用,其余的文字稀疏且与检测器训练的科学英语不同。一篇在大量模型辅助下撰写的数学论文可能得分低,因为其文字不在检测器的分布范围内,因此数学中的低分并不能强有力地证明该论文由人类撰写。结果可以用两个完全不同的解释来理解:采纳率较低,或者在该领域检测器敏感度降低,而这些数据无法区分它们。那些符合分布假设最强的、以文字为主的领域也是增长最多的领域,因此这种混杂因素无法解释整体趋势。但在低分领域中,排名应被视为采用率的下限。

检测器覆盖范围。检测器对某些生成器比其他生成器更敏感,而我们无法针对作者实际使用的确切、私有的模型和提示组合进行评估。不完整的覆盖会降低标记率,因此报告的普及率是下限:真实比例至少与我们测得的相同。检测器说明:/blog/how-our-ai-text-detector-works 报告了按生成器划分的性能。

一个标记并不等同于作者身份。检测器会以已校准的概率估计文本是否像机器生成的,并且具有已知的错误率。它无法区分经过轻度编辑的文档与完全生成的文档,而且单一评分永远不能作为指控某个特定人的依据。我们报告机器化写作的普遍性,其中包括大量 AI 辅助编辑的内容。

该检测器运行成本低,我们并不从中盈利。你可以在这里免费尝试任意 arXiv 论文:/check,也可以在这里尝试你自己的文本:/app。

在你自己的文本上运行 unslop →:/app

情报判断

Aioga 编辑摘要

研究对12,750篇arXiv论文的第一版全文进行评分。按其校准阈值,截至2026年7月,最近完整季度约32%的新投稿超过检测阈值,2026年初一度接近39%,但这表示文本特征与机器撰写一致,并非直接证明论文由AI生成。

背景分析

样本覆盖十个学科组、2023年1月至2026年7月,并以2021至2022年的论文作为前大模型时期对照。检测器在设定的0.4%假阳性率下,可识别85%的AI学术文本;研究使用第一版PDF全文,并为结果提供自助法95%置信区间。

Aioga 观点

Aioga判断,这项研究的价值在于将前大模型论文作为内置对照,并主动披露假阳性率,较单纯公布“AI占比”更具解释力。但超过阈值仍只是检测结果,不能据此认定具体作者使用了AI,也不能等同于学术不端。

影响与后续

计算机科学近12个月的标记比例约65%,数学约0.7%,但跨学科排名不能直接解释为真实采用率差异。数学论文的符号、定理与证明结构可能偏离检测器训练分布,因此低分既可能代表较少采用,也可能来自检测盲区。 值得关注的是扩大各学科的前大模型对照样本,并用不同检测方法、人工评审及已知写作来源的数据进行交叉验证。后续解读还应持续区分“超过检测阈值”“使用模型辅助”和“由AI撰写”,避免把相关文本特征升级为作者行为事实。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: unslop.run

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-20T18:28:23.600Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-20T18:28:23.600Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。