Aioga
AI资讯 / 论文研究
返回 AI资讯

AI文本检测器在模仿作者风格时漏检率飙升

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-19T08:35:26.000Z热度 57

Epoch AI研究显示,Pangram、GPTZero和Originality.ai检测普通AI文本近乎完美,假阴性率最高仅0.7%。但当Claude Opus 4.8等模型...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

Epoch AI研究显示,Pangram、GPTZero和Originality.ai检测普通AI文本近乎完美,假阴性率最高仅0.7%。

但当Claude Opus 4.8等模型模仿特定作者风格写作时,平均13%的AI文本未被检出; 科学写作类别中漏检率高达24%-29%,Pangram对Gemini生成的学术文本漏检率达48%。

中文正文 · AI 翻译

流行的 AI 文本检测器几乎可以以接近完美的准确率检测普通的 AI 生成文本。但当语言模型有意模仿特定作者的写作风格时,多达五分之一的 AI 文本会逃脱检测。科学写作是检测器最容易失败的领域。

Epoch AI 的一个研究团队测试了三种最广泛使用的 AI 文本检测器:Pangram(版本 3.3.2)、GPTZero(模型 2026-05-11-base)和 Originality.ai(Turbo 3.0.2)。测试涵盖三个类别:真实的人类写作、从简单提示生成的 AI 文本,以及故意模仿特定作者风格的 AI 文本。

该团队构建了一个包含 99 位作者的 495 段人类文本的语料库,平均分布在博客、小说和科学写作中。所有文本均在 ChatGPT 于 2022 年 11 月发布之前写成,这有效地排除了被语言模型污染的可能性。

在处理普通 AI 生成文本时,所有三种检测器的表现几乎无懈可击:https://epoch.ai/data-insights/ai-text-detection-challenges,假阴性率最高仅为 0.7%。大部分人类文本也能被正确分类。Pangram 和 GPTZero 没有产生任何误报。然而,Originality.ai 对 495 段人类文本中有 19 段误判为 AI 生成,假阳性率高达 3.8%,令人担忧。

当语言模型获得作者的写作样本作为参考资料时,这个结果就会发生变化。对于本次测试,三款前沿模型(Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro)各自收到一位作者的五段真实文本,然后被要求以相同风格撰写新文本。

根据 Epoch AI 的数据,在通过这种方式生成的 297 段文本中,平均有 38 段逃脱了检测,相当于约 13% 的假阴性率。Pangram 漏_detect 了 10% 的风格模仿文本,GPTZero 漏_detect 了 11%,Originality.ai 漏_detect 了 18%。

The chart shows error rates for the three AI text detectors Pangram, GPTZero, and Originality.ai across three test categories: human writing (false positives), directly prompted AI text (false negatives), and AI text imitating a human author's style (false negatives).

对于小说而言,三种检测器的假阴性率仅为 1% 至 5%。科学写作则表现出完全不同的情况。Pangram 未能识别出 25% 的风格模仿学术 AI 文本,GPTZero 漏_detect 了 24%,Originality.ai 漏_detect 了 29%。

在科学写作中,最糟糕的个体表现出现在特定的模型-文类组合中。根据已发布的数据,Pangram未能检测到48%的Gemini生成的学术段落:https://github.com/jaeholee-brown/ai-text-detectors。在Originality.ai上,39%的GPT-5.5学术文本未被检测到。Ad DEC_D_Incontent-2

Pangram使用一个在人工和机器生成文本上训练的神经网络,尽管其创始人曾称该系统为黑箱:https://the-decoder.com/pangram-ceo-says-language-models-give-themselves-away-by-making-the-same-arguments/,因为其判决无法追踪。GPTZero测量词语选择的可预测性及其在文本中的变化程度,基于语言模型比人类写得更统一的理念。Originality.ai:http://originality.ai/ 搜索其训练过程中从人工和AI生成文本中学到的统计模式。Ad

尽管存在这些差异,三种检测器表现出相同的模式。它们几乎每次都能捕捉到简单提示生成的文本,但更容易漏掉模仿文本。科学写作这一类型可能是AI检测在实际应用中使用最频繁的:https://the-decoder.com/grades-dropped-from-96-to-48-percent-when-a-brown-professor-made-students-take-the-exam-without-ai/,仍然是最难正确标记的。

早期的作者协会测试:https://the-decoder.com/authors-guild-test-finds-some-ai-detectors-perfectly-identify-human-writing-while-others-fail-on-every-single-text/ 发现,Pangram和Originality.ai能够可靠地将人类文本归类为人类写作。Epoch AI的研究补充了图景的另一半:对人类写作的假阳性率低,对AI文本实际漏检的数量几乎没有说明意义。

保持对AI的关注。清晰、有用、不空洞。

关注The Decoder获取AI新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Epoch AI研究显示,Pangram、GPTZero和Originality.ai检测普通AI文本近乎完美,假阴性率最高仅0.7%。 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-19T08:35:26.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Epoch AI研究显示,Pangram、GPTZero和Originality.ai检测普通AI文本近乎完美,假阴性率最高仅0.7%。但当Claude Opus 4.8等模型...

The Decoder:AI News(RSS)2026-07-19T08:35:26.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。