同一个小时里,两个截然不同的人在搜索框里打下 AI 检测工具。一个是市场经理,他发布了四十篇借助语言模型起草的页面,并被告知 Google 会因此惩罚这个网站。另一个则被指控作弊,只因为某款工具返回了一个数字,而某位有权决定的人相信了它。

两个人走到的是同一类软件面前,这类软件卖的是确信感,而两个人都值得听到那个不太舒服的答案。关于这些工具已经公开的证据是一致的,而且并不好看。它们出错的频率高到,一个分数永远不该用来决定关于某个人的任何事;面对人类改写过的文本,它们直接崩掉;而且它们的错误并不是均匀分布在所有写作者身上的。

搜索引擎那个问题是另一个问题,有另一个答案,而那个答案跟检测毫无关系。

这些工具准确吗,Google 会惩罚 AI 内容吗。 经过同行评审的测试显示,所有工具的准确率都低于 80%,在经过改写的 AI 文本上跌到 26%;另一项研究发现,检测工具把非英语母语者写的文章判为 AI 所写的比例高达 61.3%。Google 不会因为内容由 AI 生成而惩罚它。它惩罚的是大规模内容滥用(scaled content abuse),那是关于目的和价值的问题,不是关于作者是谁的问题。


AI 检测工具实际上是怎么工作的

这个品类里卖的几乎所有东西都属于两个家族之一,而这个区分很重要,因为它们失败的方式不一样。

困惑度与突发性

较早的那一族测量的是文本自身的统计属性。困惑度描述的是,在给定前文的情况下,语言模型对每一个词有多意外,所以模型觉得高度可预测的文字得分就低。突发性描述的是这种可预测性在句与句之间的起伏,其理论前提是,人类写作会在平淡与古怪之间来回摆动,而生成的文本待在一条更窄的带子里。

这样造出来的工具并不是在辨认机器。它是在测量这段文字有多循规蹈矩,然后断言循规蹈矩的文字就是机器写的文字。这个推断就是整个产品的全部,而所有的失效方式都从这里来。

用生成文本训练出来的分类器

较新的那一族,用人类文本与生成文本配对的语料去训练一个模型,让它学会区分两者的任何特征。在它训练时所处的那个分布上,它比原始困惑度表现更好,同时它继承了一个更难的问题:每当模型更新一次,或者提示词换了一种语域,那个分布就会移动。

两族都拿不到任何一条关于这段文字是如何产生的事实。两者都是从成品去猜测文风,这正是为什么改一改文风就能让它们失效。第三条路线是水印,它的运作方式不同,放在后面讲,因为它是唯一一种从证据出发而不是从推断出发的方法。

关于 AI 检测工具准确率,研究到底说了什么

十四款工具的基准测试

被引用最多的对照测试,是 2023 年发表在 International Journal for Educational Integrity 上的《AI 生成文本检测工具的测试》。Weber-Wulff 和同事把 54 份测试文档送进 14 款工具,其中 12 款免费、2 款商用(Turnitin 和 PlagiarismCheck),共完成 756 次单项测试。

结果毫不客气。每一款工具的准确率都低于 80%,只有五款超过 70%。在真正由人类撰写的文档上,准确率是 96%,单看这一条还不错,但看完剩下的就不然了。在未经修改的 AI 文本上是 74%。在人类轻度编辑过的 AI 文本上是 42%。在经过改写工具处理的 AI 文本上是 26%。

论文写明,它的发现“与某些 AI 生成文本检测工具所声称的内容存在实质性差异”,而它自己的结论被引用的次数远远不够:这些工具“既不准确也不可靠”,并且“我们测试的这些系统不应在学术场景中使用”。

一项检验商用主力产品的 2026 年研究

三年之后,同一份期刊在 2026 年 2 月发表的一项研究用一组均衡的 192 份文本检验了 Turnitin 和 Originality。这组文本包括生成式 AI 尚未普及之前产生的真实学生写作、专业的人类写作、AI 输出,以及大约各占一半拼成的混合文档。

Originality 的宏平均准确率是 0.69,Turnitin 是 0.61,两者的宏平均 F1 分数都低于 0.55。在混合文本上,也就是今天大多数人真正的写作方式,Originality 的召回率接近于零。它几乎一份都没认出来。

领域差距才是所有在发布技术内容的人应该担心的那个发现。Turnitin 的准确率从人文类文本上的 0.86 跌到科学类文本上的 0.51。Originality 从 0.96 跌到 0.58。两个差异在统计上都显著。在科学写作上做到 0.51,一款检测工具做的事已经接近抛硬币。

唯一一家公布了自己失败的厂商

OpenAI 在 2023 年 1 月上线了一个分类器,随后又把它撤了下来。它自己的公告页面如今挂着这样一条说明:“自 2023 年 7 月 20 日起,AI 分类器因准确率过低而不再提供”,而原文里的数字仍然留着:它“把 AI 所写文本中的 26% 正确识别为很可能由 AI 撰写,同时有 9% 的概率把人类撰写的文本错误标注为 AI 撰写”。该页面还警告说,它“不应被用作主要的决策工具”。这是全世界最有条件接触到训练分布的那个机构,报出来的真阳性率大约是四分之一。

误判问题,以及它落在谁身上

TOEFL 研究

由 Liang、Yuksekgonul、Mao、Wu 和 Zou 撰写的《GPT 检测工具对非英语母语写作者存在偏见》于 2023 年发表在期刊 Patterns 上。方法很简单:把七款广泛使用的检测工具跑在非英语母语者写的 91 篇 TOEFL 作文和美国八年级学生写的 88 篇作文上。

对美国学童的作文,这些检测工具处理得很准确。在 TOEFL 作文上,平均误判率是 61.3%。这些由人类撰写的作文里,有 19.8% 被全部七款工具一致判定为 AI 所写,有 97.8% 至少被其中一款判定。

接着研究者做了那个把底牌掀开的动作。他们让同样的作文用更书面化的语言重写一遍,平均误判率就从 61.3% 降到了 11.6%。

为什么错误偏偏落在这里

这个下降精确地指出了被测量的到底是什么。这些工具检测到的是词汇变化的贫乏,而那是用第二语言写作时的一种属性,它们却把它报告成机器撰写。2023 年那份基准测试从另一个方向发现了同一效应:人类撰写、再由机器翻译成英语的文本,准确率损失了 20 个百分点,所以一位用母语起草再翻译的研究者,被冤枉的风险就此升高。

接下来的结论不是一道需要斟酌的题目。一款在某个可辨认的写作者群体上误判率达到 61.3% 的工具,绝不可以用来对一个人做出有后果的判断。2023 年那篇论文把它的实务含义说得很好:这些工具返回的是一个不附带任何证据的百分比,因此仅凭这一点被指控的学生“将没有任何辩护的可能”。

为什么编辑一遍就能让 AI 检测工具失效

最清楚的实验,是 Krishna、Song、Karpinska、Wieting 和 Iyyer 的《改写可以躲开 AI 生成文本的检测工具》。他们造了一个名为 DIPPER 的 110 亿参数改写模型,把生成文本推过去。在固定 1% 误判率的条件下,DetectGPT 的检测准确率从 70.3% 跌到 4.6%。水印、GPTZero 和 OpenAI 的分类器同样被躲了过去。

请认真对待它的推论,因为那是对整个品类最诚实的总结。如果未编辑的输出被检出率是 74%,编辑过的是 42%,那么这些工具稳定识别出来的东西并不是机器撰写。是马虎。从聊天窗口直接粘贴出来的页面会被标记。同一个页面,在一位称职的编辑砍掉三分之一、补进两条只有作者才知道的具体信息、并重写了开头之后,就不会被标记。检测工具是投入程度的替代指标,而且是个很差的替代指标。

Krishna 那篇论文提出的防御手段值得记下来,因为它根本不是检测。它是检索:在一个包含 1500 万条既往生成序列的数据库里搜索近似匹配,在只误标 1% 人类文本的水平上,抓到了 80% 到 97% 被改写过的生成内容。它之所以有效,是因为它比对的是真实产生过什么的记录。它同样要求模型提供方保存那份记录并执行这项核对,而这是任何公开工具都做不到的。

水印,技术上更认真的替代方案

它有什么不同

水印是在生成的那一刻介入,而不是事后去猜。Google DeepMind 面向文本的 SynthID 以 logits 处理器的身份坐在采样循环里,用 Google 自己的说法,它“使用一个伪随机 g 函数来增广模型的 logits,从而以一种能帮助你判断这段文本是否由你的模型生成、又不显著影响文本质量的方式,把水印信息编码进去”。开发者文档描述了一个贝叶斯检测器,它返回三种状态之一:有水印、无水印,或不确定。

Google 在 2024 年 5 月宣布为 Gemini 应用和网页版加入文本水印。那是一次真实的部署,而且它是一种与文风猜测完全不同性质的主张,因为那个信号是被刻意插入的,不是被推断出来的。

Google 自己讲出来的限制

同一份文档对什么会破坏它相当坦率。水印“在陈述事实的回复上效果较弱,因为在不降低准确性的前提下,可供增广生成的余地更少”,而检测器的“置信度分数在一段 AI 生成文本被彻底重写、或被翻译成另一种语言时,可能会大幅下降”。Google 还补充说,SynthID“并非设计用来直接阻止有动机的对手造成危害”。

还有一条平行的路线,走的是来源元数据而不是统计信号。目前版本为 2.4 的 C2PA Content Credentials 规范把一份经过密码学签名的清单绑定到一件作品上,记录它的来源以及施加于它的编辑。它明确是自愿加入的,全球采用是它写明的目标,而不是当下的状态。

两种方案共享同一条硬边界。它们能告诉你,某个参与其中的提供方生成了某个特定的字符串。对于不参与的提供方产出的东西,它们什么也告诉不了你;而且恰恰是一个认真的人无论如何都会做的那种重写,会削弱它们。水印是给运行模型的那一方的供应链管控。它不是审计陌生人文档的办法。

Google 会惩罚 AI 内容吗

Google 的立场发表于 2023 年 2 月,此后没有变过。那篇 Search Central 文章叫《Google 搜索关于 AI 生成内容的指南》,其中一节的标题是“奖励高质量内容,无论它是如何产生的”,而承重的那句话是这样的:“我们关注的是内容的质量,而不是内容的产生方式,多年来这条有用的准则一直帮助我们向用户提供可靠的优质结果。”

这篇文章还写道,“包括 AI 生成在内,并非所有对自动化的使用都是垃圾内容”,并指出自动化早就在生成体育比分、天气预报和文字记录。构成违规的,是把包括 AI 在内的自动化,主要用于操纵搜索结果排名。

真正会被惩罚的是什么

真正咬人的那条政策是大规模内容滥用。Google 把它定义为“为了操纵搜索排名而不是为了帮助用户,而生成大量页面”,针对的是“制作大量对用户几乎没有价值的非原创内容,无论它是如何创建的”。

最后那半句请读两遍。生产方式被明确地宣布为无关。用一个地名模板手工拼出来的 200 个单薄页面,违反这条政策的程度,跟模型拼出来的 200 个完全一样。Google 的生成式 AI 内容使用指南从另一侧说了同一件事:这项技术在调研和结构上是有用的,但把它用来“生成大量页面而没有为用户增加价值,可能违反 Google 关于大规模内容滥用的垃圾内容政策”。

所以并不存在什么需要去检测的 AI 处罚,也不存在 Google 会去参考的检测分数。分界线是目的和价值。一个回答了你的客户真正会问的问题、并且包含只有你的业务才知道的东西的页面,就算第一版草稿是模型写的,也不是滥用。

与其看分数,不如去量什么

我们自己的数字比讲道理更能说明问题。在最近一个 28 天的窗口里,本站从 Google 获得了 52,331 次展示,有 531 个查询词排在前十位。这 531 个查询词带来了 28,847 次展示和 161 次点击,点击率是 0.56%,而第四到第十位通常能拿到 2% 到 8%。其中有 452 个一次点击都没换到。

这里没有一件事是检测问题。这是差异化问题,而这个品类里没有任何一款工具在测量它。

值得盯住的指标是,相对于你所处位置的点击率,以及 AI 答案是引用了你、还是仅仅给你排了个名。这些我们在为什么内容有排名却从不被引用和Google AI 模式对你的流量意味着什么里讲过。接下来是随之而来的编辑决策:对什么具体问题都没回答的页面做内容修剪,对曾经回答过的页面做内容更新。一次技术性 SEO 审计会浮出同一幅图景中机械的那一半,也就是你在意的那些页面到底有没有资格被看见。

如果检测工具标记了你的作品该怎么办

分数不是证据

那个数字是一个模型对文风的意见,产生它的过程中没有接触到任何关于这段文本是如何写成的事实。这不是修辞,这就是它的设计。把这一点直说出来,并且引用经过同行评审的测试,而不是用你自己的信誉去论证,因为研究站在你这一边,而你的信誉正是眼下被质疑的东西。

你能自己掌握的来源记录

版本历史是你手上最强的东西,而它只有在你需要它之前就已经存在时才管用。把文档放在会记录修订的系统里,留住你的提纲和笔记,留住你读过的资料以及读它们的时间。一份在九天里经过四十次保存慢慢长出来的文档,比任何反向分数都是好得多的答案。

要求把同一款工具跑在你多年前、生成式 AI 还不存在时写的东西上。2026 年那项研究用的正是这样一组对照。也要问一问第二款工具是否给出同样的判断,因为工具与工具之间、以及同一款工具重复运行之间的不一致,在 2023 年那份基准测试里都有记录。如果英语不是你的第一语言,或者你用另一种语言起草再翻译,就把 61.3% 这个数字和翻译带来的 20 个百分点的损失,摆到做决定的人面前。

人性化工具,以及打败一场坏测试的经济账

为了打败一场在真正要紧的案例里已经错了 26% 到 58% 的测试而按月付订阅费,是一种糟糕的用钱方式;而且 2023 年那份基准测试还记录到,这个领域里有一款工具建议用户不断编辑文本,直到可检测的 AI 内容变少为止,这等于一个品类在反驳自己的前提。

除了这笔费用之外还有真实的代价。人性化处理靠增加词汇方差来奏效,落到实处就是同义词替换、模糊限定和被吹胀的句子。你最后是在为一台并不影响你排名的机器做优化,代价是那个真正决定要不要来问一问的人。如果你有这笔预算,请把它花在编辑身上。

代理商真正能加价值的地方

不在于绕开检测工具。真正改变结果的工作是编辑流程和可证明的专业性:一份主题简报,指出你的业务知道而竞争对手不知道的东西;一位有真实资历的署名作者;注明日期的引用来源;以及一道审校环节,由做过这件事的人来核对那些说法是不是真的。这套流程碰巧会让产出变得难以被检测,但那是副作用,不是目的。

Mecanik 就是按这个思路来搭建内容项目的,并通过我们的 SEO 审计服务来审视既有的项目,它的起点是你的页面现在挣到了什么,而不是它们是怎么写出来的。如果你的页面有排名却什么都没发生,要修的是具体性和权威性,而技术性 SEO 审计会告诉你,真正卡住你的是这两者中的哪一个。检测分数不会出现在报告里,因为它们没有测量任何你能据此行动的东西。如果你想先看更大的商业图景,我们那篇关于 AI SEO 代理商做什么、该付多少钱的指南讲了钱真正花到了哪里。



常见问题

AI 检测工具准确吗? 并不可靠。2023 年发表在 International Journal for Educational Integrity 的一项研究对 14 款工具做了 756 次单项测试,发现每一款的准确率都低于 80%,只有五款超过 70%。准确率在未经修改的 AI 文本上是 74%,在人类编辑过之后是 42%,在机器改写之后是 26%。2026 年 2 月一项针对 Turnitin 和 Originality 的研究得出的宏平均准确率分别是 0.61 和 0.69。

Google 会惩罚 AI 生成的内容吗? 不会。Google 公开的指南写明,它关注的是内容的质量而不是内容的产生方式,并且并非所有对自动化的使用都是垃圾内容。违反政策的是大规模内容滥用,即主要为了操纵排名而不是帮助用户去生成大量页面,Google 并说明这一条无论内容如何创建都适用。

为什么 AI 检测工具会标记非英语母语的写作者? 因为它们测量的是词汇变化和可预测性,而不是作者身份。2023 年发表在 Patterns 的一项研究把七款检测工具跑在非母语者写的 91 篇 TOEFL 作文上,记录到平均误判率 61.3%,而在美国八年级学生的作文上结果接近准确。把同样的作文用更书面化的语言重写之后,误判率降到了 11.6%。

AI 检测工具能看出文本是否经过人类编辑吗? 实际上不能,这是最大的缺口。在 2023 年那份基准测试里,对经过人类轻度编辑的 AI 文本,准确率是 42%;2026 年的一项研究发现,在大约一半人类、一半 AI 拼成的混合文档上召回率接近于零。关于改写的研究让一款检测工具在固定 1% 误判率下从 70.3% 跌到 4.6%。

如果我被错误地指控使用了 AI 该怎么办? 把分数当作关于文风的意见而不是证据,并引用已发表的研究把这一点讲出来。拿出你能自己掌握的来源记录:文档版本历史、草稿、笔记和带时间戳的资料。要求把同一款工具跑在生成式 AI 出现之前你写的作品上,并问一问第二款工具是否给出同样判断,因为工具之间的不一致是有记录的。