同一個小時裡,兩個截然不同的人在搜尋框裡打下 AI 檢測工具。一個是行銷經理,他發布了四十篇借助語言模型起草的頁面,並被告知 Google 會因此處罰這個網站。另一個則被指控作弊,只因為某款工具回傳了一個數字,而某位有權決定的人相信了它。

兩個人走到的是同一類軟體面前,這類軟體賣的是確信感,而兩個人都值得聽到那個不太舒服的答案。關於這些工具已經公開的證據是一致的,而且並不好看。它們出錯的頻率高到,一個分數永遠不該用來決定關於某個人的任何事;面對人類改寫過的文字,它們直接垮掉;而且它們的錯誤並不是平均分布在所有寫作者身上的。

搜尋引擎那個問題是另一個問題,有另一個答案,而那個答案跟檢測毫無關係。

這些工具準確嗎,Google 會處罰 AI 內容嗎。 經過同儕審查的測試顯示,所有工具的準確率都低於 80%,在經過改寫的 AI 文字上跌到 26%;另一項研究發現,檢測工具把非英語母語者寫的文章判為 AI 所寫的比例高達 61.3%。Google 不會因為內容由 AI 生成而處罰它。它處罰的是大規模內容濫用(scaled content abuse),那是關於目的和價值的問題,不是關於作者是誰的問題。


AI 檢測工具實際上是怎麼運作的

這個類別裡賣的幾乎所有東西都屬於兩個家族之一,而這個區分很重要,因為它們失敗的方式不一樣。

困惑度與突發性

較早的那一族測量的是文字本身的統計性質。困惑度描述的是,在給定前文的情況下,語言模型對每一個詞有多意外,所以模型覺得高度可預測的文字分數就低。突發性描述的是這種可預測性在句與句之間的起伏,其理論前提是,人類寫作會在平淡與古怪之間來回擺動,而生成的文字待在一條更窄的帶子裡。

這樣造出來的工具並不是在辨認機器。它是在測量這段文字有多循規蹈矩,然後斷言循規蹈矩的文字就是機器寫的文字。這個推論就是整個產品的全部,而所有的失效方式都從這裡來。

用生成文字訓練出來的分類器

較新的那一族,用人類文字與生成文字配對的語料去訓練一個模型,讓它學會區分兩者的任何特徵。在它訓練時所處的那個分布上,它比原始困惑度表現更好,同時它繼承了一個更難的問題:每當模型更新一次,或者提示詞換了一種語域,那個分布就會移動。

兩族都拿不到任何一條關於這段文字是如何產生的事實。兩者都是從成品去猜測文風,這正是為什麼改一改文風就能讓它們失效。第三條路線是浮水印,它的運作方式不同,放在後面談,因為它是唯一一種從證據出發而不是從推論出發的方法。

關於 AI 檢測工具準確率,研究到底說了什麼

十四款工具的基準測試

被引用最多的對照測試,是 2023 年發表在 International Journal for Educational Integrity 上的《AI 生成文字檢測工具的測試》。Weber-Wulff 和同事把 54 份測試文件送進 14 款工具,其中 12 款免費、2 款商用(Turnitin 和 PlagiarismCheck),共完成 756 次個別測試。

結果毫不客氣。每一款工具的準確率都低於 80%,只有五款超過 70%。在真正由人類撰寫的文件上,準確率是 96%,單看這一條還不錯,但看完剩下的就不然了。在未經修改的 AI 文字上是 74%。在人類輕度編輯過的 AI 文字上是 42%。在經過改寫工具處理的 AI 文字上是 26%。

論文寫明,它的發現「與某些 AI 生成文字檢測工具所宣稱的內容存在實質差異」,而它自己的結論被引用的次數遠遠不夠:這些工具「既不準確也不可靠」,而且「我們測試的這些系統不應在學術場合中使用」。

一項檢驗商用主力產品的 2026 年研究

三年之後,同一份期刊在 2026 年 2 月發表的一項研究用一組均衡的 192 份文字檢驗了 Turnitin 和 Originality。這組文字包括生成式 AI 尚未普及之前產生的真實學生寫作、專業的人類寫作、AI 輸出,以及大約各占一半拼成的混合文件。

Originality 的宏平均準確率是 0.69,Turnitin 是 0.61,兩者的宏平均 F1 分數都低於 0.55。在混合文字上,也就是今天大多數人真正的寫作方式,Originality 的召回率接近於零。它幾乎一份都沒認出來。

領域落差才是所有在發布技術內容的人應該擔心的那個發現。Turnitin 的準確率從人文類文字上的 0.86 跌到科學類文字上的 0.51。Originality 從 0.96 跌到 0.58。兩個差異在統計上都顯著。在科學寫作上做到 0.51,一款檢測工具做的事已經接近擲硬幣。

唯一一家公布了自己失敗的廠商

OpenAI 在 2023 年 1 月推出了一個分類器,隨後又把它撤了下來。它自己的公告頁面如今掛著這樣一條說明:「自 2023 年 7 月 20 日起,AI 分類器因準確率過低而不再提供」,而原文裡的數字仍然留著:它「把 AI 所寫文字中的 26% 正確辨識為很可能由 AI 撰寫,同時有 9% 的機率把人類撰寫的文字錯誤標示為 AI 撰寫」。該頁面還警告說,它「不應被用作主要的決策工具」。這是全世界最有條件接觸到訓練分布的那個機構,報出來的真陽性率大約是四分之一。

誤判問題,以及它落在誰身上

TOEFL 研究

由 Liang、Yuksekgonul、Mao、Wu 和 Zou 撰寫的《GPT 檢測工具對非英語母語寫作者存在偏見》於 2023 年發表在期刊 Patterns 上。方法很簡單:把七款廣泛使用的檢測工具跑在非英語母語者寫的 91 篇 TOEFL 作文和美國八年級學生寫的 88 篇作文上。

對美國學童的作文,這些檢測工具處理得很準確。在 TOEFL 作文上,平均誤判率是 61.3%。這些由人類撰寫的作文裡,有 19.8% 被全部七款工具一致判定為 AI 所寫,有 97.8% 至少被其中一款判定。

接著研究者做了那個把底牌掀開的動作。他們讓同樣的作文用更書面的語言重寫一遍,平均誤判率就從 61.3% 降到了 11.6%。

為什麼錯誤偏偏落在這裡

這個下降精確地指出了被測量的到底是什麼。這些工具檢測到的是詞彙變化的貧乏,而那是用第二語言寫作時的一種性質,它們卻把它報告成機器撰寫。2023 年那份基準測試從另一個方向發現了同一效應:人類撰寫、再由機器翻譯成英語的文字,準確率損失了 20 個百分點,所以一位用母語起草再翻譯的研究者,被冤枉的風險就此升高。

接下來的結論不是一道需要斟酌的題目。一款在某個可辨認的寫作者群體上誤判率達到 61.3% 的工具,絕不可以用來對一個人做出有後果的判斷。2023 年那篇論文把它的實務含意說得很好:這些工具回傳的是一個不附帶任何證據的百分比,因此僅憑這一點被指控的學生「將沒有任何辯護的可能」。

為什麼編輯一遍就能讓 AI 檢測工具失效

最清楚的實驗,是 Krishna、Song、Karpinska、Wieting 和 Iyyer 的《改寫可以躲開 AI 生成文字的檢測工具》。他們造了一個名為 DIPPER 的 110 億參數改寫模型,把生成文字推過去。在固定 1% 誤判率的條件下,DetectGPT 的檢測準確率從 70.3% 跌到 4.6%。浮水印、GPTZero 和 OpenAI 的分類器同樣被躲了過去。

請認真對待它的推論,因為那是對整個類別最誠實的總結。如果未編輯的輸出被檢出率是 74%,編輯過的是 42%,那麼這些工具穩定辨識出來的東西並不是機器撰寫。是馬虎。從聊天視窗直接貼出來的頁面會被標記。同一個頁面,在一位稱職的編輯砍掉三分之一、補進兩條只有作者才知道的具體資訊、並重寫了開頭之後,就不會被標記。檢測工具是投入程度的替代指標,而且是個很差的替代指標。

Krishna 那篇論文提出的防禦手段值得記下來,因為它根本不是檢測。它是檢索:在一個包含 1500 萬條既往生成序列的資料庫裡搜尋近似匹配,在只誤標 1% 人類文字的水準上,抓到了 80% 到 97% 被改寫過的生成內容。它之所以有效,是因為它比對的是真實產生過什麼的紀錄。它同樣要求模型提供方保存那份紀錄並執行這項核對,而這是任何公開工具都做不到的。

浮水印,技術上更認真的替代方案

它有什麼不同

浮水印是在生成的那一刻介入,而不是事後去猜。Google DeepMind 面向文字的 SynthID 以 logits 處理器的身分坐在取樣迴圈裡,用 Google 自己的說法,它「使用一個偽隨機 g 函數來增廣模型的 logits,從而以一種能幫助你判斷這段文字是否由你的模型生成、又不顯著影響文字品質的方式,把浮水印資訊編碼進去」。開發者文件描述了一個貝氏檢測器,它會回傳三種狀態之一:有浮水印、無浮水印,或不確定。

Google 在 2024 年 5 月宣布為 Gemini 應用程式和網頁版加入文字浮水印。那是一次真實的部署,而且它是一種與文風猜測完全不同性質的主張,因為那個訊號是被刻意插入的,不是被推論出來的。

Google 自己講出來的限制

同一份文件對什麼會破壞它相當坦率。浮水印「在陳述事實的回覆上效果較弱,因為在不降低準確性的前提下,可供增廣生成的餘地更少」,而檢測器的「信心分數在一段 AI 生成文字被徹底重寫、或被翻譯成另一種語言時,可能會大幅下降」。Google 還補充說,SynthID「並非設計用來直接阻止有動機的對手造成傷害」。

還有一條平行的路線,走的是來源中繼資料而不是統計訊號。目前版本為 2.4 的 C2PA Content Credentials 規範把一份經過密碼學簽章的清單綁定到一件作品上,記錄它的來源以及施加於它的編輯。它明確是自願加入的,全球採用是它寫明的目標,而不是當下的狀態。

兩種方案共享同一條硬邊界。它們能告訴你,某個參與其中的提供方生成了某個特定的字串。對於不參與的提供方產出的東西,它們什麼也告訴不了你;而且恰恰是一個認真的人無論如何都會做的那種重寫,會削弱它們。浮水印是給執行模型的那一方的供應鏈管控。它不是稽核陌生人文件的辦法。

Google 會處罰 AI 內容嗎

Google 的立場發表於 2023 年 2 月,此後沒有變過。那篇 Search Central 文章叫《Google 搜尋關於 AI 生成內容的指南》,其中一節的標題是「獎勵高品質內容,無論它是如何產生的」,而承重的那句話是這樣的:「我們關注的是內容的品質,而不是內容的產生方式,多年來這條有用的準則一直幫助我們向使用者提供可靠的優質結果。」

這篇文章還寫道,「包括 AI 生成在內,並非所有對自動化的使用都是垃圾內容」,並指出自動化早就在產生體育比分、天氣預報和逐字稿。構成違規的,是把包括 AI 在內的自動化,主要用於操縱搜尋結果排名。

真正會被處罰的是什麼

真正咬人的那條政策是大規模內容濫用。Google 把它定義為「為了操縱搜尋排名而不是為了幫助使用者,而產生大量頁面」,針對的是「製作大量對使用者幾乎沒有價值的非原創內容,無論它是如何建立的」。

最後那半句請讀兩遍。生產方式被明確地宣告為無關。用一個地名範本手工拼出來的 200 個單薄頁面,違反這條政策的程度,跟模型拼出來的 200 個完全一樣。Google 的生成式 AI 內容使用指南從另一側說了同一件事:這項技術在調查和結構上是有用的,但把它用來「產生大量頁面而沒有為使用者增加價值,可能違反 Google 關於大規模內容濫用的垃圾內容政策」。

所以並不存在什麼需要去檢測的 AI 處罰,也不存在 Google 會去參考的檢測分數。分界線是目的和價值。一個回答了你的客戶真正會問的問題、並且包含只有你的業務才知道的東西的頁面,就算第一版草稿是模型寫的,也不是濫用。

與其看分數,不如去量什麼

我們自己的數字比講道理更能說明問題。在最近一個 28 天的區間裡,本站從 Google 獲得了 52,331 次曝光,有 531 個查詢字詞排在前十名。這 531 個查詢字詞帶來了 28,847 次曝光和 161 次點擊,點擊率是 0.56%,而第四到第十名通常能拿到 2% 到 8%。其中有 452 個一次點擊都沒換到。

這裡沒有一件事是檢測問題。這是差異化問題,而這個類別裡沒有任何一款工具在測量它。

值得盯住的指標是,相對於你所處名次的點擊率,以及 AI 答案是引用了你、還是僅僅給你排了個名。這些我們在為什麼內容有排名卻從不被引用和Google AI 模式對你的流量意味著什麼裡談過。接下來是隨之而來的編輯決策:對什麼具體問題都沒回答的頁面做內容修剪,對曾經回答過的頁面做內容更新。一次技術性 SEO 稽核會浮出同一幅圖景中機械的那一半,也就是你在意的那些頁面到底有沒有資格被看見。

如果檢測工具標記了你的作品該怎麼辦

分數不是證據

那個數字是一個模型對文風的意見,產生它的過程中沒有接觸到任何關於這段文字是如何寫成的事實。這不是修辭,這就是它的設計。把這一點直說出來,並且引用經過同儕審查的測試,而不是用你自己的信譽去論證,因為研究站在你這一邊,而你的信譽正是眼下被質疑的東西。

你能自己掌握的來源紀錄

版本歷史是你手上最強的東西,而它只有在你需要它之前就已經存在時才管用。把文件放在會記錄修訂的系統裡,留住你的大綱和筆記,留住你讀過的資料以及讀它們的時間。一份在九天裡經過四十次儲存慢慢長出來的文件,比任何反向分數都是好得多的答案。

要求把同一款工具跑在你多年前、生成式 AI 還不存在時寫的東西上。2026 年那項研究用的正是這樣一組對照。也要問一問第二款工具是否給出同樣的判斷,因為工具與工具之間、以及同一款工具重複執行之間的不一致,在 2023 年那份基準測試裡都有紀錄。如果英語不是你的第一語言,或者你用另一種語言起草再翻譯,就把 61.3% 這個數字和翻譯帶來的 20 個百分點的損失,擺到做決定的人面前。

人性化工具,以及打敗一場壞測試的經濟帳

為了打敗一場在真正要緊的案例裡已經錯了 26% 到 58% 的測試而按月付訂閱費,是一種糟糕的用錢方式;而且 2023 年那份基準測試還記錄到,這個領域裡有一款工具建議使用者不斷編輯文字,直到可檢測的 AI 內容變少為止,這等於一個類別在反駁自己的前提。

除了這筆費用之外還有真實的代價。人性化處理靠增加詞彙變異來奏效,落到實處就是同義詞替換、模糊限定和被吹脹的句子。你最後是在為一台並不影響你排名的機器做最佳化,代價是那個真正決定要不要來問一問的人。如果你有這筆預算,請把它花在編輯身上。

代理商真正能加價值的地方

不在於繞開檢測工具。真正改變結果的工作是編輯流程和可證明的專業性:一份主題簡報,指出你的業務知道而競爭對手不知道的東西;一位有真實資歷的署名作者;註明日期的引用來源;以及一道審稿環節,由做過這件事的人來核對那些說法是不是真的。這套流程碰巧會讓產出變得難以被檢測,但那是副作用,不是目的。

Mecanik 就是按這個思路來搭建內容專案的,並透過我們的 SEO 稽核服務來檢視既有的專案,它的起點是你的頁面現在賺到了什麼,而不是它們是怎麼寫出來的。如果你的頁面有排名卻什麼都沒發生,要修的是具體性和權威性,而技術性 SEO 稽核會告訴你,真正卡住你的是這兩者中的哪一個。檢測分數不會出現在報告裡,因為它們沒有測量任何你能據此行動的東西。如果你想先看更大的商業圖景,我們那篇關於 AI SEO 代理商做什麼、該付多少錢的指南講了錢真正花到了哪裡。



常見問題

AI 檢測工具準確嗎? 並不可靠。2023 年發表在 International Journal for Educational Integrity 的一項研究對 14 款工具做了 756 次個別測試,發現每一款的準確率都低於 80%,只有五款超過 70%。準確率在未經修改的 AI 文字上是 74%,在人類編輯過之後是 42%,在機器改寫之後是 26%。2026 年 2 月一項針對 Turnitin 和 Originality 的研究得出的宏平均準確率分別是 0.61 和 0.69。

Google 會處罰 AI 生成的內容嗎? 不會。Google 公開的指南寫明,它關注的是內容的品質而不是內容的產生方式,而且並非所有對自動化的使用都是垃圾內容。違反政策的是大規模內容濫用,也就是主要為了操縱排名而不是幫助使用者去產生大量頁面,Google 並說明這一條無論內容如何建立都適用。

為什麼 AI 檢測工具會標記非英語母語的寫作者? 因為它們測量的是詞彙變化和可預測性,而不是作者身分。2023 年發表在 Patterns 的一項研究把七款檢測工具跑在非母語者寫的 91 篇 TOEFL 作文上,記錄到平均誤判率 61.3%,而在美國八年級學生的作文上結果接近準確。把同樣的作文用更書面的語言重寫之後,誤判率降到了 11.6%。

AI 檢測工具能看出文字是否經過人類編輯嗎? 實際上不能,這是最大的缺口。在 2023 年那份基準測試裡,對經過人類輕度編輯的 AI 文字,準確率是 42%;2026 年的一項研究發現,在大約一半人類、一半 AI 拼成的混合文件上召回率接近於零。關於改寫的研究讓一款檢測工具在固定 1% 誤判率下從 70.3% 跌到 4.6%。

如果我被錯誤地指控使用了 AI 該怎麼辦? 把分數當作關於文風的意見而不是證據,並引用已發表的研究把這一點講出來。拿出你能自己掌握的來源紀錄:文件版本歷史、草稿、筆記和帶時間戳記的資料。要求把同一款工具跑在生成式 AI 出現之前你寫的作品上,並問一問第二款工具是否給出同樣判斷,因為工具之間的不一致是有紀錄的。