Anthropic 的 Claude Opus 5.5 幾乎已經不再使用 em dash,也就是那個被視為機器文章代號的標點符號。研究公司 Graphite 在 10 月 1 日發表的追蹤研究中,測得這個模型每 1000 字只用 0.015 個 em dash,Opus 5 則是 2.92 個,降幅達 99%。然而模型指紋的其餘部分幾乎原封不動地留了下來。
重點摘要
- Opus 5.5 每 1000 字使用 0.015 個 em dash,Opus 5 為 2.92 個,減少 99%。
- Graphite 仍從 Opus 5.5 的輸出中數出 2548 個不同痕跡,只比在 Opus 5 找到的 2666 個少 4%。
- 相較於 ChatGPT 問世前寫成的文章語料,「this matters」這個說法在 Opus 5.5 的文字裡出現頻率高出 116 倍。
Graphite 把痕跡定義為模型使用頻率至少是人類寫作者兩倍的詞彙、片語或句型。依此標準,Opus 5.5 帶有 2548 個痕跡,比 Opus 5 的 2666 個下降。刪掉 AI 文字中最容易辨認的那個習慣,總數只移動了百分之四。
哪些說法會讓 Opus 5.5 露餡
這份研究最突出的單一詞彙是「dependable」,Opus 5.5 使用它的頻率是人類對照組的 23 倍。它最強烈的結構性習慣,則是強調事情有多重要的衝動:「this matters」的出現頻率是人類文本的 116 倍,「why _ matters」這個句型則是 92 倍。
這個模型也放棄了定義早期 Claude 版本的「it's not X, it's Y」句構。Graphite 的首席 AI 官 Gregory Druck 向 TechCrunch 表示,取而代之的是一個近親:模型現在偏好說某件事不只是 X,而是 Y。
Graphite 怎麼建立語料庫
方法來自 Graphite 的 9 月 16 日報告:先蒐集 ChatGPT 發布前刊出的 1 萬篇文章作為人類基準,再讓九個前沿大型語言模型依摘要重寫每一篇。這產生了 9 萬篇主題相互對應的機器文章,從而剔除了干擾多數文體比較的主題偏差。
比較經長度正規化的使用率後,在九個模型中浮現 1 萬 2877 個獨特痕跡,各模型的數量落在 2355 到 3746 個之間,其中約 65% 只屬於單一模型家族。其他指標同樣把兩群文字分得乾淨:AI 文章平均每個詞 5.2 至 5.7 個字元,人類為 4.9 個,而 AI 的句長變化幅度小得多。
對手模型留下的印記
OpenAI 的 GPT-6 Astra 倚重更正式的對照句法,用「not simply X」或「rather than relying on X」之類結構,以「不是什麼」來界定主題。Graphite 測得這個習慣約為人類頻率的 12 倍。Google 的 Gemini 3.1 Pro 則偏好「absolutely」、「highly」這類強化語,頻率是人類的 13 倍,同時也愛用「furthermore」等正式轉折詞。
在 Graphite 的文風造作程度評分上,Opus 5 與 Gemini 3.1 Pro 落在人類基準的 2.5 倍附近,Astra 為 1.2 倍。Opus 5.5 把自己的分數從 16.75 壓到 10.57,降了 37%,但仍約為人類的 1.6 倍。它的整體用詞分布也朝人類文本靠近,單元詞差異值從 0.064 降到 0.052。
痕跡為何總會回來
Druck 向 TechCrunch 表示,Claude 的用詞分布隨著版本更迭愈來愈靠近人類寫作,OpenAI 的模型卻愈走愈遠。他還說痕跡的總數是持平而非下降:實驗室剔掉最廣為人知的那些,新的習慣就在原處冒出來,而且每一版都不一樣。他把這歸因於規模,主張擁有數十億參數的模型會跑在實驗室出貨前所能執行的任何有限測試之前。
兩家實驗室都曾宣稱自己正是在這一點上有進展。Anthropic 在 Opus 5.5 的公告中說,這個模型的溝通比前幾代更自然,早期使用者認為它的文字更清楚、更好跟上。OpenAI 也為 GPT-6 版本的 Sol 與 Luna 提出類似說法,承諾更清晰、更少術語、更少怪異的措辭。
這對 AI 偵測意味著什麼
對出版方與偵測業者來說,實際教訓是單一訊號的捷思法老得很快:任何痕跡一旦有名到堪用,也就有名到會在後訓練階段被磨掉。Graphite 表示痕跡資料與原始文章語料都可下載,這等於給分類器開發者一份各模型的詞彙表,也給實驗室一張檢查清單。本報先前關於 Pew 發現 ChatGPT 之後刊出的網頁有 35% 帶有 AI 撰寫跡象 的報導,顯示這個問題如今覆蓋了多少文字。
FAQ 常見問題
em dash 還是可靠的 AI 偵測訊號嗎?
不是。Graphite 測得 Opus 5.5 每 1000 字只用 0.015 個 em dash,比 Opus 5 低 99%,並發現 Gemini 3.1 Pro 也幾乎不再用這個符號。GPT-6 Astra 的使用頻率比 ChatGPT 之前的人類語料低 88%。如今它的缺席比它的出現更能說明近期的訓練方式。
Graphite 總共找到多少 AI 寫作痕跡?
9 月的報告在九個模型中辨識出 1 萬 2877 個獨特詞彙、片語與句型,AI 使用它們的頻率至少是人類的兩倍。各模型分別為 2355 到 3746 個,其中約 65% 只出現在單一模型家族。
這些資料可以獨立查核嗎?
可以。Graphite 表示痕跡資料與原始文章語料都能從報告頁面下載。10 月的追蹤研究把同一套方法套用在 Claude Opus 5.5 上,並列出各個說法相對於人類基準的倍率。






