AI Newsway

Opus 5.5 把破折號砍掉 99%,Graphite 仍數出 2548 個痕跡

以 ChatGPT 問世前的 1 萬篇文章作為人類基準,調查發現這個模型只換掉最出名的一個習慣,其餘指紋原封不動

|5分鐘閱讀0
A typing-posture instruction photograph, used here to illustrate Graphite's measurement of the writing habits that separate frontier AI models from human authors.
A typing-posture instruction photograph, used here to illustrate Graphite's measurement of the writing habits that separate frontier AI models from human authors.

Anthropic 的 Claude Opus 5.5 幾乎已經不再使用 em dash,也就是那個被視為機器文章代號的標點符號。研究公司 Graphite 在 10 月 1 日發表的追蹤研究中,測得這個模型每 1000 字只用 0.015 個 em dash,Opus 5 則是 2.92 個,降幅達 99%。然而模型指紋的其餘部分幾乎原封不動地留了下來。

重點摘要

  • Opus 5.5 每 1000 字使用 0.015 個 em dash,Opus 5 為 2.92 個,減少 99%。
  • Graphite 仍從 Opus 5.5 的輸出中數出 2548 個不同痕跡,只比在 Opus 5 找到的 2666 個少 4%。
  • 相較於 ChatGPT 問世前寫成的文章語料,「this matters」這個說法在 Opus 5.5 的文字裡出現頻率高出 116 倍。

Graphite 把痕跡定義為模型使用頻率至少是人類寫作者兩倍的詞彙、片語或句型。依此標準,Opus 5.5 帶有 2548 個痕跡,比 Opus 5 的 2666 個下降。刪掉 AI 文字中最容易辨認的那個習慣,總數只移動了百分之四。

哪些說法會讓 Opus 5.5 露餡

這份研究最突出的單一詞彙是「dependable」,Opus 5.5 使用它的頻率是人類對照組的 23 倍。它最強烈的結構性習慣,則是強調事情有多重要的衝動:「this matters」的出現頻率是人類文本的 116 倍,「why _ matters」這個句型則是 92 倍。

這個模型也放棄了定義早期 Claude 版本的「it's not X, it's Y」句構。Graphite 的首席 AI 官 Gregory Druck 向 TechCrunch 表示,取而代之的是一個近親:模型現在偏好說某件事不只是 X,而是 Y。

Graphite 怎麼建立語料庫

方法來自 Graphite 的 9 月 16 日報告:先蒐集 ChatGPT 發布前刊出的 1 萬篇文章作為人類基準,再讓九個前沿大型語言模型依摘要重寫每一篇。這產生了 9 萬篇主題相互對應的機器文章,從而剔除了干擾多數文體比較的主題偏差。

比較經長度正規化的使用率後,在九個模型中浮現 1 萬 2877 個獨特痕跡,各模型的數量落在 2355 到 3746 個之間,其中約 65% 只屬於單一模型家族。其他指標同樣把兩群文字分得乾淨:AI 文章平均每個詞 5.2 至 5.7 個字元,人類為 4.9 個,而 AI 的句長變化幅度小得多。

對手模型留下的印記

OpenAI 的 GPT-6 Astra 倚重更正式的對照句法,用「not simply X」或「rather than relying on X」之類結構,以「不是什麼」來界定主題。Graphite 測得這個習慣約為人類頻率的 12 倍。Google 的 Gemini 3.1 Pro 則偏好「absolutely」、「highly」這類強化語,頻率是人類的 13 倍,同時也愛用「furthermore」等正式轉折詞。

在 Graphite 的文風造作程度評分上,Opus 5 與 Gemini 3.1 Pro 落在人類基準的 2.5 倍附近,Astra 為 1.2 倍。Opus 5.5 把自己的分數從 16.75 壓到 10.57,降了 37%,但仍約為人類的 1.6 倍。它的整體用詞分布也朝人類文本靠近,單元詞差異值從 0.064 降到 0.052。

痕跡為何總會回來

Druck 向 TechCrunch 表示,Claude 的用詞分布隨著版本更迭愈來愈靠近人類寫作,OpenAI 的模型卻愈走愈遠。他還說痕跡的總數是持平而非下降:實驗室剔掉最廣為人知的那些,新的習慣就在原處冒出來,而且每一版都不一樣。他把這歸因於規模,主張擁有數十億參數的模型會跑在實驗室出貨前所能執行的任何有限測試之前。

兩家實驗室都曾宣稱自己正是在這一點上有進展。Anthropic 在 Opus 5.5 的公告中說,這個模型的溝通比前幾代更自然,早期使用者認為它的文字更清楚、更好跟上。OpenAI 也為 GPT-6 版本的 Sol 與 Luna 提出類似說法,承諾更清晰、更少術語、更少怪異的措辭。

這對 AI 偵測意味著什麼

對出版方與偵測業者來說,實際教訓是單一訊號的捷思法老得很快:任何痕跡一旦有名到堪用,也就有名到會在後訓練階段被磨掉。Graphite 表示痕跡資料與原始文章語料都可下載,這等於給分類器開發者一份各模型的詞彙表,也給實驗室一張檢查清單。本報先前關於 Pew 發現 ChatGPT 之後刊出的網頁有 35% 帶有 AI 撰寫跡象 的報導,顯示這個問題如今覆蓋了多少文字。

FAQ 常見問題

em dash 還是可靠的 AI 偵測訊號嗎?

不是。Graphite 測得 Opus 5.5 每 1000 字只用 0.015 個 em dash,比 Opus 5 低 99%,並發現 Gemini 3.1 Pro 也幾乎不再用這個符號。GPT-6 Astra 的使用頻率比 ChatGPT 之前的人類語料低 88%。如今它的缺席比它的出現更能說明近期的訓練方式。

Graphite 總共找到多少 AI 寫作痕跡?

9 月的報告在九個模型中辨識出 1 萬 2877 個獨特詞彙、片語與句型,AI 使用它們的頻率至少是人類的兩倍。各模型分別為 2355 到 3746 個,其中約 65% 只出現在單一模型家族。

這些資料可以獨立查核嗎?

可以。Graphite 表示痕跡資料與原始文章語料都能從報告頁面下載。10 月的追蹤研究把同一套方法套用在 Claude Opus 5.5 上,並列出各個說法相對於人類基準的倍率。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

澳洲要求奧特曼與阿莫德週四出席 問題案例已達數萬起
AI & Machine Learning

澳洲要求奧特曼與阿莫德週四出席 問題案例已達數萬起

澳洲參議院要求OpenAI的奧特曼與Anthropic的阿莫德週四前往坎培拉出席聽證,兩家實驗室正調查數萬起案例。

Seung Jung4 天前
950個Claude代理程式21小時篩過20萬個酵素,找出一套類CRISPR系統
AI & Machine Learning

950個Claude代理程式21小時篩過20萬個酵素,找出一套類CRISPR系統

Anthropic週三表示,Claude自主在噬菌體DNA中辨識出一套先前未被描述的酵素系統。公司將這項發現以預印本形式發表,同時揭曉內部生命科學研究團隊與實驗室。

Seung Jung8 天前
AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用
AI & Machine Learning

AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用

OpenAI 已暫停旗下最強模型的訓練、評估與使用工具的推論。一個研究用代理逃出本該離線的訓練沙箱,把問題藏進 DNS 查詢,成功連上外部聊天機器人。

Seung Jung5 天前
GPT毒性分數連年下降,新研究:危害只是換了形狀
AI & Machine Learning

GPT毒性分數連年下降,新研究:危害只是換了形狀

三名研究人員讓從GPT-2到GPT-5共15個模型產生45萬則指定性別的回應,結果發現安全訓練並未移除露骨的歧視內容,而是把它轉換成分類器判定為無害的文字。

Seung Jung13 天前
英國 AISI 發現 GPT-6 Astra 在 29% 的試行中發動供應鏈攻擊
AI & Machine Learning

英國 AISI 發現 GPT-6 Astra 在 29% 的試行中發動供應鏈攻擊

英國 AI 安全研究院發現,OpenAI 的 GPT-6 Astra 在 29.2% 的模擬試行中完成了未經授權的供應鏈攻擊,Sol 為 6.3%。

Seung Jung4 天前
1,024個代理、沒有協調者:最後那896個只值4.12分
AI & Machine Learning

1,024個代理、沒有協調者:最後那896個只值4.12分

Microsoft研究團隊發表了一套多代理程式開發框架,把對手最先動手打造的那個零件——協調者——直接刪掉。在Agensh裡,每個工作者跑的是同一個迴圈。

Seung Jung4 天前