AI Newsway

微軟內部備忘錄:AI 訓練是「人類史上最大規模的勞動竊取」

《紐約時報》訴訟解封的文件,把微軟與 OpenAI 內部對付費牆、替代效應與媒體損害的坦白說法留在紀錄上

|5分鐘閱讀0
The New York Times copyright case against OpenAI and Microsoft has entered its third year, with newly unsealed filings quoting internal company documents.
The New York Times copyright case against OpenAI and Microsoft has entered its third year, with newly unsealed filings quoting internal company documents.

《紐約時報》將近三年前對 OpenAI 與微軟提起的著作權訴訟,最新解封的文件裡出現了兩家公司公開書狀從未寫下的東西:自家員工用最直白的說法描述這項作法。在 2023 年 1 月的一份內部備忘錄中,微軟應用科學總監布倫特·赫克特(Brent Hecht)把用抓取而來的作品訓練 AI 稱為「規模空前的驚人竊取」,也說那是「人類史上最大規模的勞動竊取」。這些引述於週四曝光,由 TechCrunch 率先報導

以下內容都要放在一個前提下看。新曝光的文字多半出自原告自己的書狀,而非底層證物,證物仍處於封存狀態,因此這些摘句都脫離了當初書寫的脈絡。相關指控尚未經過審判檢驗。

重點摘要

  • 依解封書狀,2023 年 1 月的微軟備忘錄把以抓取內容訓練 AI 形容為人類史上最大規模的勞動竊取。
  • 微軟自家數據顯示,Copilot 相較於傳統 Bing 搜尋,讓 nytimes.com 的點擊率最多下滑 93%,內部簡報稱這是一個「末日循環」。
  • 書狀指出,OpenAI 的中期訓練資料集收錄三家新聞原告的作品副本超過 9 萬 1,692 份,另一個共用資料集則至少含 16 萬 903 件獨立作品。

內部說法為何具有法律份量

法院大致上願意接受「以受著作權保護的文字訓練模型屬於合理使用」這項主張,川普政府本月稍早也遞交書狀,支持 OpenAI 未經授權使用受保護素材。不過合理使用的判斷有一部分取決於新產品是否在市場上替代了原作,而解封的說法正好打在這個要害上。

OpenAI 的 ChatGPT 負責人尼克·特利(Nick Turley)被引述指出,這類產品大體上具有替代性,對媒體構成生存威脅,而且照他的說法,產品愈進步、替代性就愈強。總裁葛雷格·布洛克曼(Greg Brockman)則說模型在新聞上表現極佳。微軟執行長薩蒂亞·納德拉(Satya Nadella)在宣誓作證時同意,與聊天機器人對話等於由 AI 平台直接提供資訊,而不是把讀者送往原始來源。這些都讀不出轉化,讀到的是取代。

書狀附上的流量數字讓論點更銳利。原告主張,微軟內部量測顯示 Copilot 回答引擎相較一般 Bing 搜尋,把《紐約時報》網域的點擊率壓低了最多 93%。赫克特在 2024 年 1 月的一份簡報把這個機制描述成末日循環,會同時傷害模型與更廣的網路生態。

終端產品威脅到其關鍵供應者的經濟基礎,是非常不尋常的事;但我們的 LLM 業務對它的「內容供應鏈」,正是造成了這樣的局面。

規模與抄捷徑

書狀也替複製行為附上數字。文件主張,光是 OpenAI 的中期訓練資料集就收錄《紐約時報》、《紐約每日新聞》與調查報導中心的作品副本逾 9 萬 1,692 份,另一個源自 Common Crawl 的資料集則含有超過兩百萬份來自 nytimes.com 的文件。資料在兩家夥伴之間雙向流動:OpenAI 據稱把整套 GPT-3 訓練資料交給微軟,微軟則透過代號「Project Taxi」與「Project Mango」的專案提供資料。Mango 資料集據稱蒐集了新聞原告至少 16 萬 903 件獨立作品。

殺傷力最強的段落談的是意圖而非數量。書狀描述 OpenAI 員工討論如何在不被偵測的情況下繞過《紐約時報》的付費牆——研究員尼克·萊德(Nick Ryder)提出,布洛克曼表示贊同——並指控訓練資料中的著作權標示遭到刻意移除,好讓模型不會重現這些標示。納德拉作證說,任何人若要把付費牆內的素材用於訓練或接地,都應該取得授權;他並表示,若早知道 OpenAI 抓取付費牆後的內容,他會行使微軟要求重新訓練模型的權利。

接下來會怎麼走

《紐約每日新聞》的代理律師說,這些證據首次顯示兩家公司都知道這種作法不對。微軟與 OpenAI 都未回應置評請求。這些引述在對照封存的原始脈絡後是否站得住腳,將決定它們的份量,而證物本身目前仍未解封。

這次揭露的時間點,正逢業界透過公開的同意標準、而非訴訟來處理同一個問題,微軟也是近期簽署 Cloudflare 爬蟲規則的企業之一。書狀多補上的一塊,是證明大型語言模型所需的網路爬取在經濟上如何運作,公司內部早就心知肚明,而且在公開爭論開始的好幾年前,就已用不怎麼好聽的字眼寫了下來。

FAQ — 常見問題

這次解封的究竟是什麼?

是《紐約時報》在對 OpenAI 與微軟的著作權訴訟中所提書狀被解除遮蔽的部分,內容引用了內部備忘錄、簡報與證詞。引述所依據的證物仍處於封存狀態,因此這些摘句是脫離原始脈絡出現的。

這是否就確定了合理使用的爭點?

沒有。法官大致接受模型訓練可能構成合理使用,而本案也尚未進入審判。解封說法之所以重要,是因為合理使用要衡量產品是否替代原作,而多位被引述的高層描述的正是這種替代。

微軟與 OpenAI 回應了嗎?

兩家公司都未回覆對解封文件的置評請求。書狀中的指控是原告對證據的詮釋,尚未經過裁判認定。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI 稱自研模型將 Jalapeño 設計週期壓縮至九個月
Tech & Business

OpenAI 稱自研模型將 Jalapeño 設計週期壓縮至九個月

AI 生成的核心比 OpenAI 專家手寫版本快出最多 1.8 倍,Jalapeño 首次公佈 InferenceX 基準測試結果。

Seung Jung23 天前
ChatGPT編造假證人,新墨西哥州最高法院罰律師5000美元
Tech & Business

ChatGPT編造假證人,新墨西哥州最高法院罰律師5000美元

新墨西哥州最高法院因ChatGPT在上訴狀中編造證人和警方證詞,對律師Stephen Aarons處以5000美元罰款並認定其藐視法庭。

Seung Jung6 天前
華盛頓1美元的ChatGPT協議到期,接替者按令牌計費
Tech & Business

華盛頓1美元的ChatGPT協議到期,接替者按令牌計費

OpenAI新的27個月GSA協議免除每席15美元許可費並將令牌費率減半,但自10月1日起把每年1美元的固定收費改為計量計費。

Seung Jung5 天前
輝達砸下270億美元,卻沒提交過一份併購申報。司法部要問個明白
Tech & Business

輝達砸下270億美元,卻沒提交過一份併購申報。司法部要問個明白

反壟斷執法者首次真正審視這種在AI領域取代了收購的交易結構:輝達已收到司法部的正式資料索取要求。

Seung Jung5 天前
保密版S-1已在案,奧爾特曼仍排除OpenAI在2026年上市
Tech & Business

保密版S-1已在案,奧爾特曼仍排除OpenAI在2026年上市

OpenAI今年不會完成首次公開募股。執行長薩姆·奧爾特曼在接受《財富》總編輯採訪時明確排除了2026年掛牌的可能。

Seung Jung5 天前
OpenAI 測試可以追問的廣告
Tech & Business

OpenAI 測試可以追問的廣告

OpenAI 於週三啟動 Sponsored Agents 測試,ChatGPT 使用者點擊廣告後可開啟與廣告主贊助代理人的獨立對話。同一波更新把 ChatGPT 廣告帶進 HubSpot 與 Shopify。

Seung Jung昨天