《紐約時報》將近三年前對 OpenAI 與微軟提起的著作權訴訟,最新解封的文件裡出現了兩家公司公開書狀從未寫下的東西:自家員工用最直白的說法描述這項作法。在 2023 年 1 月的一份內部備忘錄中,微軟應用科學總監布倫特·赫克特(Brent Hecht)把用抓取而來的作品訓練 AI 稱為「規模空前的驚人竊取」,也說那是「人類史上最大規模的勞動竊取」。這些引述於週四曝光,由 TechCrunch 率先報導。
以下內容都要放在一個前提下看。新曝光的文字多半出自原告自己的書狀,而非底層證物,證物仍處於封存狀態,因此這些摘句都脫離了當初書寫的脈絡。相關指控尚未經過審判檢驗。
重點摘要
- 依解封書狀,2023 年 1 月的微軟備忘錄把以抓取內容訓練 AI 形容為人類史上最大規模的勞動竊取。
- 微軟自家數據顯示,Copilot 相較於傳統 Bing 搜尋,讓 nytimes.com 的點擊率最多下滑 93%,內部簡報稱這是一個「末日循環」。
- 書狀指出,OpenAI 的中期訓練資料集收錄三家新聞原告的作品副本超過 9 萬 1,692 份,另一個共用資料集則至少含 16 萬 903 件獨立作品。
內部說法為何具有法律份量
法院大致上願意接受「以受著作權保護的文字訓練模型屬於合理使用」這項主張,川普政府本月稍早也遞交書狀,支持 OpenAI 未經授權使用受保護素材。不過合理使用的判斷有一部分取決於新產品是否在市場上替代了原作,而解封的說法正好打在這個要害上。
OpenAI 的 ChatGPT 負責人尼克·特利(Nick Turley)被引述指出,這類產品大體上具有替代性,對媒體構成生存威脅,而且照他的說法,產品愈進步、替代性就愈強。總裁葛雷格·布洛克曼(Greg Brockman)則說模型在新聞上表現極佳。微軟執行長薩蒂亞·納德拉(Satya Nadella)在宣誓作證時同意,與聊天機器人對話等於由 AI 平台直接提供資訊,而不是把讀者送往原始來源。這些都讀不出轉化,讀到的是取代。
書狀附上的流量數字讓論點更銳利。原告主張,微軟內部量測顯示 Copilot 回答引擎相較一般 Bing 搜尋,把《紐約時報》網域的點擊率壓低了最多 93%。赫克特在 2024 年 1 月的一份簡報把這個機制描述成末日循環,會同時傷害模型與更廣的網路生態。
終端產品威脅到其關鍵供應者的經濟基礎,是非常不尋常的事;但我們的 LLM 業務對它的「內容供應鏈」,正是造成了這樣的局面。
規模與抄捷徑
書狀也替複製行為附上數字。文件主張,光是 OpenAI 的中期訓練資料集就收錄《紐約時報》、《紐約每日新聞》與調查報導中心的作品副本逾 9 萬 1,692 份,另一個源自 Common Crawl 的資料集則含有超過兩百萬份來自 nytimes.com 的文件。資料在兩家夥伴之間雙向流動:OpenAI 據稱把整套 GPT-3 訓練資料交給微軟,微軟則透過代號「Project Taxi」與「Project Mango」的專案提供資料。Mango 資料集據稱蒐集了新聞原告至少 16 萬 903 件獨立作品。
殺傷力最強的段落談的是意圖而非數量。書狀描述 OpenAI 員工討論如何在不被偵測的情況下繞過《紐約時報》的付費牆——研究員尼克·萊德(Nick Ryder)提出,布洛克曼表示贊同——並指控訓練資料中的著作權標示遭到刻意移除,好讓模型不會重現這些標示。納德拉作證說,任何人若要把付費牆內的素材用於訓練或接地,都應該取得授權;他並表示,若早知道 OpenAI 抓取付費牆後的內容,他會行使微軟要求重新訓練模型的權利。
接下來會怎麼走
《紐約每日新聞》的代理律師說,這些證據首次顯示兩家公司都知道這種作法不對。微軟與 OpenAI 都未回應置評請求。這些引述在對照封存的原始脈絡後是否站得住腳,將決定它們的份量,而證物本身目前仍未解封。
這次揭露的時間點,正逢業界透過公開的同意標準、而非訴訟來處理同一個問題,微軟也是近期簽署 Cloudflare 爬蟲規則的企業之一。書狀多補上的一塊,是證明大型語言模型所需的網路爬取在經濟上如何運作,公司內部早就心知肚明,而且在公開爭論開始的好幾年前,就已用不怎麼好聽的字眼寫了下來。
FAQ — 常見問題
這次解封的究竟是什麼?
是《紐約時報》在對 OpenAI 與微軟的著作權訴訟中所提書狀被解除遮蔽的部分,內容引用了內部備忘錄、簡報與證詞。引述所依據的證物仍處於封存狀態,因此這些摘句是脫離原始脈絡出現的。
這是否就確定了合理使用的爭點?
沒有。法官大致接受模型訓練可能構成合理使用,而本案也尚未進入審判。解封說法之所以重要,是因為合理使用要衡量產品是否替代原作,而多位被引述的高層描述的正是這種替代。
微軟與 OpenAI 回應了嗎?
兩家公司都未回覆對解封文件的置評請求。書狀中的指控是原告對證據的詮釋,尚未經過裁判認定。






