Microsoft社内メモ、AI学習を「人類史上最大の労働の窃盗」と表現

ニューヨーク・タイムズの訴訟で開示された資料が、ペイウォールや代替性、報道機関への打撃をめぐるMicrosoftとOpenAI内部の率直な発言を記録に残した

|5分で読める0
The New York Times copyright case against OpenAI and Microsoft has entered its third year, with newly unsealed filings quoting internal company documents.
The New York Times copyright case against OpenAI and Microsoft has entered its third year, with newly unsealed filings quoting internal company documents.

ニューヨーク・タイムズが3年近く前にOpenAIとMicrosoftを相手取って起こした著作権訴訟で、新たに開示された資料には、両社の公開書面には一度も現れなかった内容が含まれています。自社の社員がこの慣行を最も率直な言葉で説明した部分です。2023年1月の社内メモで、Microsoftの応用科学ディレクター、ブレント・ヘクト氏は、収集した著作物でAIを学習させる行為を「前例のない規模の驚くべき窃盗」「人類史上最大の労働の窃盗」と表現しました。この引用は木曜日に明らかになり、TechCrunchが最初に報じました

以下の内容全体にかかる注意点が一つあります。新たに見えるようになった文言の大半は、根拠資料そのものではなく原告側の書面から出たもので、元の証拠は依然として封印されたままです。つまり、引用は書かれた当時の文脈から切り離された形で伝わっています。主張はまだ法廷で検証されていません。

要点

  • 開示された書面によれば、2023年1月のMicrosoftのメモは、収集したコンテンツでAIを学習させる行為を人類史上最大の労働の窃盗と位置づけていました。
  • Microsoft自身のデータでは、Copilotが従来のBing検索と比べてnytimes.comへのクリック率を最大93%押し下げたとされ、社内資料はこれを「ドゥームループ」と呼んでいました。
  • 書面は、OpenAIの中間学習データセットに報道機関の原告3社の著作物の複製が9万1,692件以上含まれ、別の共同データセットには少なくとも16万903件の固有の著作物があったと主張しています。

社内の発言が法的に重要な理由

裁判所は、著作権のあるテキストでモデルを学習させる行為がフェアユースに当たるという主張をおおむね受け入れてきました。トランプ政権も今月初め、OpenAIによる無許諾の著作物利用を支持する意見書を提出しています。ただしフェアユースの判断は、新しい製品が市場で元の著作物を代替するかどうかにも左右されます。開示された発言が弁護側の論理を正面から突くのは、まさにこの点です。

ChatGPT責任者のニック・ターリー氏は、大部分が代替的な性格を持つ製品が報道機関にとって存亡に関わる脅威であり、性能が上がるほどその性格は強まると述べたと引用されています。グレッグ・ブロックマン社長はモデルがニュースに極めて優れていると評しました。Microsoftのサティア・ナデラCEOは宣誓証言で、チャットボットと会話すれば読者を元の情報源に送る代わりにAIプラットフォーム側が情報を提供することになると認めました。いずれも変容とは読めません。置き換えと読めます。

書面に添えられたトラフィックの数値が、この論点をさらに鋭くします。Microsoftの社内計測では、Copilotの回答エンジンが通常のBing検索と比べてタイムズのドメインのクリック率を最大93%低下させたと原告側は主張しています。2024年1月にヘクト氏が作成した資料は、この構図をモデルとウェブ全体を同時に傷つけるドゥームループだと説明しました。

最終製品が不可欠な供給者の経済的基盤を脅かすことは極めて異例だが、我々はLLM事業の「コンテンツ・サプライチェーン」に対して、まさにその状況を作り出してしまった。

規模と抜け道

書面は複製の規模にも数字を付けています。OpenAIの中間学習データセットだけで、タイムズ、ニューヨーク・デイリー・ニューズ、調査報道センターの著作物の複製が9万1,692件以上あり、Common Crawl由来のデータセットにはnytimes.comの文書が200万件以上含まれていたという主張です。データは両社の間を双方向に動きました。OpenAIはGPT-3の学習データ一式をMicrosoftに渡し、Microsoftは「プロジェクト・タクシー」「プロジェクト・マンゴー」と名付けられた取り組みでデータを供給したとされます。マンゴーのデータセットは、報道機関の原告の固有の著作物を少なくとも16万903件集めていたとされています。

最も打撃が大きい箇所は、量ではなく意図に関わるものです。書面は、OpenAIの社員がタイムズのペイウォールを検知されずに回避する手法を議論していたと記述しています。研究者のニック・ライダー氏が持ち出し、ブロックマン氏が肯定的に応じたという内容です。モデルが著作権表示を再現しないよう、学習データから表示を意図的に取り除いていたという主張も含まれます。ナデラ氏は、学習やグラウンディングにペイウォール内のコンテンツを使うなら誰であれライセンスを取るべきだと証言しました。さらに、OpenAIがペイウォールの内側を収集していたと知っていれば、モデルの再学習を求めるMicrosoftの権利を行使していたはずだと述べています。

今後の展開

ニューヨーク・デイリー・ニューズ側の弁護士は、両社がこの慣行を不当だと認識していたことが初めて証拠として示されたと語りました。MicrosoftとOpenAIはいずれもコメント要請に応じていません。引用が封印された本来の文脈と突き合わせても持ちこたえるかどうかが、この資料の価値を決める問いであり、証拠そのものは今も封印されたままです。

今回の開示は、業界が同じ問題を訴訟ではなく公開の同意基準で解こうとしている時期に重なりました。Microsoftも最近Cloudflareのクローラー規約に署名した企業の一社です。書面が加えるのは、大規模言語モデルのためのウェブスクレイピングの経済構造が社内では早くから理解され、公の議論が始まる何年も前から芳しくない言葉で語られていたという証拠です。

FAQ — よくある質問

具体的に何が開示されたのですか?

ニューヨーク・タイムズがOpenAIとMicrosoftを相手取った著作権訴訟で提出した書面のうち、非開示処理が解かれた部分です。社内メモ、プレゼン資料、証言が引用されています。引用の元になった証拠自体は封印されたままで、抜粋は本来の文脈を欠いた形で現れています。

これでフェアユースの争点は決着しますか?

いいえ。裁判所はモデルの学習がフェアユースになり得ると概ね認めてきましたし、この訴訟はまだ審理に入っていません。開示された発言が重要なのは、フェアユースの判断が製品による原著作物の代替を問うからで、引用された複数の幹部がまさにその代替を語っているためです。

MicrosoftとOpenAIは反応しましたか?

両社とも開示資料についてのコメント要請に応じていません。書面の主張は証拠に対する原告側の解釈であり、司法判断はまだ下されていません。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

OpenAI「自社モデルがJalapeñoの設計を9か月に短縮した」
Tech & Business

OpenAI「自社モデルがJalapeñoの設計を9か月に短縮した」

AIが書いたカーネルがOpenAIの専門家による実装を最大1.8倍上回った。JalapeñoのInferenceXベンチマーク結果が初公開された。

Seung Jung23 日前
ChatGPTが架空の証人を捏造、ニューメキシコ州最高裁が弁護士に5000ドルの制裁
Tech & Business

ChatGPTが架空の証人を捏造、ニューメキシコ州最高裁が弁護士に5000ドルの制裁

ニューメキシコ州最高裁は、ChatGPTが控訴趣意書に架空の証人と警察の供述を作り出したとして、弁護士Stephen Aarons氏に5000ドルの制裁金を科し法廷侮辱と認定した。

Seung Jung6 日前
ワシントンの1ドルChatGPT契約が終了、後継契約はトークン単位で請求する
Tech & Business

ワシントンの1ドルChatGPT契約が終了、後継契約はトークン単位で請求する

OpenAIの新しい27か月のGSA契約は1席15ドルのライセンス料を免除しトークン料金を半額にしたが、年1ドルの定額を10月1日から従量課金へ切り替える。

Seung Jung5 日前
エヌビディアは270億ドルを投じながら企業結合の届出を一度も行わなかった。司法省がその理由を問う
Tech & Business

エヌビディアは270億ドルを投じながら企業結合の届出を一度も行わなかった。司法省がその理由を問う

反トラスト当局が、AI業界で買収に取って代わった取引スキームを初めて本格的に調べ始めました。エヌビディアは司法省から正式な資料提出要求を受けています。

Seung Jung5 日前
アルトマン氏、非公開S-1を提出済みでも2026年のOpenAI上場を否定
Tech & Business

アルトマン氏、非公開S-1を提出済みでも2026年のOpenAI上場を否定

OpenAIは今年中に新規株式公開を完了しない。サム・アルトマン最高経営責任者がフォーチュン編集長とのインタビューで2026年の上場を明確に否定した。

Seung Jung5 日前
OpenAI、問い返せる広告をテストへ
Tech & Business

OpenAI、問い返せる広告をテストへ

OpenAIは水曜日、Sponsored Agentsのテストを開始しました。ChatGPTの利用者が広告をクリックすると、広告主がスポンサーするエージェントとの別の会話が開きます。同じアップデートでChatGPT広告はHubSpotとShopifyに組み込まれました。

Seung Jung昨日