紐約時報訴訟新解密檔案顯示,微軟員工內部稱訓練資料取用是「史上最大勞動竊盜」,而 Copilot 上線後,紐時網域點閱率最深曾下跌 93%。
(前情提要:紐時董事長演講:媒體在AI時代該如何生存?我勸業界站起來反抗)
(背景補充:出版社搶作者賠償金?Anthropic 15 億和解出亂子,50 萬本書作者怕拿不到錢)
一份微軟內部備忘錄,用詞罕見直白:「規模空前、令人震驚的竊盜」,甚至是「人類史上最大的勞動竊盜」。寫下這句話的人,不是外部批評者,而是微軟應用科學總監 Brent Hecht,形容的正是微軟與 OpenAI 訓練 AI 模型的方式。
這段話出自紐約時報對 OpenAI 與微軟提起的著作權訴訟,現已併入紐約南區聯邦法院多區訴訟,原告還包括 New York Daily News、Center for Investigative Reporting、Ziff Davis 與多名書籍作者,雙方簡易判決動議目前正在審理中。
「末日迴圈」與 93% 流量重挫
Hecht 在 2024 年 1 月的微軟內部簡報中,把 Copilot 造成的流量下滑稱為「末日迴圈」,形容這種效應會「同時傷害我們模型與整個網路的表現」。
微軟自己的數據顯示,與傳統 Bing 搜尋相比,Copilot 這類「答案引擎」讓紐時網域的點閱率最深下跌 93%;法律檔案另列出,紐時與 Daily News 網域下跌 83% 至 93%,Ziff Davis 網域則下跌 51% 至 94%。
微軟另一份內部檔案寫得更直接:「一個終端產品威脅到其關鍵供應商的經濟基礎,這極不尋常,但這正是我們在 LLM 業務的『內容供應鏈』上所造成的處境。」還有檔案承認,生成式 AI 有「真實風險」會「嚴重衝擊那些產出基礎模型訓練資料之人的就業」。
授權說一套,爬蟲做一套?
微軟執行長 Satya Nadella 在今年的證詞中表示:「任何付費牆後的內容,任何想用來做 grounding(讓模型回答時即時參照外部資料)或訓練的人都應該取得授權」;他也在宣誓下同意,若得知 OpenAI 爬取並訓練了付費牆後的資訊,會「動用(微軟的權利)要求 OpenAI 重新訓練模型」。
他也在宣誓下同意,人們與聊天機器人對話「已經取代了……直接在 AI 平台上給你資訊,而不需要去原始來源」;他同時承認,下載盜版內容「絕對」違法。但起訴檔案引述,OpenAI 研究員 Nick Ryder 曾向總裁 Greg Brockman 提到一個「繞過紐時付費牆的 hack」,Brockman 只回了一句:「ah nice」。
OpenAI ChatGPT 負責人 Nick Turley 的內部通訊則寫道,出版商面臨來自聊天機器人的「生存威脅」,這類產品很大程度是替代性的,而且「會隨著變好而越來越具替代性」。
Brockman 也曾形容模型「非常擅長新聞」。前 OpenAI 政策總監、現 Anthropic 共同創辦人 Jack Clark 則寫下更沉重的一句:公司的工作「將越來越導致我們打造出取代那些定義社會『文化』之人勞動的系統」,「我們的工作會讓人失業」。
九萬份文章,只是零頭
爬取規模有多大?起訴檔案顯示,OpenAI 光是中期訓練資料集就含超過 91,692 份紐時、Daily News、CIR 作品的副本;另一個源自 Common Crawl(一個大型網路爬蟲資料庫)的資料集,含超過 200 萬份 nytimes.com 檔案。
取得管道包括直接從 Bing 索引爬取;起訴檔案也指出,OpenAI 曾把整個 GPT-3 訓練資料集交給微軟,供微軟評估如何把 OpenAI 模型整合進自家商業產品,而微軟同樣透過代號「Project Taxi」與「Project Mango」的計畫回頭提供訓練資料給 OpenAI,其中 Project Mango 資料集含至少 160,903 件新聞出版商的獨特作品。
微軟 2022 年曾因法律疑慮,以「Project Clear」為名刪除兩個訓練資料集。檔案也顯示,OpenAI 建構 WebText 等資料集時不成比例依賴爬取的新聞內容,並刻意從訓練資料中移除版權聲明,因為研究員「不希望模型輸出」版權聲明給用戶。
微軟對此回應,這些內部評論「反映的是一名員工的個人觀點,不是法律分析,也不代表公司立場」;OpenAI 未回應置評請求。
📍相關報導📍
CNN 控告 Perplexity 侵害著作權:1.7 萬篇報導逐字複製、繞過付費牆

