2026年8月29日星期六

WhaleAgent
wikiHow 告 OpenAI 爬走 11,211 篇教學

wikiHow 告 OpenAI 爬走 11,211 篇教學

教學網站 wikiHow 入稟紐約南區法院控告 OpenAI,指對方未經授權爬取 11,211 篇已註冊版權文章訓練 ChatGPT,要求賠償及禁制令。訴狀附上 ChatGPT 輸出與原文的逐字對照、逾 30 萬次爬蟲紀錄,並引用 GPT-4 自認訓練資料「包含足夠的 wikiHow 內容」。

教學網站 wikiHow 在 2026 年 8 月 21 日入稟紐約南區聯邦法院控告 OpenAI,指對方未經授權爬取並複製其 11,211 篇已註冊版權的教學文章,用來訓練 ChatGPT,並要求賠償與禁制令。訴狀同時附上 ChatGPT 輸出與原文的逐字對照。

事件背景

wikiHow 由 Jack Herrick 在 2005 年創立,起初是眾包式的步驟教學平台,但自 2011 年起改為自聘編採團隊,目前網站上絕大部分內容由公司自行撰寫,而非用戶貢獻。這一點在版權訴訟裡並非枝節:內容由誰創作,直接決定誰有資格提告。

網站現時載有超過 50 萬篇文章、涵蓋數十種語言,高峰期每月訪客超過 1.5 億。wikiHow 持有逾 30 萬篇文章的版權,而今次興訟針對的是其中 11,211 篇,由 1,211 項美國版權註冊涵蓋,逐篇列於訴狀的附件 A。

被告一共九間 OpenAI 相關實體,由 OpenAI, Inc. 到 OpenAI Group, PBC。訴狀指九者實際上以單一企業運作,因此一併列為被告。案件編號 1:26-cv-7171,wikiHow 要求陪審團審訊。

訴狀的四條路線

主張

指控內容

訓練階段複製

大規模複製文章以訓練 ChatGPT 背後的大型語言模型

RAG 檢索複製

透過檢索增強生成系統另行取用文章,每次回答都重新複製一次

輸出侵權

ChatGPT 生成的答案逐字或近乎逐字重現受保護表達,並複製 wikiHow 的步驟選材與排序

DMCA 第 1202 條

在批量抓取時移除版權管理資訊,而且範圍不限於已註冊的 11,211 篇

第二條是這宗案與早期 AI 版權訴訟最不同的地方。過往爭議集中在「訓練是否構成合理使用」,而 RAG 這一條把戰線推到產品的日常運行:即使訓練那一步將來被判為合理使用,模型每次即時抓取原文來生成答案,仍然是一次獨立的複製行為。

wikiHow 的使用條款早已明文禁止爬取內容用於訓練機器學習模型,訴狀以此主張 OpenAI 知悉其複製未獲授權。

爬蟲日誌是最硬的數字

時段

來源

次數

2025 年 3 月 27 日至 5 月 16 日

OpenAI 公開 IP 位址

逾 185,000 次

2026 年 5 月 1 日至 7 月 21 日

OpenAI 爬蟲

148,529 次

2025 年 5 月至今

Common Crawl 及 OpenAI 爬蟲

逾 300,000 次

wikiHow 補充,OpenAI 亦使用經過偽裝的 user agent 與 IP 位址,因此上述數字只是下限。

這些日期比表面看來重要。wikiHow 的版權註冊在 2025 年 8 月 21 日生效,而第二、三行的抓取全部發生在註冊之後。美國版權法下,註冊生效後的侵權行為才可申索法定賠償與律師費,所以訴狀特意逐段強調「每一次複製都是獨立的侵權行為」。

最有力的一段是逐字對照

訴狀花了大量篇幅做並排比對:左邊是 ChatGPT 的輸出,右邊是 wikiHow 的原文,重疊的句子以螢光標示。被引用的例子包括《What Does It Mean When You Dream About a Wedding》與《March Aries vs April Aries》等文章,其中一段輸出更直接標註「來自 wikihow.com」。

另一段更尷尬。訴狀展示 GPT-4 準確辨認出一張 wikiHow 的教學插圖,並在被追問時自行解釋原因,當中一句是它的訓練資料「包含足夠的 wikiHow 內容,讓它能有效歸納其視覺風格與版式」。原告把模型自己的說法當作證據使用。

wikiHow 稱它是在 2024 年底才從 ChatGPT 的輸出中察覺內容被取用,因為訓練資料與檢索系統內部的複製,外界根本無從觀察。

這宗案的位置

OpenAI 現時的版權訴訟已由美國司法多區訴訟審判小組集中處理,即 In re OpenAI, Inc. Copyright Infringement Litigation(1:25-md-3143),同樣在紐約南區。wikiHow 明言自己的主張涉及相同行為與相同法律爭點,應歸入同一法院,換言之這宗案大概率會併入既有的大隊,而不是獨立審。

訴狀亦引用 OpenAI 自己公布的規模數字:ChatGPT 每周活躍用戶逾 9 億、消費訂閱用戶逾 5,000 萬、企業客戶逾 900 萬,估值報 7,300 億美元,年化收入一度達 250 億美元。這些數字出現在版權訴狀裡只有一個用途,就是為賠償金額鋪路。

值得留意的是,訴狀是原告的一面之詞,OpenAI 尚未答辯,法院也未就任何一項主張作出裁定。真正的分水嶺會落在訓練是否構成合理使用,以及 RAG 檢索能否被視為另一回事,兩者都要等到實質審理階段才有答案。

來源

No comments yet