AI 用版權書籍訓練合法嗎?Anthropic 被判 15 億美元卻不是因為訓練:合理使用、影子圖書館與 2026 版權訴訟戰線解析

AI 模型用數百萬本書訓練,作者一毛錢都拿不到,這樣合法嗎?2026 年美國法院給出微妙答案:Anthropic 被罰 15 億美元,罪名不是訓練本身,而是從盜版影子圖書館抓資料。本文拆解合理使用四要素、Thomson Reuters 案與 Authors Guild 訴 OpenAI 最新進度。

  • Dennis
  • 7 分鐘閱讀
AI 用版權書籍訓練合法嗎?Anthropic 被判 15 億美元卻不是因為訓練:合理使用、影子圖書館與 2026 版權訴訟戰線解析

結論

AI 用版權書籍訓練,在美國目前「原則上合法、但偷書不合法」:2025 年法院認定訓練本身屬合理使用,Anthropic 卻因從盜版影子圖書館下載 700 萬本書被判賠 15 億美元。 真正決定輸贏的關鍵,不是「有沒有拿你的書訓練」,而是「書從哪裡來」以及「訓練出的產品會不會直接跟原作搶市場」。

你的小說可能正在餵養 AI,而且你毫不知情

ChatGPT、Gemini、Claude 背後的模型,訓練資料庫裡裝著數以億計的書籍、文章與學術論文——其中絕大多數作者,從來沒有被詢問、也沒有拿到任何授權費。聽起來很扯?美國科技媒體 TechCrunch 在 2026 年 8 月 23 日發表深度報導,訪問了多位智財律師,結論是:「這個問題的答案,非常複雜。」

複雜在哪?因為美國著作權法從 1976 年之後就沒有大修過。50 年前的法律,要拿來判斷「把幾百萬本書灌進神經網路」這種 21 世紀的行為,法官們只能各憑本事解讀。於是 2025 年以來,各法院開始陸續丟出關鍵判決——方向還不一致。

最關鍵的判決:Anthropic 賠 15 億,但輸在「偷」不是「訓練」

2025 年 6 月 23 日,加州北區聯邦法院的 William Alsup 法官在 Bartz v. Anthropic 案做出里程碑裁決,訊息量極大:

  • 訓練本身 = 合法:Alsup 認定用受版權保護的書籍訓練 LLM 屬於「合理使用(fair use)」,而且是「極具轉化性(spectacularly transformative)」——模型沒有重製或散佈你的書,而是像人類作家閱讀文學作品一樣,學習語言模式。他甚至在判決書裡寫:「如同任何想成為作家的讀者,Anthropic 的 LLM 訓練不是為了複製或取代這些作品,而是轉個彎、創造出不一樣的東西。」
  • 資料來源 = 違法:但法官同時拒絕把合理使用延伸到 Anthropic 從 Books3、LibGen、PiLiMi 等盜版影子圖書館下載超過 700 萬本盜版書的行為。Alsup 的關鍵一句話是:「取得管道至關重要(acquisition matters)」——就算最終用途是轉化性的,你一開始用偷的,就是侵權。

所以那筆驚人的 15 億美元賠償,罰的不是「AI 訓練」,罰的是「偷書」。這個區分讓 IP 律師 Cathy Gellis 直言:「這對 AI 公司來說其實是好消息——法官把訓練類比為『閱讀』,而不是『複製』。著作權法管的是複製,不管閱讀。」

flowchart TD
    A[Anthropic 訓練資料來源] --> B[合法購買的書籍<br/>數位化後訓練]
    A --> C[盜版影子圖書館<br/>Books3 / LibGen / PiLiMi<br/>700 萬本書]
    B --> D[法院認定:合理使用 ✅<br/>轉化性使用、無市場替代]
    C --> E[法院認定:侵權 ❌<br/>acquisition matters<br/>取得管道非法]
    E --> F[判賠 15 億美元]

合理使用的四要素:市場影響才是王牌

美國著作權法第 107 條的合理使用測試,靠四個要素逐案判斷:

要素內容AI 訓練的實務判斷
① 使用目的與性質是否「轉化性」(transformative)學習語言模式=轉化;直接複製輸出=不轉化
② 作品性質創意作品 vs 事實性資料小說、音樂等高度創意作品保護最強
③ 引用比例用了多少、佔多少AI 通常複製整本書,但要看是否「合理必要」
④ 市場影響是否取代原作市場被視為最重要的單一要素

關鍵的轉折點在第四要素:如果訓練出來的產品會直接跟原作搶生意,合理使用就站不住腳。 美國著作權局 2025 年 5 月的《Generative AI Training》報告(Part 3)也呼應這點:執行通用功能的模型通常具轉化性;但如果訓練目的是為了生成直接與原作市場競爭的內容,尤其是商業用途,「極不可能」被認定為合理使用。

Thomson Reuters 案:直接競爭 = 侵權的鐵證

2025 年 2 月,德拉瓦州聯邦法院的 Stephanos Bibas 法官在 Thomson Reuters v. Ross Intelligence 做出第一個針對「AI 訓練合理使用抗辯」的重大判決:

  • Ross 用 Thomson Reuters 旗下 Westlaw 的 2,243 個法律頭條當訓練資料,開發自己的 AI 法律檢索引擎
  • 法院認定:這是商業性、非轉化性的使用,而且 Ross 的產品就是 Westlaw 的市場替代品
  • 結果:合理使用抗辯「依法不成立」,Ross 侵權

法官特別強調這案「僅涉及非生成式 AI」,把生成式 AI 的合理使用問題留給後續案件。本案目前上訴到第三巡迴法院。它釋放的信號很清楚:訓練出一個直接競品,比訓練一個通用模型,法律風險高得多。

Authors Guild v. OpenAI:2026 年進行中的最大戰線

作者陣營 vs OpenAI 的集體訴訟,是這波版權戰爭的主戰場:

  • 2023 年 9 月:美國作家協會(Authors Guild)聯同多位知名作家在紐約南區法院提告;12 月把微軟也列為被告
  • 2025 年 4 月:與其他案件合併為跨州多地區訴訟(MDL No. 3143),由 Sidney H. Stein 法官審理
  • 2025 年 10 月 27 日:Stein 法官拒絕駁回直接侵權指控——他認定 ChatGPT 生成的小說摘要與續作大綱(例如《冰與火之歌》角色與情節)與原著「實質相似」,構成表面證據充分的侵權主張
  • 2026 年至今:案件進入證據開示(discovery)階段,仍在進行中

換句話說,OpenAI 這條線的風險點在「輸出端」——如果 ChatGPT 吐出來的東西跟原著太像,就不是訓練合不合法,而是直接侵權。

國際戰線:歐洲比美國更嚴

除了美國,2025 年底的兩場國際判決也值得關注:

  • GEMA v. OpenAI(德國慕尼黑,2025 年 11 月):法院裁定 OpenAI 未經授權用版權歌詞訓練違法,且歐盟的「文字與數據挖掘(TDM)」豁免不適用——因為訓練超出了分析範疇,生成式輸出還直接跟音樂市場競爭
  • Getty Images v. Stability AI(英國,2025 年 11 月):技術性判決,法院認為 Stable Diffusion 的模型架構「在技術上並未儲存或重製」Getty 的作品副本,但商標等其他指控仍在進行
  • LAION 案(德國漢堡):法院澄清,版權所有人必須用 robots.txt 等「機器可讀」訊號表達拒絕訓練(opt-out),寫在網站條款裡的自然語言無效

加上 2026 年全面實施的歐盟 AI 法案(Article 53)要求公開訓練資料摘要、違者最高罰全球年營業額 3%,以及加州 2026 年 1 月生效的《生成式 AI 訓練數據透明度法案》——AI 公司靠免費抓資料的時代,確實正在結束。

作者 vs AI 公司:雙方都在承擔風險

面向作者 / 出版商AI 公司
主要風險作品未經同意被訓練、生計受威脅;AI 生成內容不具著作權,重度依賴 AI 的手稿可能被出版商拒絕法定賠償每部作品最高 15 萬美元,OpenAI 這類公司潛在曝險達數十億美元
機會集體訴訟若勝訴可獲賠償與授權金判例逐漸明朗化:合法來源+非競爭用途=安全牌
策略用 robots.txt 等機器可讀訊號表態、要求透明度轉向「設計即合規」:與新聞、圖片庫、出版商簽授權合約

白話總結

把這幾場官司拼起來,2026 年的規則大致是這樣:

  1. 訓練本身:通用模型用書本學語言,法院傾向認定合理使用
  2. 資料來源:從盜版影子圖書館抓書=偷,怎麼轉化都救不了你
  3. 輸出競爭:訓練出的產品若直接取代原作市場(法律檢索、音樂、小說生成),侵權風險暴增
  4. 透明合規:機器可讀的 opt-out 訊號必須尊重,公開訓練資料摘要會是趨勢

對創作者來說,短時間內不會有「一刀切」的答案——正如律師 Jason Henderson 說的:「法律到處都是分歧,而這些分歧判決正在塑造接下來發生的一切。AI 公司如果忽視它們,會很愚蠢。」想了解 AI 生成的內容算不算「創作」,可以搭配閱讀本站的 Pew 研究:新網頁 35% 有 AI 創作跡象;若關心 AI 內容如何被辨識與標記,AI 浮水印路線分歧 一文也有完整整理。

延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友