全部集數

068 · 掃完就銷毀:AI 的乾淨資料戰

Anthropic 與 Amazon 都在大量收購二手書,掃描建檔之後直接銷毀。從版權、成本到不讓對手拿到,這集把乾淨資料的價值、模型商的下一步,還有髒資料怎麼被餵進來,講得很完整。

2026-08-2318:46Anthropic資料版權模型產業觀察看原片

原標題:AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why? | S2E68

重點摘要

  • 2022 年是一條分水嶺有研究統計,ChatGPT 問世之後,現在的網頁超過三分之一有 AI 處理過的痕跡。想拿到沒被碰過的人類資料,最直接的辦法是回頭找 2022 年以前出版的實體書。
  • Anthropic 的巴拿馬計畫2024 年秘密啟動,內部文件寫的是大規模掃描世上的實體書,而且不能被發現。起心動念其實是版權,因為早期從盜版電子書網站抓資料,後來吃上官司。
  • 買數位版行不通PDF 只有個人使用權,拿去訓練就違反授權範圍;一家一家跟出版商談,又太慢、太貴、涵蓋範圍不完整。最後反而是土法煉鋼最划算。
  • Amazon 是被 AirTag 抓到的書商發現來路不明的大筆訂單,一筆可能抵一週營業額。404 Media 的記者把 AirTag 縫進書裡追蹤,一路追到拉斯維加斯的 VGT3 倉庫,團隊 logo 是恐龍在吃書。
  • 銷毀有三個理由砍掉書背大量掃描最省成本;同時持有實體版與數位版等於複製了一份,銷毀可以規避法律風險;書不流回市面,競爭對手就拿不到,包括那些已經絕版的珍本。
  • 但乾淨資料已經不是萬靈丹2023 到 2024 年初 scaling law 還成立,之後效果遞減,重心轉到強化學習與推論時的 test-time compute,再往下是持續學習與 RSI。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場預告三條線:AI 公司秘密收書銷毀、2026 年模型商還能靠什麼拉開差距、有人花錢往資料裡植入立場。
02:18網路變髒了ChatGPT 問世後超過三分之一的網頁有 AI 痕跡,而且只會越來越多,乾淨資料因此變稀缺。
02:49巴拿馬計畫Anthropic 2024 年秘密啟動,目標是大規模掃描實體書,並且不讓外界知道。
03:19動機其實是版權早期從盜版電子書網站下載書被告,於是改走「買實體書、掃成自己的數位版」這條路。
03:50授權為何談不成數位版只有個人使用權,拿去訓練就違約;逐家談出版商則太慢太貴、範圍不完整。
04:52AirTag 追到倉庫書商察覺神秘大單,記者把 AirTag 縫進書裡,最後定位到拉斯維加斯的 Amazon VGT3 倉庫。
05:53只收不重複的 ISBN買書不分主題,靠書碼去重,重複的就不掃;流程是砍書背、快速掃描、建檔、銷毀。
06:42焚書坑儒的比喻差別在目的:不是阻止知識傳播,而是把知識私有化。珍本也照掃照毀,社群反彈最大。
07:58為什麼非毀不可成本、法律風險、不讓對手取得,三個理由疊起來,賣回市面反而不划算。
09:14scaling law 退場2024 年後加資料、加算力、加參數的效果遞減,重心轉向強化學習與可驗證任務。
11:02語感退步的代價程式與數學這種能驗證的能力變強,人文語感反而變差,Opus 5 的體感就是例子。
12:50推論時再想一點test-time compute、chain of thought、routing、動態調整深度,但想越久不等於答得越好。
13:53持續學習與 RSI目標是繞過 cut off,不必重訓整個大模型就能吸收新知,再往上是模型自己迭代下一代。
15:11花錢餵髒資料以色列政府花 90 萬美金請公關公司做智庫風格網站,目的是被 ChatGPT、Gemini 引用。
16:29保持懷疑內容可能在你不知情時被污染,連自己設定不要阿諛奉承也擋不掉,還是得自己判斷合不合理。

值得記的話

就只有他們可以拿到這些高品質的這些私有的數位版的人類寫的資料

06:42

你不要讓其他競爭對手有這些資料嘛

08:44

你這個東西變好了,你在這個可驗證的程式方面變好了,可是你的語感能力卻變差了

12:02

你把一些簡單的問題你調到 max effort,反而會讓模型想太多

13:06

誰知道現在 2022 年以後爬的網站是不是有心人士故意去做出來的

16:44

名詞與人物

巴拿馬計畫Anthropic 2024 年秘密啟動的計畫,內部文件寫明要大規模掃描實體書且不能曝光。
VGT3Amazon 在拉斯維加斯的倉庫代號,團隊 logo 是一隻恐龍爪子抓著書在吃。
404 Media報導此事的媒體,記者把 AirTag 縫進書裡追蹤,才找出書的去向。
ISBN書碼,Amazon 這批採購用它去重,重複的書就不再買、不再掃。
scaling law資料、算力、參數一起放大就能換到更強模型的規律,2024 年後效果遞減。
test-time compute把力氣放在推論階段,例如多想一點、chain of thought、routing、動態調整思考深度。
持續學習讓模型在知識 cut off 之後還能吸收新資訊,不必重訓整個大模型。
RSIrecursive self improvement,模型自己設計實驗、調參數,產生下一代模型。

延伸

  • 持續學習與 RSI 這條線,節目過去幾週已經談過類似主題,想深入可以回聽先前的集數。
  • 網站植入看不見的文字、誘導 LLM 在摘要時推薦特定產品,也是之前集數提過的手法,這集只帶到一句。
  • 主持人正在調整戶外邊移動邊錄的形式,想聽的深淺與風格都歡迎在影片下留言。