068 · 掃完就銷毀:AI 的乾淨資料戰
Anthropic 與 Amazon 都在大量收購二手書,掃描建檔之後直接銷毀。從版權、成本到不讓對手拿到,這集把乾淨資料的價值、模型商的下一步,還有髒資料怎麼被餵進來,講得很完整。
原標題:AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why? | S2E68
重點摘要
- 2022 年是一條分水嶺有研究統計,ChatGPT 問世之後,現在的網頁超過三分之一有 AI 處理過的痕跡。想拿到沒被碰過的人類資料,最直接的辦法是回頭找 2022 年以前出版的實體書。
- Anthropic 的巴拿馬計畫2024 年秘密啟動,內部文件寫的是大規模掃描世上的實體書,而且不能被發現。起心動念其實是版權,因為早期從盜版電子書網站抓資料,後來吃上官司。
- 買數位版行不通PDF 只有個人使用權,拿去訓練就違反授權範圍;一家一家跟出版商談,又太慢、太貴、涵蓋範圍不完整。最後反而是土法煉鋼最划算。
- Amazon 是被 AirTag 抓到的書商發現來路不明的大筆訂單,一筆可能抵一週營業額。404 Media 的記者把 AirTag 縫進書裡追蹤,一路追到拉斯維加斯的 VGT3 倉庫,團隊 logo 是恐龍在吃書。
- 銷毀有三個理由砍掉書背大量掃描最省成本;同時持有實體版與數位版等於複製了一份,銷毀可以規避法律風險;書不流回市面,競爭對手就拿不到,包括那些已經絕版的珍本。
- 但乾淨資料已經不是萬靈丹2023 到 2024 年初 scaling law 還成立,之後效果遞減,重心轉到強化學習與推論時的 test-time compute,再往下是持續學習與 RSI。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 預告三條線:AI 公司秘密收書銷毀、2026 年模型商還能靠什麼拉開差距、有人花錢往資料裡植入立場。 |
| 02:18 | 網路變髒了 | ChatGPT 問世後超過三分之一的網頁有 AI 痕跡,而且只會越來越多,乾淨資料因此變稀缺。 |
| 02:49 | 巴拿馬計畫 | Anthropic 2024 年秘密啟動,目標是大規模掃描實體書,並且不讓外界知道。 |
| 03:19 | 動機其實是版權 | 早期從盜版電子書網站下載書被告,於是改走「買實體書、掃成自己的數位版」這條路。 |
| 03:50 | 授權為何談不成 | 數位版只有個人使用權,拿去訓練就違約;逐家談出版商則太慢太貴、範圍不完整。 |
| 04:52 | AirTag 追到倉庫 | 書商察覺神秘大單,記者把 AirTag 縫進書裡,最後定位到拉斯維加斯的 Amazon VGT3 倉庫。 |
| 05:53 | 只收不重複的 ISBN | 買書不分主題,靠書碼去重,重複的就不掃;流程是砍書背、快速掃描、建檔、銷毀。 |
| 06:42 | 焚書坑儒的比喻 | 差別在目的:不是阻止知識傳播,而是把知識私有化。珍本也照掃照毀,社群反彈最大。 |
| 07:58 | 為什麼非毀不可 | 成本、法律風險、不讓對手取得,三個理由疊起來,賣回市面反而不划算。 |
| 09:14 | scaling law 退場 | 2024 年後加資料、加算力、加參數的效果遞減,重心轉向強化學習與可驗證任務。 |
| 11:02 | 語感退步的代價 | 程式與數學這種能驗證的能力變強,人文語感反而變差,Opus 5 的體感就是例子。 |
| 12:50 | 推論時再想一點 | test-time compute、chain of thought、routing、動態調整深度,但想越久不等於答得越好。 |
| 13:53 | 持續學習與 RSI | 目標是繞過 cut off,不必重訓整個大模型就能吸收新知,再往上是模型自己迭代下一代。 |
| 15:11 | 花錢餵髒資料 | 以色列政府花 90 萬美金請公關公司做智庫風格網站,目的是被 ChatGPT、Gemini 引用。 |
| 16:29 | 保持懷疑 | 內容可能在你不知情時被污染,連自己設定不要阿諛奉承也擋不掉,還是得自己判斷合不合理。 |
值得記的話
名詞與人物
| 巴拿馬計畫 | Anthropic 2024 年秘密啟動的計畫,內部文件寫明要大規模掃描實體書且不能曝光。 |
|---|---|
| VGT3 | Amazon 在拉斯維加斯的倉庫代號,團隊 logo 是一隻恐龍爪子抓著書在吃。 |
| 404 Media | 報導此事的媒體,記者把 AirTag 縫進書裡追蹤,才找出書的去向。 |
| ISBN | 書碼,Amazon 這批採購用它去重,重複的書就不再買、不再掃。 |
| scaling law | 資料、算力、參數一起放大就能換到更強模型的規律,2024 年後效果遞減。 |
| test-time compute | 把力氣放在推論階段,例如多想一點、chain of thought、routing、動態調整思考深度。 |
| 持續學習 | 讓模型在知識 cut off 之後還能吸收新資訊,不必重訓整個大模型。 |
| RSI | recursive self improvement,模型自己設計實驗、調參數,產生下一代模型。 |
延伸
- 持續學習與 RSI 這條線,節目過去幾週已經談過類似主題,想深入可以回聽先前的集數。
- 網站植入看不見的文字、誘導 LLM 在摘要時推薦特定產品,也是之前集數提過的手法,這集只帶到一句。
- 主持人正在調整戶外邊移動邊錄的形式,想聽的深淺與風格都歡迎在影片下留言。