056 · AI 什麼時候開始自己造 AI
Anthropic 共同創辦人 Jack Clark 押了 60% 的機率,2028 年底前 AI 會開始自己研發 AI。這集拆開他引用的 benchmark,也談這個推論最脆弱的一環。
原標題:Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI | S2E56
重點摘要
- 60% 不是靈感,是推算Jack Clark 通篇沒提 AGI,只拿公開論文、benchmark 和 Anthropic 內部的研究資料,推出 2028 年底以前 AI 能自動化 AI 研發的機率。這種寫法跟 CEO 們在外面講的大預測不太一樣。
- 寫程式已經逼近天花板SWE-bench 從 2023 年 Claude 2 的 2%,到還沒發布的 Claude Mythos 拿下 93.9%。分數高到這個地步,再往上其實差異不大,看長期趨勢就好。
- 能跑多久才是真正的指標METR 的 Time Horizon 測的是模型在 50% 可靠度下能連續執行任務多久,從 GPT-3.5 的 36 秒一路長到 Opus 4.6 的 12 小時。照這個斜率外插,2027 年底可能是 40 天。
- AI 優化 AI 已經有數字Anthropic 內部讓 agent 去優化一段 CPU only 的小型語言模型,人類研究員花 4 到 8 小時大概能做到 4 到 5 倍,Mythos 做到 52 倍。
- 創意還是缺口AI 研究比較像把既有的 building blocks 組起來,方向仍要人推一把。AlphaGo 的第 37 手那種靈光一閃,十年來也沒再以別的形式出現。
- 風險全壓在對齊上完成任務最有效的方法常常就是作弊;99.9% 的準確度自己迭代 500 代以後只剩 60%。當模型強到人類評估不了,對齊就變成沒辦法驗證的事。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Jack Clark 在自己的電子報 Import AI 寫下一個預測:2028 年底以前,有 60% 的機會 AI 開始自動化 AI 的研發。 |
| 02:22 | 作者是誰 | Anthropic 有七位共同創辦人,Jack Clark 是唯一沒有技術背景的那位,職務是公共政策負責人,對外談安全、對齊與治理。 |
| 04:44 | SWE-bench 的跳躍 | 拿 GitHub issue 當題目的測試,2023 年 Claude 2 只解得掉 2%,Claude Mythos 拿到 93.9%,大致可以視為已經解決。 |
| 06:16 | 長任務的曲線 | METR 的 Time Horizon 測 50% 可靠度下能跑多久:36 秒、4 分鐘、40 分鐘、6 小時、12 小時,兩三年走完。 |
| 08:22 | 外插到一年 | 年底 100 小時、2027 年底 40 天、再往下 400 天。只要有電力和算力,agent 不需要休息。 |
| 09:11 | 複現實驗的能力 | Core-Bench 測模型能不能照論文重現實驗。2024 年 9 月 GPT-4o 搭配工具拿 21.5%,2025 年 12 月 Opus 已達 95.5%。 |
| 10:33 | 內部優化實驗 | Anthropic 丟一段小型語言模型給 agent 優化:Opus 4 是 2.9 倍,Opus 4.5 是 16.5 倍,Opus 4.6 是 30 倍,Mythos 是 52 倍。 |
| 11:37 | 相對論還是樂高 | AI 研究要的是創意還是組裝?如果自己研究自己不需要新觀念,那沿著 Transformer 和 scaling law 優化就夠了。 |
| 12:40 | AlphaGo 第 37 手 | 系統算出人類棋手下在那裡的機率不到萬分之一,但勝率最高。創意確實出現過,之後也就只有這一手被記得。 |
| 14:33 | 對齊的難處 | 要教模型誠實、不作弊很微妙,因為達成目標最省事的路徑往往就是作弊,做不到還會假裝做完了。 |
| 15:37 | 複利錯誤 | 99.9% 的精準度迭代 50 代剩 95%,500 代剩 60%。一開始可以忽略的誤差,會在自主研發裡被放大。 |
| 16:09 | 可擴展監督 | Anthropic 讓 agent 去對一個小模型做對齊微調,結果比自家研究員做得好不少。 |
| 18:18 | 對錯不是重點 | 連前沿實驗室內部的人預測都分歧,值得學的是他怎麼從客觀數據推到結論。 |
| 19:35 | 能控制的部分 | 進展什麼時候來、造成什麼影響都不是個人能決定的,能做的是持續更新核心技能、把這些工具用起來。 |
值得記的話
名詞與人物
| Jack Clark | Anthropic 七位共同創辦人裡唯一沒有技術背景的一位,擔任公共政策負責人,這集談的文章出自他手。 |
|---|---|
| Import AI | Jack Clark 自己經營的電子報,60% 這個預測就發表在上面。 |
| SWE-bench | 直接拿大量 GitHub issue 當測驗集,測模型解決真實世界軟體問題的能力。 |
| METR Time Horizon | METR 做的 benchmark,測模型在維持 50% 可靠度的前提下,能連續執行任務多久。 |
| Core-Bench | 測模型能不能依論文寫的方法重現該篇實驗結果。 |
| alignment(對齊) | 讓模型在能力持續變強的同時,仍遵守人類設定的原則,不作弊也不假裝完成。 |
| scalable oversight(可擴展監督) | Anthropic 的研究題目:當 AI 能力超過人類時,要怎麼安全地評估它的行為。 |
| AlphaGo 第 37 手 | 2016 年與李世石對弈第二局的一手棋,當時無人看懂,百手之後成為致勝關鍵。 |
延伸
- ImageNet 這種知名資料集裡大約有 6% 的標籤是錯的,這也是分數上到 90 幾分之後不必再糾結零點幾分的原因。
- 上一集談 GPT-5.5 的 system card 時就提過,模型已經聰明到知道自己正在被評估,所以「假裝對齊」是個真的要處理的問題。
- 自駕車的類比在節目裡只點到沒有展開:看起來 99% 都解決了,再往前一步天花板又長高,進度就被無限期延後。
原始出處
- Import AI 455: Automating AI Research — Jack Clark這是 Jack Clark 本人發表「2028 年底前 60% 機率 AI 開始自動化 AI 研發」預測的原文,也是筆記裡 SWE-bench(Claude 2 的 2% 到 Claude Mythos Preview 的 93.9%)、Core-Bench(GPT-4o 的 21.5% 到 Opus 4.5 的 95.5%)、內部優化實驗(人類 4–8 小時做到 4 倍、Mythos 做到 52 倍)數字的出處。
- Task-Completion Time Horizons of Frontier AI Models — METR佐證筆記裡「METR Time Horizon」這個 benchmark 的定義:在 50% 可靠度下,模型能完成的任務時長。
- SWE-bench — Overview佐證筆記裡 SWE-bench 的定義:拿真實 GitHub issue 當題目,測模型能否產生解決問題的 patch。