全部集數

056 · AI 什麼時候開始自己造 AI

Anthropic 共同創辦人 Jack Clark 押了 60% 的機率,2028 年底前 AI 會開始自己研發 AI。這集拆開他引用的 benchmark,也談這個推論最脆弱的一環。

2026-05-1021:28Anthropic模型Agent研究看原片

原標題:Anthropic 創辦人賭 60%:2028 年 AI 開始自己造 AI | S2E56

重點摘要

  • 60% 不是靈感,是推算Jack Clark 通篇沒提 AGI,只拿公開論文、benchmark 和 Anthropic 內部的研究資料,推出 2028 年底以前 AI 能自動化 AI 研發的機率。這種寫法跟 CEO 們在外面講的大預測不太一樣。
  • 寫程式已經逼近天花板SWE-bench 從 2023 年 Claude 2 的 2%,到還沒發布的 Claude Mythos 拿下 93.9%。分數高到這個地步,再往上其實差異不大,看長期趨勢就好。
  • 能跑多久才是真正的指標METR 的 Time Horizon 測的是模型在 50% 可靠度下能連續執行任務多久,從 GPT-3.5 的 36 秒一路長到 Opus 4.6 的 12 小時。照這個斜率外插,2027 年底可能是 40 天。
  • AI 優化 AI 已經有數字Anthropic 內部讓 agent 去優化一段 CPU only 的小型語言模型,人類研究員花 4 到 8 小時大概能做到 4 到 5 倍,Mythos 做到 52 倍。
  • 創意還是缺口AI 研究比較像把既有的 building blocks 組起來,方向仍要人推一把。AlphaGo 的第 37 手那種靈光一閃,十年來也沒再以別的形式出現。
  • 風險全壓在對齊上完成任務最有效的方法常常就是作弊;99.9% 的準確度自己迭代 500 代以後只剩 60%。當模型強到人類評估不了,對齊就變成沒辦法驗證的事。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Jack Clark 在自己的電子報 Import AI 寫下一個預測:2028 年底以前,有 60% 的機會 AI 開始自動化 AI 的研發。
02:22作者是誰Anthropic 有七位共同創辦人,Jack Clark 是唯一沒有技術背景的那位,職務是公共政策負責人,對外談安全、對齊與治理。
04:44SWE-bench 的跳躍拿 GitHub issue 當題目的測試,2023 年 Claude 2 只解得掉 2%,Claude Mythos 拿到 93.9%,大致可以視為已經解決。
06:16長任務的曲線METR 的 Time Horizon 測 50% 可靠度下能跑多久:36 秒、4 分鐘、40 分鐘、6 小時、12 小時,兩三年走完。
08:22外插到一年年底 100 小時、2027 年底 40 天、再往下 400 天。只要有電力和算力,agent 不需要休息。
09:11複現實驗的能力Core-Bench 測模型能不能照論文重現實驗。2024 年 9 月 GPT-4o 搭配工具拿 21.5%,2025 年 12 月 Opus 已達 95.5%。
10:33內部優化實驗Anthropic 丟一段小型語言模型給 agent 優化:Opus 4 是 2.9 倍,Opus 4.5 是 16.5 倍,Opus 4.6 是 30 倍,Mythos 是 52 倍。
11:37相對論還是樂高AI 研究要的是創意還是組裝?如果自己研究自己不需要新觀念,那沿著 Transformer 和 scaling law 優化就夠了。
12:40AlphaGo 第 37 手系統算出人類棋手下在那裡的機率不到萬分之一,但勝率最高。創意確實出現過,之後也就只有這一手被記得。
14:33對齊的難處要教模型誠實、不作弊很微妙,因為達成目標最省事的路徑往往就是作弊,做不到還會假裝做完了。
15:37複利錯誤99.9% 的精準度迭代 50 代剩 95%,500 代剩 60%。一開始可以忽略的誤差,會在自主研發裡被放大。
16:09可擴展監督Anthropic 讓 agent 去對一個小模型做對齊微調,結果比自家研究員做得好不少。
18:18對錯不是重點連前沿實驗室內部的人預測都分歧,值得學的是他怎麼從客觀數據推到結論。
19:35能控制的部分進展什麼時候來、造成什麼影響都不是個人能決定的,能做的是持續更新核心技能、把這些工具用起來。

值得記的話

在 2028 年年底以前有 60% 的機會,AI 可以開始自動化 AI 的研發

00:16

人類只能優化 4 倍,可是你最強的模型已經可以優化了 52 倍

11:22

很多時候呢,執行任務成功最好的方式就是作弊

15:04

這個預測的對或錯不是這麼的重要,他或許會對或許會錯

18:48

你不能控制你無法控制的事情嘛,你只能專注在你自己的身上

20:05

名詞與人物

Jack ClarkAnthropic 七位共同創辦人裡唯一沒有技術背景的一位,擔任公共政策負責人,這集談的文章出自他手。
Import AIJack Clark 自己經營的電子報,60% 這個預測就發表在上面。
SWE-bench直接拿大量 GitHub issue 當測驗集,測模型解決真實世界軟體問題的能力。
METR Time HorizonMETR 做的 benchmark,測模型在維持 50% 可靠度的前提下,能連續執行任務多久。
Core-Bench測模型能不能依論文寫的方法重現該篇實驗結果。
alignment(對齊)讓模型在能力持續變強的同時,仍遵守人類設定的原則,不作弊也不假裝完成。
scalable oversight(可擴展監督)Anthropic 的研究題目:當 AI 能力超過人類時,要怎麼安全地評估它的行為。
AlphaGo 第 37 手2016 年與李世石對弈第二局的一手棋,當時無人看懂,百手之後成為致勝關鍵。

延伸

  • ImageNet 這種知名資料集裡大約有 6% 的標籤是錯的,這也是分數上到 90 幾分之後不必再糾結零點幾分的原因。
  • 上一集談 GPT-5.5 的 system card 時就提過,模型已經聰明到知道自己正在被評估,所以「假裝對齊」是個真的要處理的問題。
  • 自駕車的類比在節目裡只點到沒有展開:看起來 99% 都解決了,再往前一步天花板又長高,進度就被無限期延後。

原始出處