全部集數

054 · 駕馭工程之外,世界模型補了什麼

模型一代比一代強,但離 AGI 好像沒有更近。這集拆解 LLM 的先天限制與駕馭工程能走到哪,再看楊立昆的世界模型想補上的是哪一塊。

2026-04-2624:57模型研究產業觀察開發工具看原片

原標題:LLM 賭錯方向了?從駕馭工程到世界模型 | S2E54

重點摘要

  • 競爭白熱化,體感卻停滯Opus 4.7 剛出,GPT-5.5 馬上跟上,錄製當天又冒出開源的 DeepSeek V4。benchmark 一直漂亮,但實際用久了還是會撞到同樣的不足。
  • LLM 的兩個先天缺陷沒有狀態,每一輪都得把上下文重新餵給它;加上會產生幻覺,輸出本質上是擲骰子。出錯機率越來越低,但還沒低到可以忽略。
  • 駕馭工程在補什麼在模型之上架一層骨架,給它狀態、控制流程、遇到 rate limit 該怎麼辦、怎麼跟 MCP 溝通。Claude Code 外流的原始碼有 3000 多行專門在做這件事。
  • 世界模型不是取代 LLMLLM 只從文字表層理解「球打到會痛」,人卻是靠直覺知道前車切進來會撞上。世界模型要的是理解「為什麼」,而不是預測畫面接下來長什麼樣。
  • JEPA 的門檻被拉低了新論文用常態分布的機制擋掉特徵崩塌,訓練需求從大機房降到一張 GPU、1500 萬個參數、幾個小時。成果還很弱,但研究生等級的電腦就能跑了。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場提問LLM 加上駕馭工程能不能帶我們到 AGI。這集用世界模型當另一條路來回答。
06:25Meta 開發者踩坑想做一鍵發佈短影片的 skill,YouTube 幾乎一次就通,Meta 卻卡在權限。關鍵是 use case 要選那個標示即將淘汰的「其他」,而且選了就不能同一個 app 發 Threads。
08:47繞道 R2 才打通Facebook 上傳沒問題,同一支影片到 Instagram 就一直吐 400。最後改成先上傳 Cloudflare R2、再用 video URL 發佈才解決。
10:35進步與距離感每次新模型出來都覺得離 AGI 更近,實際用下去又覺得更遠。這種落差是這集的起點。
11:20自駕車的長尾FSD 和 Robotaxi 喊了好幾年,系統確實一直在進步,規模化卻遲遲沒發生。做到 99%,剩下 1% 若是重大車禍就無法量產。
12:22scaling law 的賭注參數、資料、算力堆上去,loss 就降,這是過去幾年多數人押的方向。但它躲不掉 LLM 無狀態與幻覺這兩個底層問題。
13:27駕馭工程補骨架在模型外層加狀態與控制流程,讓 agent 看起來更穩、甚至像有記憶。Claude Code 外流原始碼裡 3000 多行就在幹這件事。
14:43另一條路登場世界模型不是要取代 LLM,是補它不足的部分。最大倡導者之一是楊立昆,去年 11 月離開 Meta,今年成立 AMI Labs。
15:44直覺從哪來LLM 做的是文字接龍,只從文字表層認識物理世界。人是看到前車切進來就知道要煞車,小孩是把水杯推下桌才學會東西會摔破。
17:04Sora 不算世界模型生成影片模型是知其然不知其所以然,靠統計匹配畫出「看起來對」的畫面,所以偶爾會生出不合物理的東西。
18:56JEPA 的抽象空間不在像素或 token 層級預測,而是把原始資料映射到維度較低的潛在空間,只留下重要的變化。樹怎麼搖、花草長怎樣,對預測撞不撞到人沒有意義。
19:59特徵崩塌與新解模型會學會走捷徑,把所有輸入映射到同一個向量就能拿高分。舊解法治標不治本,只有大機房跑得動;新論文要求向量呈常態分布,直接把捷徑堵掉。
21:18成果還很弱目前只能推測大概 5 步,而且只在模擬環境裡跑,沒上真實機器人。長任務的結果他們自己也說蠻糊的。
22:05預測:兩者相輔相成短期內 LLM 加駕馭工程還是主流,Google DeepMind 也是兩條路並行,Genie 就是他們的世界模型。未來比較可能是 hybrid 架構,兩種模型各管一塊。
23:23那人的區別是什麼架構越做越像人腦,反而逼出一個哲學問題。也許最後只剩情感、痛苦與觸感這些真實感受,把我們和 agent 分開。

值得記的話

它只是去畫出來這個世界看起來接下來會發生什麼事情

17:20

我如果要得到高分的話,我就把所有的輸入資料都映射到一樣的向量就好了

20:14

他們現在只需要 1500 萬個參數、一張 GPU 跟幾個小時,就可以訓練這個世界模型

21:01

這些東西呢也只是在模擬的環境跑,它並沒有在真實的機器人上面跑

21:33

如果真的變成這樣的話,那真的是跟人類越來越像了,所以你不覺得這個有點細思極恐嗎

23:07

名詞與人物

Harness Engineering(駕馭工程)在大語言模型之上架一層骨架,補上狀態與控制流程,讓 agent 的輸出更穩定。
世界模型讓模型理解物理世界為什麼這樣運作,而不是只預測下一秒看起來會怎樣。
楊立昆世界模型最主要的倡導者之一,前 Meta 首席 AI 科學家,2022 年就開始喊這條路。
AMI Labs楊立昆離開 Meta 後於今年成立的公司,專門研究世界模型。
JEPA聯合嵌入預測架構,把資料映射到低維度的潛在空間做預測,而不是在像素或 token 層級預測。
特徵崩塌JEPA 訓練時模型走捷徑,把所有輸入都映射到同一個向量,預測看似精準卻毫無意義。
LeWorldModel上個月發表的論文,用常態分布約束擋住特徵崩塌,把訓練門檻降到一張 GPU。
GenieGoogle DeepMind 幾個月前發表的世界模型,是他們並行嘗試的另一條路。
scaling law參數、資料量、算力越大,模型 loss 越低,是過去幾年通往 AGI 的主流押注。

延伸

  • Claude Code 外流的原始碼裡有 3000 多行在處理狀態與控制流程,這集只當成駕馭工程的佐證,沒有細講內容。
  • Demis Hassabis 幾個月前的訪問提到 DeepMind 內部同時試多條路線,節目只帶過一句,沒有展開。
  • 主持人正在做的短影片自動化流程,前段(挑片段、剪輯、上字幕)還在進行中,後段自動發佈四大平台已經打通。

原始出處