054 · 駕馭工程之外,世界模型補了什麼
模型一代比一代強,但離 AGI 好像沒有更近。這集拆解 LLM 的先天限制與駕馭工程能走到哪,再看楊立昆的世界模型想補上的是哪一塊。
原標題:LLM 賭錯方向了?從駕馭工程到世界模型 | S2E54
重點摘要
- 競爭白熱化,體感卻停滯Opus 4.7 剛出,GPT-5.5 馬上跟上,錄製當天又冒出開源的 DeepSeek V4。benchmark 一直漂亮,但實際用久了還是會撞到同樣的不足。
- LLM 的兩個先天缺陷沒有狀態,每一輪都得把上下文重新餵給它;加上會產生幻覺,輸出本質上是擲骰子。出錯機率越來越低,但還沒低到可以忽略。
- 駕馭工程在補什麼在模型之上架一層骨架,給它狀態、控制流程、遇到 rate limit 該怎麼辦、怎麼跟 MCP 溝通。Claude Code 外流的原始碼有 3000 多行專門在做這件事。
- 世界模型不是取代 LLMLLM 只從文字表層理解「球打到會痛」,人卻是靠直覺知道前車切進來會撞上。世界模型要的是理解「為什麼」,而不是預測畫面接下來長什麼樣。
- JEPA 的門檻被拉低了新論文用常態分布的機制擋掉特徵崩塌,訓練需求從大機房降到一張 GPU、1500 萬個參數、幾個小時。成果還很弱,但研究生等級的電腦就能跑了。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場提問 | LLM 加上駕馭工程能不能帶我們到 AGI。這集用世界模型當另一條路來回答。 |
| 06:25 | Meta 開發者踩坑 | 想做一鍵發佈短影片的 skill,YouTube 幾乎一次就通,Meta 卻卡在權限。關鍵是 use case 要選那個標示即將淘汰的「其他」,而且選了就不能同一個 app 發 Threads。 |
| 08:47 | 繞道 R2 才打通 | Facebook 上傳沒問題,同一支影片到 Instagram 就一直吐 400。最後改成先上傳 Cloudflare R2、再用 video URL 發佈才解決。 |
| 10:35 | 進步與距離感 | 每次新模型出來都覺得離 AGI 更近,實際用下去又覺得更遠。這種落差是這集的起點。 |
| 11:20 | 自駕車的長尾 | FSD 和 Robotaxi 喊了好幾年,系統確實一直在進步,規模化卻遲遲沒發生。做到 99%,剩下 1% 若是重大車禍就無法量產。 |
| 12:22 | scaling law 的賭注 | 參數、資料、算力堆上去,loss 就降,這是過去幾年多數人押的方向。但它躲不掉 LLM 無狀態與幻覺這兩個底層問題。 |
| 13:27 | 駕馭工程補骨架 | 在模型外層加狀態與控制流程,讓 agent 看起來更穩、甚至像有記憶。Claude Code 外流原始碼裡 3000 多行就在幹這件事。 |
| 14:43 | 另一條路登場 | 世界模型不是要取代 LLM,是補它不足的部分。最大倡導者之一是楊立昆,去年 11 月離開 Meta,今年成立 AMI Labs。 |
| 15:44 | 直覺從哪來 | LLM 做的是文字接龍,只從文字表層認識物理世界。人是看到前車切進來就知道要煞車,小孩是把水杯推下桌才學會東西會摔破。 |
| 17:04 | Sora 不算世界模型 | 生成影片模型是知其然不知其所以然,靠統計匹配畫出「看起來對」的畫面,所以偶爾會生出不合物理的東西。 |
| 18:56 | JEPA 的抽象空間 | 不在像素或 token 層級預測,而是把原始資料映射到維度較低的潛在空間,只留下重要的變化。樹怎麼搖、花草長怎樣,對預測撞不撞到人沒有意義。 |
| 19:59 | 特徵崩塌與新解 | 模型會學會走捷徑,把所有輸入映射到同一個向量就能拿高分。舊解法治標不治本,只有大機房跑得動;新論文要求向量呈常態分布,直接把捷徑堵掉。 |
| 21:18 | 成果還很弱 | 目前只能推測大概 5 步,而且只在模擬環境裡跑,沒上真實機器人。長任務的結果他們自己也說蠻糊的。 |
| 22:05 | 預測:兩者相輔相成 | 短期內 LLM 加駕馭工程還是主流,Google DeepMind 也是兩條路並行,Genie 就是他們的世界模型。未來比較可能是 hybrid 架構,兩種模型各管一塊。 |
| 23:23 | 那人的區別是什麼 | 架構越做越像人腦,反而逼出一個哲學問題。也許最後只剩情感、痛苦與觸感這些真實感受,把我們和 agent 分開。 |
值得記的話
名詞與人物
| Harness Engineering(駕馭工程) | 在大語言模型之上架一層骨架,補上狀態與控制流程,讓 agent 的輸出更穩定。 |
|---|---|
| 世界模型 | 讓模型理解物理世界為什麼這樣運作,而不是只預測下一秒看起來會怎樣。 |
| 楊立昆 | 世界模型最主要的倡導者之一,前 Meta 首席 AI 科學家,2022 年就開始喊這條路。 |
| AMI Labs | 楊立昆離開 Meta 後於今年成立的公司,專門研究世界模型。 |
| JEPA | 聯合嵌入預測架構,把資料映射到低維度的潛在空間做預測,而不是在像素或 token 層級預測。 |
| 特徵崩塌 | JEPA 訓練時模型走捷徑,把所有輸入都映射到同一個向量,預測看似精準卻毫無意義。 |
| LeWorldModel | 上個月發表的論文,用常態分布約束擋住特徵崩塌,把訓練門檻降到一張 GPU。 |
| Genie | Google DeepMind 幾個月前發表的世界模型,是他們並行嘗試的另一條路。 |
| scaling law | 參數、資料量、算力越大,模型 loss 越低,是過去幾年通往 AGI 的主流押注。 |
延伸
- Claude Code 外流的原始碼裡有 3000 多行在處理狀態與控制流程,這集只當成駕馭工程的佐證,沒有細講內容。
- Demis Hassabis 幾個月前的訪問提到 DeepMind 內部同時試多條路線,節目只帶過一句,沒有展開。
- 主持人正在做的短影片自動化流程,前段(挑片段、剪輯、上字幕)還在進行中,後段自動發佈四大平台已經打通。
原始出處
- A Path Towards Autonomous Machine Intelligence(Yann LeCun, 2022, JEPA 原始論文)楊立昆提出 JEPA(聯合嵌入預測架構)概念的原始論文,對應筆記裡「JEPA 聯合嵌入預測架構」的定義來源。
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels楊立昆與 Mila、NYU、Samsung SAIL 團隊發表的新論文,證實用 Gaussian 正規化解決特徵崩塌、約 1500 萬參數可在單張 GPU 上訓練數小時,對應筆記裡「新論文用常態分布的機制擋掉特徵崩塌,訓練需求…降到一張 GPU、1500 萬個參數、幾個小時」。
- Genie 3: A new frontier for world models — Google DeepMindGoogle DeepMind 官方部落格介紹 Genie 3 作為通用世界模型,可即時生成可互動的環境,對應筆記裡「Genie 就是他們的世界模型」。