EP 4162024-03-072:47:17 ROUND 2
LeCun 談 LLM 極限與開源之路
Yann LeCun
Yann LeCun 主張自回歸 LLM 缺乏規劃與世界理解,改用 JEPA 在抽象空間預測世界,並認為唯有開源才能避免 AI 知識被少數公司壟斷。
Yann Lecun: Meta AI, Open Source, Limits of LLMs, AGI & the Future of AI | Lex Fridman Podcast #416在 YouTube 看 ↗
重點6 條
- LLM 缺理解、缺記憶、缺規劃:LeCun 認為智慧行為要有四樣東西——理解物理世界、持久記憶、推理、規劃,LLM 目前這四樣都只有很粗淺的能力,光靠預測下一個詞走不到超人類智慧。
- 語言其實是很貧乏的資料:他拿四歲小孩單靠視覺累積的資訊量,對比 LLM 訓練用掉的全部文字,算出來語言含的資訊量遠遠比不上感官經驗。
- JEPA:只預測抽象表徵,不重建每個像素:他主張放棄生成式的路線,改成在抽象表徵空間裡做預測,把樹葉搖晃這種本來就猜不到的雜訊直接濾掉;V-JEPA 已經能從遮罩過的影片學出基本的物理常識。
- 幻覺是自回歸誤差疊出來的:每產生一個詞都有出錯機率,誤差一路疊加會讓答對的機率隨句子長度指數下降;他也指出 LLM 對每個 token 花的算力是固定的,不會因為問題難而多想,這點跟人不一樣。
- 開源才擋得住權力集中:他從 Google Gemini 1.5 審查爭議談起,主張沒有任何系統能做到人人都覺得公平,唯一辦法是讓不同群體都能把基礎模型拿去微調成自己要的版本,知識來源才不會被少數公司壟斷。
- AGI 不會是某天「開機」就出現:他認為超級智慧是漸進累積出來的,支配慾也不是智慧自動帶來的東西,而是社會性物種才有的特徵;AI 安全要靠反覆迭代設計,像渦輪引擎的可靠度是幾十年慢慢磨出來的。
時間軸26 段
LeCun 開門見山主張,自回歸 LLM 缺乏理解物理世界、持久記憶、推理與規劃這四項智慧行為的要素,這條路走不到超人類智慧。
他拿四歲小孩靠視覺累積的資訊量,對比 LLM 訓練用掉的全部文字,說明語言其實是相對貧乏的資料來源。
兩人辯論語言本身夠不夠建構出世界模型;LeCun 認為智慧一定要扎根在某種現實(不一定是物理的),語言只是很粗略的表徵。
他認為現在把視覺塞進 LLM 的做法只是接上去的 hack,不是端對端訓練出來理解世界,也還不懂直覺物理。
影片是高維連續的資料,沒辦法像文字一樣窮舉所有可能畫面,FAIR 花了十年想用生成模型預測影片都沒成功。
放棄重建每個像素,改成只預測抽象表徵,濾掉樹葉搖晃這類本來就不可預測的雜訊。
介紹 DINO、iJEPA 等 FAIR 方法,靠編碼器共享權重、加正則化項,避免系統學到「什麼都輸出同一個值」的塌縮解。
遮罩一段影片訓練出的表徵,第一次能讓系統辨認影片裡的動作,也初步能判斷畫面是否違反物理常識。
有了「預測某個動作會讓世界變成什麼狀態」的模型才談得上規劃,這正是 LLM 做不到的事;他用「從紐約到巴黎」拆解成搭機、叫車、站起來走路等層層子目標為例,坦言沒人知道怎麼讓 AI 自己學出這種階層式規劃。
他把 LLM 的驚人表現歸功於自監督學習本身的成功,但提醒我們是被語言的流暢騙了,杜林測試因此被 AI 圈公認是很差的智慧測試;針對「常識是不是就藏在文字裡」的爭論,他反駁人類嬰兒時期靠觀察累積的知識,多數根本沒被寫進文字。
每個字都有出錯機率,誤差會隨句子長度指數累積;微調能覆蓋大多數常見問題,但提問的長尾大到不可能被完整覆蓋。
每個 token 花掉的運算量固定,不會因為問題難而多想;人類遇到難題會多花時間,這是 LLM 目前沒有的機制。
在抽象表徵空間裡用梯度下降找出「最像好答案」的表徵,再解碼成文字,而不是一個詞一個詞生成。
用一個純量分數衡量答案跟提問合不合,分數愈低愈好,這套系統要靠正則化避免「隨便都給零分」的塌縮。
他不反對 RL,但認為它樣本效率太差,應該先用觀察學好世界模型,只在需要校正模型或目標函數時才用 RL 探索。
從黑人版華盛頓畫像,到拒絕討論天安門事件與坦克人,他認為這是去偏見做過頭又不透明的示範案例。
沒有任何系統能做到人人都覺得公平,他主張知識來源不能被西岸少數幾家公司壟斷;至於商業模式,他解釋 Meta 靠服務(廣告、企業客戶)賺錢,不是靠賣模型本身,開源基礎模型反而能讓外部生態幫忙把它變得更好用。
他引用研究指出 LLM 並不會讓製造生物或化學武器變得更容易,真正的門檻在於實驗室操作的實務經驗。
他預告 Llama 3 之後會加入多模態與規劃能力,V-JEPA 剛發表是這個方向的第一步;但也坦言硬體效率還差人腦一大截,GPU 耗電是人腦的數萬倍。
他反覆強調超級智慧不會是某天「開機」就出現,而是漸進累積;智慧本身是多維技能的集合,沒辦法用單一分數比較。
他主張想支配別人是社會性物種才有的特徵(像人類、狒狒、狼),不是智慧本身自動帶來的,而且人類會替 AI 設計服從人類的護欄。
他用渦輪引擎花了幾十年才變得極度可靠為例,主張 AI 安全靠的是反覆迭代改良設計,不是先證明出一條萬無一失的公式。
Lex 假設一個極度有說服力、能操弄人心的 AI 系統會不會像武器一樣危險;LeCun 認為這跟核武不同,AI 會是漸進、邊做邊修正的軍備競賽,使用者端也會有一樣聰明的 AI 助理幫忙擋下這類操弄,就像信箱的垃圾郵件過濾器。
他重講自己「原子筆」的哏:每次有新科技出現,人們就會出現同一套「這會毀了社會、應該立法禁止」的反應;也提到 Pessimist Archive 這個網站,蒐集了電力、火車、漫畫等科技被說成會毀掉一切的歷史剪報。
話題轉向機器人:他點名 Tesla Optimus、Boston Dynamics、Figure AI、Unitree 這些做人形機器人的公司,認為接下來十年會很精彩,但家用機器人要做到清理餐桌、洗碗這種事,目前還差得遠。
他把 AI 助理比擬成印刷術:讓每個人都變聰明,過程也可能帶來動盪,但整體是好事。