EP 2582022-01-222:45:10
LeCun 談自我監督學習的暗物質
Yann LeCun
LeCun 用蛋糕比喻解釋自我監督學習為何效率最高,主張純文字訓練不出真智慧,也為 Facebook 的社會爭議辯護。
Yann LeCun: Dark Matter of Intelligence and Self-Supervised Learning | Lex Fridman Podcast #258在 YouTube 看 ↗
重點6 條
- 自我監督學習比監督式與強化學習有效率得多:他用「蛋糕比喻」解釋差距——強化學習每次只給一個純量回饋、監督學習給幾個位元,自我監督學習理想上能從一整段影片的後續內容榨出巨量資訊。
- 世界模型是智慧的核心,但還缺三塊拼圖:用自我監督學習表徵世界、讓推理相容於梯度學習、學出階層式的行動規劃;他強調目前連貓的常識水準都還做不到,第三塊完全沒人知道怎麼解。
- 純文字走不到真智慧:他主張像「推桌子,手機會跟著移動」這種直覺物理常識,沒有任何文字明確寫過;30 年前想靠人工窮舉常識的 Cyc 計畫,他認為基本上沒希望。
- 非對比式學習是他當下最興奮的方向:從早年提出的孿生網路(Siamese network)發展到 Barlow Twins、VICReg,靠正則化避免系統「躺平」只輸出同一個值,不需要對比式學習所需的大量負樣本。
- 意識可能只是大腦只有一套世界模型的副作用:他提出一個非正統假設——正因為大腦一次只能配置一套世界模型去應付當下情境,才需要一個「執行者」去切換配置,這個切換過程可能就是意識,而不是心智強大的證明。
- 他為 Facebook 的社會影響辯護:引用學界(非公司資助)研究,包括一項讓人暫停使用臉書結果反而更極化的實驗,主張美國政治極化在 Mark Zuckerberg 出生前就在持續上升。
時間軸26 段
他解釋標題由來:監督學習與強化學習都需要海量標註或模擬才學得會事情,嬰兒卻單靠觀察就能累積背景知識,這塊沒被機器複製到的能力就是「暗物質」。
沒有世界模型的強化學習系統得真的摔下懸崖好幾千次才學到教訓;人類因為有直覺物理的背景知識,一看方向盤角度就知道會出事。
強化學習每次只給一個純量回饋、監督學習給幾個位元,自我監督學習理想上是給一整段影片後續的資訊量,這是它效率高的原因。
文字可以把有限詞彙轉成機率分布來表示不確定性,但影片的可能延續是無限、連續、高維的,目前沒人知道怎麼恰當表示這種不確定性。
他認為智慧某個層次上確實可能就是統計,但那不代表沒有因果結構;行動要成為模型的輸入,才學得出因果關係,而不只是相關性。
他把問題拆成三塊——用自我監督學習表徵世界、讓推理相容於梯度學習、學出階層式的行動規劃;目前連貓的常識水準都還做不到,第三塊完全沒人知道怎麼解。
他把 1960 年代 NASA 算火箭軌跡用的模型預測控制,類比成一種推理;也認同世界模型要處理其他行動者的博弈性質,用開車讓路給人下車的默契,說明這種互動其實比下棋更複雜,只是人類演化到擅長它。
他把智能主體拆成三個模組——預測世界的模型、驅動行為的內在動機(基底核)、預先判斷結果好壞的評論者;三者都要能用梯度估計,才能做規劃與推理。
他估計貓的全部常識大概塞在八億個神經元裡,幾乎都是靠類似自我監督學習學來的,只有極小一部分靠強化學習,監督學習幾乎沒份。
他認為人類把語言與社會互動看得太重;紅毛猩猩獨居也很聰明,章魚沒有父母、幾乎不社交,半年就變成熟,說明智慧不必然跟語言或社會性綁在一起。
資料增強是把訓練圖片做旋轉、裁切等變形;他在 90 年代提出用「孿生網路」比較兩張變形圖片的表徵,這後來發展成對比式學習。
對比式學習在高維空間需要太多負樣本才有效,他轉向非對比式方法,靠正則化避免系統「躺平」只輸出同一個值。
他主張純文字訓練走不到真智慧,因為「推桌子,手機會跟著移動」這種直覺物理常識,沒有任何文字明確寫過;30 年前想窮舉常識的 Cyc 計畫,他認為基本上沒希望。
他認為多工學習、持續學習這些對短期工程很有用,像 Tesla Autopilot 那種一次訓練上百個任務的做法;他也回顧語音辨識、電腦視覺等領域都經歷過從手工特徵走向端對端學習的過程。
他同意要學出因果模型,系統得真的能對世界採取行動、觀察後果,不能只是被動觀察;接著拋出一個非正統假設——大腦一次只能配置一套世界模型應付當下情境,因此需要一個「執行者」切換配置,這個切換過程可能就是意識。
面對「人類因為理解死亡而獨特」的說法,他不認同有質的差異,認為人與貓的差別只是人類的長期規劃能力比較好,死亡意識只是這種能力的副產品。
他主張只要系統有內在動機、又有預先判斷結果好壞的評論者,就自然會產生恐懼與喜悅這類情緒;接著討論如果機器人可以被完整備份還原,「謀殺」的意義會不會改變,機器人若累積了主人的個人資料,分手後該不該被抹除記憶,也牽涉隱私倫理。
他認為機器在所有領域超越人類「毫無疑問」會發生,但比很多人(包括馬斯克)想的難很多;連 DeepMind 內部也有人五年前覺得簡單、現在覺得難。
他回顧 FAIR 從十幾個工程師的小組長成研究機構,產出 PyTorch 等開源工具;把深度學習從 Meta 服務裡拿掉,公司會直接垮掉,他現在是首席科學家,不再管日常營運。
他引用學界(非 Meta 資助)研究反駁「臉書讓社會更極化」的說法,包括一項讓人暫停使用臉書幾週、結果反而更極化的實驗;也把社群媒體的爭議類比成印刷術——聖經被印出來讓人自己讀,間接引發了兩百年的宗教戰爭,但沒有人會說印刷術是壞主意。
他介紹被 NeurIPS 拒絕的 VICReg 論文,解釋兩種處理預測不確定性的方式——直接生成內容,或在抽象表徵空間裡比對;並坦言自己已經從第一種陣營整個換邊站到第二種。
他批評審查者傾向靠「挑毛病」交差,真正有新意的論文反而不容易過;他多年前提過一套開放式審查構想——論文放上 Archive,由具名的「審查團體」自願認領評論,並建立可信度制度。
他用「把 MNIST 像素隨機置換」做例子,說明複雜度取決於你戴哪副眼鏡——同一份資料,換一套感知方式,看起來的複雜程度完全不同,這也是為什麼人類可能認不出外星生命。
他從小玩模型飛機、自學電子學,疫情待在紐澤西的工作室裡,終於認真動手做一支表現力更好的電子吹管樂器(EWI)。
他舉了幾個 AI 可能解決重大問題的例子——找到能有效分離氫與氧的材料就能解決能源儲存,深度學習或許也能找出穩定電漿的控制器,讓核融合實用化。
他舉石墨烯疊兩層、扭轉特定角度就會變成超導體、卻沒人知道原理為例,說明深度學習或許能學出材料科學裡「知其然不知其所以然」的規律,甚至反向設計出想要的物理性質。