EP 712020-02-141:44:55 ROUND 2
Vapnik:用謂詞逼近智慧本質
Vladimir Vapnik
Vapnik 二度上節目,主張找到對的謂詞能讓機器用極少樣本學會辨識,這個想法一路連到柏拉圖的理型世界。
Vladimir Vapnik: Predicates, Invariants, and the Essence of Intelligence | Lex Fridman Podcast #71在 YouTube 看 ↗
重點6 條
- 謂詞與不變量:Vapnik 認為智慧的核心是找到「謂詞」——一種套進資料後能大幅縮小可用函數集合的規則,產生的結果叫「不變量」。他相信好的謂詞應該像柏拉圖講的理型一樣,抽象、而且能跨任務通用。
- 弱收斂勝過強收斂:他花了大半段訪談解釋自己研究了五十年強收斂,直到最近才想通弱收斂才是關鍵——不用要求兩個函數在每個點都逼近,只要在做內積後的值收斂就夠,這樣才擠得出真正好用的容許函數集合。
- 手寫數字辨識挑戰:他公開提出挑戰,要用比現有神經網路少上百倍的訓練樣本做到同樣的辨識率,認為做到這件事需要的就是智慧;對稱性是他目前想到最明確的一個謂詞例子。
- 對深度學習的評語:他說自己認識的深度學習就只有 LeCun 的卷積網路,本質上就是「保留平移不變量」這一個謂詞;他認為神經網路的容許函數集合是手工湊出來的,不是用不變量推出來的,整個領域該多花力氣找謂詞。
- 用特權資訊學習:他提到跟一位研究俄國詩歌的朋友合作,請她用詩的意象描述一批手寫數字圖片,再把這些文字描述當成訓練時才看得到的「特權資訊」一起餵給模型,辨識效果明顯變好。
- 從音樂與人生談起:訪談尾聲他用樂評描述巴赫與蕭邦時用詞完全不同這件事,說明抽象描述背後藏著謂詞;面對人生意義的提問,他說跟一位談文學的作家比,自己在懂生活這件事上只是個小孩。
時間軸26 段
兩人從前一天聊到的 Turing 接著往下,Vapnik 認為工程只是模仿人的行為,理解智慧完全是另一回事,他把這個想法跟 Propp 分析民間故事的謂詞連在一起。
Lex 補充 Vladimir Propp 在 1928 年《故事形態學》歸納出 31 個敘事單元,接著拉回 Turing 的模仿遊戲;Vapnik 說模仿很有用,自駕車就是例子,但理解是哲學問題,他相信從柏拉圖開始的「理型世界」。
人的行為形式很多,謂詞卻少得多,同一個謂詞套到不同資料會生出不同的不變量;他由此帶出手寫數字挑戰,認為要用少 100 到 200 倍的樣本打破紀錄,就需要智慧。
Vapnik 把最簡單的謂詞定義成一個函數,拿來做內積;他舉對稱性與「結構化程度」當成影像辨識最早想到的兩個謂詞例子。
他拿音樂評論家描述音樂用的詞彙類比,認為好的影像謂詞也該有類似的語彙;不變量則是把某個謂詞套進一張具體圖片後得到的投影值。
Vapnik 把想法接回柏拉圖的理型論,主張存在一個抽象的理型世界,現實中的資料只是它的投影;Lex 點出這條從柏拉圖、黑格爾到 Wigner 的線,他表示同意。
兩人細談對稱性這個謂詞還能再分,例如字母 S 有垂直反對稱,也有對角或垂直方向的對稱,程度上也能量化成一個數值。
Vapnik 解釋兩種收斂:強收斂要求兩個函數在每個點的差平方積分要小,弱收斂只要求函數做內積後的值收斂;他說容許函數集合就是靠弱收斂挑出來的。
他強調謂詞跟理型一樣是抽象、跨任務的,不是為特定問題設計;兩人接著討論這種好謂詞能不能靠機器自動找出來,而不只靠人的直覺。
Vapnik 說他認識的深度學習就只有 LeCun 的卷積網路,本質上是「保留平移不變量」這一個謂詞;LeCun 25 年前做出來之後,再也沒有這麼清楚的謂詞,他不懂為什麼要談「深度網路」,而不是談保有這個謂詞的分段線性函數。
他解釋每加入一個不變量的限制,可用的函數集合就會跟著縮小;VC 維度就是衡量這個集合「有多大」的指標,集合愈小需要的訓練資料愈少。
Vapnik 用「長得像鴨子、游泳像鴨子、叫聲像鴨子」比喻好謂詞的條件——重點不是一定要懂鴨子,而是這個規則要能大幅縮小可用的函數集合。
Lex 追問如果把 Propp 的敘事單元丟給不懂人類文化的外星物種,這些謂詞還有沒有用;Vapnik 反問 Lex 是否「理解」數字影像,藉此把話題拉回謂詞本身。
Vapnik 說他找新謂詞的方法接近物理學——找出現有謂詞解釋不了的資料,再補上新謂詞消除矛盾;對 1980 年代專家系統那類純邏輯推理,他不看好,認為得先「懂生活」才找得到好謂詞。
Vapnik 認為若解開手寫數字挑戰,幾乎能立刻用同一套想法理解一般影像;Lex 追問三維世界投影到二維平面會不會需要完全不同層級的常識,他坦言自己還沒想過那一步。
他說自己是想通弱收斂之後才真正理解柏拉圖在講什麼,並把這條思路接到黑格爾與 Propp,強調理解仍然是把抽象理型投影回現實資料。
估謂詞在訓練資料上的平均值時,他說用一般的大數法則就夠,不需要一致大數法則;Lex 把這說成「發現好謂詞是人類智慧的基礎」,他糾正是「發現你對世界的理解」,謂詞是抽象的,可以套到很多任務上。
被問到 Chomsky 與語言在理解上的角色,Vapnik 坦言語言太複雜、不是他這輩子能碰的題目,寧可先把手寫數字這種簡單問題做透。
他重申目前用六萬筆數字圖片訓練是「方向錯了」,從很少的例子學起,會找到跟現在不一樣的原則(Lex 拿嬰兒類比,他說自己不懂嬰兒),而且這些原則最後應該要能讓人看懂、講得出來,對稱性就是一個例子。
被問到統計學習理論裡最美的概念,Vapnik 選了一致收斂——不能只看單一函數的誤差是否收斂,要整組候選函數一起收斂,學習才有保證。
他偏好能推出封閉解的方法,認為那才是走對路的訊號;目前想找更適合這組收斂界線的核函數,懷疑徑向基函數還有改進空間。
對於要不要在神經網路加入類似人類反覆思考的遞迴機制,Vapnik 說到目前為止都還沒遇到非用不可的情況,他反而覺得問出好問題比推理本身更難。
被問到哲學在機器學習裡扮演什麼角色,他把哲學定義成「理解人生」,說自己花了五十年才想通弱收斂,靠的不是一時的興奮,而是不斷回頭檢討做不到的地方。
兩人短暫切換成俄語聊童年回憶,回到英語後 Vapnik 說樂評描述巴赫與蕭邦時用的詞彙完全不同,他相信整理這些詞彙有機會反推出通用的謂詞;被問到怕不怕死,他說不太怕,只遺憾可能做不完這個要花很多年的計畫。
他提到一位研究俄國詩歌的朋友,曾用詩的意象描述一批手寫數字圖片;他把這些文字說明當成訓練時才看得到的「特權資訊」一起餵給模型,效果明顯更好,可惜這位朋友已經過世。
面對人生意義的提問,Vapnik 提到 Strugatsky 兄弟筆下人類分裂成「普通人」與「聰明人」兩條路的構想;他說跟一位每週聽他談文學的作家比,自己只是個小孩,最後說自己很清楚自己的極限。