← 回到天際線 思考機器第 28 層 / 102

EP 1102020-07-211:41:36

電腦視覺,為了行動而生

Jitendra Malik

柏克萊電腦視覺學者 Jitendra Malik 談這個領域被低估的難度、感知與行動的演化關係,以及研究生涯教會他怎麼挑對問題。

Jitendra Malik: Computer Vision | Lex Fridman Podcast #110在 YouTube 看 ↗

重點6 條

  1. 電腦視覺其實比看起來難得多:Malik 說多數視覺處理是人腦在意識不到的情況下完成的,這種「毫不費力」的錯覺讓早期 AI 研究低估了難度;他認為早期還情有可原,今天再犯就說不過去,而大家一再掉進去,是因為他所謂的「成功的第一步的謬誤」——解決一個視覺問題的 50% 只要一分鐘,做到 90% 要一天,99% 要五年,99.99% 可能一輩子都碰不到。
  2. 感知的根本目的是引導行動:他從演化角度解釋,五億年前最早的多細胞動物開始,移動與感知就是互相成就的兩件事——能移動才用得上感知到的資訊,能感知才知道要往哪裡移動;他認為電腦視覺圈把問題切成物件偵測、三維重建等子題,是科學家自己加上去的結構,實際上這些處理是同時在進行的。
  3. 人是靠多年視覺經驗學開車,不是從零開始:他指出,人類進駕訓班之前,視覺能力大概在兩歲前就已經打底,知道世界是立體的、物體會被遮擋、身體怎麼動;十六歲進駕訓班真正在學的是控制方向盤與煞車等操作,不是重新學怎麼看世界。這跟現在的神經網路得靠大量資料從零學習不同,他也提到用真實機器人與模擬環境(例如 Facebook AI 的 Habitat)讓系統主動探索,是縮小這個差距的方向。
  4. 能主動行動,才跨得過相關與因果的界線:他認為系統能在世界裡主動行動很重要,因為這是跨越「相關不等於因果」的一條路。他提到 Judea Pearl 認為深度學習的成功只是「曲線擬合」,但他自己並不完全認同這個說法,主張因果推理不是單一萬靈丹;他認為建立因果模型最可靠的方法之一是隨機對照實驗,而小孩其實一直在小規模地做這種控制實驗——這也呼應他同事 Alison Gopnik 在《The Scientist in the Crib》裡的論點。
  5. 黑盒子不是原罪,可解釋性要看場合:他認為人類本來就無法完全互相解釋,只要效能夠好,他願意接受內部是黑盒子的系統;但在醫療診斷這類場合,判斷是根據哪個群體的資料訓練出來的很重要,因為不同群體之間可能有落差,這時候誤差範圍與信心程度比單一答案更關鍵。
  6. 挑對問題比技術能力更重要:回顧在柏克萊當教授三十四年的經驗,他認為短期的研究成敗看技術能力,但長期的研究方向取決於會不會挑問題;他借用諾貝爾獎得主 Peter Medawar 的說法,把研究比喻成「可解的技藝」——找到那個還沒解決、但已經有「軟肋」可以下手的問題,而不是一頭撞向還沒成熟的題目。

時間軸26 段

01 03:04
電腦視覺為何難

從 1966 年 MIT 的 Summer Vision Project 談起——當時打算讓學生一個暑假解決電腦視覺;Malik 認為多數視覺處理是無意識完成的,這種「毫不費力」的錯覺讓人低估難度,他稱之為「成功的第一步的謬誤」。

02 07:30
視覺需要多少理解

被問到看懂一個場景需要多少常識推理,他認為感覺、知覺、認知的分界是人為劃的,問題在每個層次都有;需要多少理解要看應用:圖片搜尋錯幾張沒關係,開車就攸關人命。他也因此對近期實現完全自駕持悲觀態度,理由是總會有那 0.01% 的情況需要相當複雜的認知推理。

03 10:07
自駕車與視覺

談到 Tesla Autopilot 這種以視覺為主的系統,Malik 認為高速公路等特定情境下的自駕已經相對成熟(1980 年代慕尼黑就有示範),但要應付所有邊界情況需要更深的認知理解;他把預測其他人車的行為也算進視覺,因為感知要回答的是接下來會發生什麼,並提到自己的 Tesla 曾對滑板玩家做出錯誤反應的例子。

04 16:00
學開車不是從零學

他解釋人類駕駛不是「白板學習」:十六歲學開車前,視覺能力大概在兩歲前就已經打底,駕訓班真正教的是控制而非重新學怎麼看世界;他認為神經網路要做到類似的長期知識累積,學習方法還需要演進。

05 21:16
人腦與電腦算力

延續學習方法的討論,Malik 提到 Hans Moravec 在 1990 年代估算過人腦與電腦的運算能力差距;他認為就原始算力而言,現在的 GPU 可能已經追上人腦,但運作方式差異很大——人腦的能耗效率遠高於今天的 GPU。

06 23:08
感知是為了行動

被問到電腦視覺有沒有一個統一的核心問題,他從演化角度回答:感知的根本目的是引導行動,從五億年前最早的多細胞動物開始,能移動與能感知就是互相成就的兩件事;今天視覺圈切分出的物件偵測、三維重建等子領域,是科學家自己加上去的結構,實際上這些處理是同時在進行的。

07 28:59
靜態與動態視覺

談靜態影像、影片與機器人視覺哪個更難,他認為早期電腦視覺偏重靜態影像,很大部分是受限於當年的算力與儲存,例如曾經只保留邊緣線條、丟掉灰階資訊來省空間;他估計影片辨識的進展大概落後物件辨識十年左右。

08 34:11
動作辨識需要知識

他認為要做長時間的動作與行為理解,需要心理學說的「schema」(基模)這類知識架構,並用「上餐廳」的固定流程當例子;他傾向用學習的方式取得這種知識,而不是回到 1970 年代那種把腳本手動寫死進系統的做法,因為孩子似乎是靠反覆的生活經驗學會這些基模。

09 37:37
用孩子的資料來測

Lex 引用圖靈論文結尾「與其模擬成人的心智,不如模擬孩子的」,問電腦視覺該有什麼樣的測驗。Malik 認為現在還沒有這類基準,應該收集孩子成長過程實際看到、聽到的資料(會碰到隱私問題);他知道也有人主張像飛機不用拍翅膀那樣走捷徑,但他押注像孩子一樣學。

10 40:01
像孩子一樣探索

他認同讓系統像孩子一樣可以主動探索、挑自己要學的資料,並提出兩個方向:真實機器人(有物理身體、質量與摩擦力)以及愈來愈逼真的模擬環境,他舉了 Facebook AI Research 團隊做的居家場景模擬環境 Habitat 為例。

11 42:06
因果與相關性

他認為能在世界裡主動行動很重要,因為這是跨越「相關不等於因果」的一條路。他提到 Judea Pearl 認為深度學習的成功只是「曲線擬合」,但他自己不完全認同這個說法,主張建立因果模型最可靠的方式之一是隨機對照實驗,而小孩其實一直在做小規模的控制實驗,這呼應了他同事 Alison Gopnik 在《The Scientist in the Crib》裡的論點。

12 45:32
影像統計與壓縮

回到「早期視覺」這個層次,他談影像統計本身能告訴我們什麼:視網膜大約有一億個光受器,但視神經只有大約一百萬條纖維,生物系統得先做數百倍的壓縮,這和類神經網路最前面幾層在做的事情類似。

13 48:10
由上而下與由下而上

他認為現在的電腦視覺系統是純前饋、訓練時卻高度依賴人工標註,兩頭都不理想;生物視覺系統則有回饋機制,用的神經網路層數也淺得多(他舉例 ResNet-50 有五十層,從視網膜到高階視覺區大概只有七層左右),他認為這條回饋機制的路線值得再深入研究。

14 52:40
分割任務是什麼

他解釋分割(segmentation)是在不需要先知道物體名稱的情況下,把一群像素辨認成「同一個東西」的能力;他認為這種能力讓小孩能在很少監督下學會物體的名字,在醫療診斷這類場景(例如標出腦部外傷的出血位置)也有實際用途。

15 56:53
辨識重建與重組

他介紹自己約在 2010 年前後開始推廣的三分法架構:辨識(recognition,貼標籤)、重建(reconstruction,從影像反推場景的三維結構,像電腦圖學的逆運算)、重組(reorganization,把影像從一堆像素變成有結構的物件);他認為深度學習時代的多輸出頭網路架構剛好呼應了這個框架。

16 1:02:42
端到端學習的侷限

被問到能不能整個問題端到端學完,他認為現在講的「端到端」多半只是端到端的監督式學習,範圍太窄;他傾向終身學習、逐步累積能力的觀點——先建立某些能力,再在上面疊加新的能力,而不是單一任務丟進一個大模型硬學。

17 1:04:21
向孩子學習的方法

Lex 提到他演講裡的「向孩子學的六件事」(多模態、漸進式、有身體、主動探索、社會性、使用語言),他說明這出自 Smith 與 Gasser 的論文,在兒童發展圈是常識,在電腦視覺與 AI 圈卻不是;他以「觸摸加視覺」與「聲音加畫面」為例:小孩玩球時同時得到觸覺與視覺訊號,兩者對應到同一個物體,這是不需要任何人給標籤的自我監督訊號。

18 1:08:31
語言與視覺誰根本

回應 Chomsky 認為語言是認知核心的看法,Malik 認為視覺才是更根本的能力:從演化時間看,視覺大概五億年前就出現,語言則晚得多,他推測要等到人類已經能直立行走、雙手空出來操作工具、腦容量變大之後才發展出來;他認為語言裡的空間、時間概念,建立在感知與行動的基礎之上。

19 1:12:29
超越圖靈測試

他不相信有單一的智力測驗,就像不相信 IQ 能用一個數字講完;他認為語言會是最難破解的。他也不看好把圖靈測試當成衡量智能的標準,認為那把研究導向騙人五分鐘的聊天機器人;他寧可要一份大約十種任務的清單(操作、導航、場景理解、讀小說回答任意問題等),視覺方面他認為一個好的測驗方向是做出能協助視障者的系統。

20 1:16:11
希爾伯特問題

被問到當代電腦視覺還沒解決的核心難題,他點名兩個:一是長時間的影片理解(要能追蹤場景裡的行動者、理解他們的目標與意圖,而不只是辨認單一動作);二是真正豐富的三維理解——現有方法若不是仰賴多視角幾何,就是靠人工提供的三維模型來監督學習,他認為理想的做法是讓系統像人一樣邊移動邊累積對三維世界的內部表徵。

21 1:21:01
黑盒子與可解釋性

他認為人類本來就不是完全可以互相解釋的,神經網路是黑盒子這件事本身不算問題;但在醫療診斷這類場景,判斷是根據哪個群體的資料訓練出來的很重要——不同群體之間可能有落差,這時候誤差範圍比一個單一答案更關鍵。他願意為了效能放棄可解釋性,只要在重要決策時能給出誤差範圍。

22 1:24:43
會不會有超級智慧

他認為原則上做得到人類等級的智慧,但他猜未來二十年內做不到(他自己說這只是瞎猜)。他借用 Donald Rumsfeld 的話區分:視覺與機器人面對的多半是「已知的未知」,知道問題在哪;自然語言理解與高階認知還有「未知的未知」,很難給時間表。他也說深度學習的效果讓他很意外,2010 年的他不會相信非凸、過度參數化的系統能這麼穩定地運作。

23 1:29:21
風險已經在發生

他認為不必等到通用人工智慧才擔心 AI 風險,現在部署中的系統就已經會做出有偏誤或造成傷害的決策,例如自駕車撞死行人(對話中提到 Uber 在亞利桑那州的那起事故);他主張這是持續性的工程與科學責任,不是某天 AGI 出現才需要處理的問題。

24 1:33:43
在對的時間進場

回顧自己在柏克萊當教授三十四年,他覺得自己很幸運,趕上電腦視覺從一個他形容為「有點瘋、完全沒用、什麼都做不了的小領域」,變成今天能實際解決很多問題、也還在快速發展的階段;他認為研究成敗很大程度跟時機有關——太早進入一個問題,前提條件還沒成熟,怎麼努力都撞不出結果。

25 1:35:51
如何挑對研究問題

談到指導學生的心得,他認為短期的研究成果靠技術能力,長期的研究方向則取決於會不會挑問題;他借用 Peter Medawar 的說法,把研究比喻成「可解的技藝」——找到那個還沒解決、但已經有「軟肋」可以下手的問題。他也說一部分功勞屬於柏克萊招得到的優秀學生;除了挑問題的品味,他能給的另一樣是橫跨心理學、神經科學與應用數學的廣度,幫專精很深的學生看到不同領域之間的連結。

26 1:40:06
對話的結語

Lex 稱讚 Malik 能自然地在心理學與電腦科學之間來回切換,說這種特質很少見,也能讓學生換個角度想問題;兩人互相道謝後結束這次對談。