← 回到天際線 思考機器第 5 層 / 102

EP 2062021-07-312:30:30

自我監督學習:電腦視覺如何自學

Ishan Misra

Ishan Misra 談自我監督學習怎麼讓電腦不靠標註看懂世界,從分類哲學聊到自駕年限與人生態度。

Ishan Misra: Self-Supervised Deep Learning in Computer Vision | Lex Fridman Podcast #206在 YouTube 看 ↗

重點6 條

  1. 自我監督怎麼學:不靠人工標註,而是把資料本身的結構(遮罩詞語、預測下一刻、比對裁切)當成監督訊號。Misra 認為叫它「自我監督」比「非監督」更準確,因為訊號終究來自資料自己。
  2. 分類永遠追不上新東西:Misra 主張任何一組離散類別都能再插入新類別(可頌加甜甜圈變成可頌甜甜圈)。比起硬要幫每樣東西取名字,相似性這種連續的度量反而更管用。
  3. 視覺比語言難訓練:語言是人類發明、字彙有限又結構化,遮罩猜詞的成功率很高;影像是連續訊號、雜訊又多,同樣的遮罩式預測在視覺上組合太多,所以視覺這邊靠的是比對不同裁切的相似度。
  4. 資料增強太原始:現行增強(換色、模糊、裁切)跟圖片內容完全無關,把香蕉改成紫色也照做不誤。Misra 認為增強該考慮圖片實際內容,做出符合物理現實的變化,效果會比現在誇張隨機的做法更好。
  5. SwAV 與 SEER 是代表作:SwAV 用線上聚類取代正負樣本對比,靠固定群數避免所有特徵塌縮成同一種;SEER 把這套方法放大到十億張未篩選的網路圖片,測試能不能擺脫對 ImageNet 的依賴。
  6. 自駕車還要五到十年:兩人都認為純視覺路線可行,但真正卡關的是人類行為難以預測,以及社會、政治對安全事故的容忍度,不是電腦視覺自己能解決的問題。

時間軸25 段

01 02:12
定義三種學習

監督式學習要人工標註,自我監督式則直接拿資料本身的結構(遮罩、預測、比對裁切)當監督訊號;Misra 解釋為什麼「自我監督」比「非監督」更準確,因為訊號來源仍然是資料本身。

02 07:15
自我監督的技巧

舉出各領域常見的自我監督手法:NLP 靠遮罩詞語猜出被蓋住的字,影片靠餵前九秒猜第十秒,圖片則靠比對同一張圖的不同裁切是不是同一個東西。

03 10:54
常識要靠自己學

談與 Yann LeCun 合寫的部落格文章:自我監督學習的目標是讓機器學到常識與物理直覺(重的東西舉起來比較慢),這些是人工標註永遠標不完的。

04 15:02
完美分類法存在嗎

Misra 主張任何一組離散類別都能再插入新類別(可頌加甜甜圈變成可頌甜甜圈),分類終究是不完美的;比起硬要幫每樣東西取名字,相似性這種連續的度量反而更好用。

05 20:26
標註的切身之痛

Misra 回憶自己讀博士時標註一週的圖片,卻被糾正「這是皮卡車不是轎車」的挫折經驗;兩人談到分類該是蛋糕上的糖霜,不該是蛋糕本身。

06 27:02
遮罩技巧的演進

回頭談 NLP:從 word2vec 到 BERT,同一套「遮罩詞語猜答案」的招式一路撐到現在,靠的是「同樣語境出現的詞意思相近」這個分布假說。

07 33:15
自注意力機制

解釋 Transformer 的核心是讓序列裡每個元素都能參照其他所有元素,不像 ConvNet 只看鄰近的一小塊窗口。

08 36:50
視覺比語言更難

Misra 認為電腦視覺比語言處理更難:語言是人類發明、字彙有限又結構化;影像是連續訊號,雜訊多、組合可能性太大,遮罩式預測在視覺上很快就會爆炸。

09 43:57
對比學習與能量模型

用貓、狗、香蕉三張圖解釋正負樣本:貓與狗算相關要拉近,香蕉是無關的要推遠;接著談 Yann LeCun 提出的能量模型,把對比學習、GAN、VAE 都理解成在最小化或最大化某種能量函數。

10 48:04
資料增強是什麼

資料增強就是把同一張圖片做不同的裁切、調色、模糊等擾動,讓神經網路學到這些變化版本應該有相近的特徵;這正是視覺自我監督學習的核心機制。

11 59:34
資料增強該更聰明

兩人認為現行的資料增強太粗暴且跟圖片內容無關(把香蕉改成紫色也照做不誤);如果增強能考慮圖片實際內容、做出符合物理現實的變化,效果會比現在誇張隨機的做法更好。

12 1:03:54
非對比式學習法

介紹對比學習之外避免「塌縮」(所有特徵變得一樣)的做法:聚類法與師生自我蒸餾;SwAV 論文靠線上聚類、固定群數的方式,讓同張圖的不同裁切落在同一群。

13 1:10:21
SEER 十億圖模型

SEER 用十億張未經篩選的網路圖片訓練超大規模自我監督模型,規模比研究界慣用的百萬張 ImageNet 大了三個數量級,測試自我監督學習能不能真正擺脫對 ImageNet 的依賴。

14 1:16:00
架構重要還是資料

RegNet 這個架構同時兼顧算力與記憶體效率,是 SEER 用的骨幹;但 Misra 認為資料與資料增強的演算法其實比架構本身更關鍵;VISSL 則是他們統一各種自我監督方法實作與評測基準的工具庫。

15 1:24:15
聲音影像多模態學習

談 CVPR 2021 最佳論文候選:用影片配對的聲音當自我監督訊號,模型不靠任何標註,就學會從聲音指出吉他在畫面裡的哪個位置。

16 1:31:57
主動學習挑資料

兩人討論主動學習能不能挑出最值得標註或訓練的資料,Misra 提到自己讀博時做過讓模型主動提問來學習的研究,確實比隨機提問更有效率。

17 1:36:27
特斯拉資料引擎

Lex 把特斯拉車隊蒐集邊緣案例、送回標註再重新訓練的流程,類比成一種主動學習;Misra 認同這個做法,認為邊緣案例正是自駕系統真正卡關的地方。

18 1:40:00
自駕還要幾年

Lex 先把「解決自駕」定義清楚——車子說它在控制就要負全責、事故率低到人類的五分之一——再請 Misra 押一個年份;Misra 估至少五到十年,兩人也談到 Waymo 長期靠光達而 Tesla 走純視覺的路線分歧。

19 1:48:43
深度學習的極限

Misra 認為資料效率差是深度學習最大的問題,一個樣本很難類推到新情境;機器學習也缺乏傳統演算法那種正確性保證;他把「學習」定義成能做出直覺判斷,「推理」則是遇到沒看過的複雜情境才需要的能力,目前的神經網路擅長前者、不擅長後者。

20 1:58:03
通用智慧要什麼

兩人談情緒可能是「預測落空」的訊號;通用智慧需要自我覺察,才能理解自己在世界裡扮演的角色;Lex 認為要讓人類真心想跟一個系統互動,它得展現出某種意識。

21 2:06:03
最美的發現

Misra 認為自我監督學習最美的地方,是模型只靠比對圖片裁切的相似度,就自己學出物件的邊界,連「這是一隻狗」都沒人教過它。

22 2:09:40
不信模擬訓練資料

Misra 說自己不看好用模擬環境訓練自駕系統,因為要精準模擬光影很難,更難的是模擬人類行為與邊緣案例。

23 2:14:23
研究與新手建議

選對值得投入的問題,跟寫論文本身一樣重要;Misra 也建議研究生早點動筆寫論文,而不是等實驗做完才寫,因為寫作過程本身會逼出更清楚的想法。

24 2:24:30
人生建議

Misra 認為想要成功要有渴望,「不是想要,是非要不可」;也談到失敗是研究的常態,要練出耐挫的能力才走得下去。

25 2:27:44
人生意義的答案

兩人聊到還沒找到人生意義的答案;Misra 認為人類沒有明確的目標函數反而是一種特色,讓每個人走出不同的路,也在演化裡互相學習。