← 回到天際線 思考機器第 27 層 / 102

EP 1082020-07-141:37:30

研究機器人是為了理解智慧

Sergey Levine

Sergey Levine 談機器人研究為什麼能幫我們理解智慧,一路深入強化學習的分類、真實世界的瓶頸與獎勵函數。

Sergey Levine: Robotics and Machine Learning | Lex Fridman Podcast #108在 YouTube 看 ↗

重點6 條

  1. 硬體差距好補,認知差距難補:Sergey 用 Stanford 那支靠人遠端操控的 PR1 居家機器人影片說明,只要願意砸錢做工程,硬體的落差幾乎能追平,但認知能力的落差還很寬,而且環境越開放、越難預期,落差就越明顯。
  2. 知識的冰山很可能是後天累積的:他認為與其糾結能力有多少是天生的,不如問「最少需要多少天生能力就夠用」;Lex 用冰山比喻人帶到桌上的知識,Sergey 同意有這座冰山,但認為它很可能是靠一輩子累積出來的。他也推測,親自跟世界互動、觀察行動後果得來的經驗,也許比大量隨機取樣的資料更容易長出常識。
  3. 機器人操作難,是因為找不到乾淨的監督訊號:電腦視覺至少還能套上乾淨的監督式學習框架,機器人操作卻很難這樣做;他也提到,人類學走路時,也沒有父母教我們怎麼控制每一條肌肉,那些底層細節大多是自己摸索出來的。
  4. 深度學習幫強化學習解決的是特徵工程:他把 deep RL 形容成強化學習加上高容量神經網路,類比早年下棋程式得靠人工硬寫「騎士是否在棋盤中央」這類特徵;這件事對強化學習的幫助,某種程度上比對電腦視覺還大,因為過去根本沒人知道該替控制問題手寫什麼特徵。
  5. 卡住機器人學習的不是網路大小,是打破的盤子:他舉例,讓機器人在廚房裡試錯學洗碗,結果會先把所有盤子打破;人類遇到這種狀況會自然生出「小心一點」「打破了就去買新的」這類常識性的應對,但這些鷹架不在強化學習經典問題設定的考慮範圍內。
  6. 他更擔心心懷不軌的人,不是太聰明的 AI:談到 AI 存在風險,他舉了三種可能的形式——心懷不軌的人、有致命缺陷的系統、太強大的 AI;他認為現階段更該擔心前兩種,尤其是心懷不軌的人,因為人類歷史上一直是心懷不軌的人在闖禍,不是心懷不軌的機器。

時間軸26 段

01 02:55
人類與機器人的能力落差

Lex 開場問人類與機器人的能力差在哪;Sergey 用 Stanford 那支靠人遠端操控的 PR1 居家機器人影片說明,硬體的落差靠砸錢做工程幾乎能追平,但認知的落差還很寬,環境越不可控,落差就越大。

02 06:06
先天與後天:常識哪裡來

Lex 問認知能力有多少是天生、多少是後天學來的;Sergey 認為與其糾結先天後天,不如問「最少需要多少天生能力才夠用」。Lex 接著用冰山比喻人帶到桌上的知識,Sergey 同意有這座冰山,但認為它很可能是一輩子累積出來的。

03 14:00
探索的重要性

Lex 問探索、跳出既有策略去嘗試全新方向有多重要;Sergey 認為這跟強化學習問題怎麼設定很有關——傳統設定是直接最大化效用,另一種思路是先讓系統自由探索、之後才被賦予任務。他說這不一定是最好的看法,也遠不是主流,但這樣的系統也許會傾向累積一整套「認知工具」。

04 16:05
機器人研究真正的目標

Lex 問機器人研究的終極目標是什麼;Sergey 說有兩種答案,一種是務實的「做出什麼都能學會做的系統」,但他自己真正的動機其實是想透過機器人理解智慧本身。

05 18:43
機器人與電腦視覺的不同

兩人聊機器人研究跟電腦視覺、NLP 有什麼不同;Sergey 提到 Moravec's paradox——人類覺得難的事(例如微積分)對機器反而簡單,人類覺得簡單的事(例如喝水)對機器卻很難,這種明顯落差正好提示研究者漏掉了什麼。

06 23:59
把感知與控制放在一起學

Sergey 回顧 2014 年一篇早期端對端機器人學習研究:讓機器人把梯形積木插進洞裡,分開處理感知與控制不如把兩者放進同一個神經網路一起訓練;他也提到棒球接球員用的「凝視捷思」是同一類例子——不用算出完整彈道,只要調整跑速、讓球一直停在視野裡同一個位置就能接到。

07 27:09
機器人有沒有一個代表性問題:抓取

Lex 問機器人研究裡有沒有像 ImageNet 之於電腦視覺那樣的「代表性問題」;Sergey 說很難回答,因為機器人真正困難的地方是面對新狀況的靈活度,不是把某一件事做到極致——不過他也提到,幾年前「抓取」曾被當成很有代表性的任務:過去被當成「反推物理」的幾何問題處理,後來發現用模擬或真實世界試錯的學習方法效果更好,真正困難的地方在於不同材質、形狀、軟硬的物體常常需要完全不同的策略。

08 31:56
機器人需不需要常識推理

Lex 問解決機器人問題是不是需要常識推理、通用智慧;Sergey 反過來認為,常識更像是機器被迫在複雜世界裡真正行動之後才會冒出來的性質——他舉影像描述系統把穿毛皮大衣的人講成泰迪熊為例,說明只活在像素與句子裡的系統學不到常識。

09 34:14
純學習能不能取代人工設計

Lex 問機器人問題能不能純靠端對端學習解決,不靠人工設計的規則與啟發式;Sergey 認為可以,而且他指出:1960 年代的「最適控制」理論跟今天的強化學習,本質上很接近,差別只在於最佳化被推向更深的層次。

10 37:39
符號主義 AI 留下的東西

談符號主義 AI 有沒有位置;Sergey 認為從邏輯推理、到貝氏網路、到直接學機率、再到整個塞進神經網路,其實都是同一件事的不同階段——用推論的方式做理性決策,只是實作方式一路在換。

11 41:05
可解釋性:除錯 vs 說故事

Sergey 認為可解釋性說到底是驗證與確認問題的一部分:系統出錯時要能找出原因。Lex 提出另一面:人類想聽一個有說服力的故事。Sergey 拿以前的合作者、現為 MIT 教授 Jacob Andreas 的研究當例子:把自然語言當成策略的內部狀態,面對新任務時先想幾種語言描述逐一嘗試,看哪一種拿到獎勵,事後讀那串文字就知道它怎麼想。Lex 接著說,如果把故事的說服力也放進獎勵函數,在假新聞的時代可能有點嚇人。

12 45:01
什麼是強化學習

Lex 直接問什麼是強化學習;Sergey 說現在講的強化學習泛指「靠資料變得更好的決策系統」,可以把監督式學習看成強化學習的一種特例(把損失函數當成負的獎勵),只是監督式學習多了「有人告訴你正確答案」跟「資料獨立同分布」這些更強的假設。

13 48:56
強化學習落後監督式學習的地方

討論強化學習目前實務上比較弱的地方:難以有效利用大量既有的歷史資料,多數場景很難讓系統直接上線亂試;Sergey 也用 model-based(預測狀態)、value-based(預測效用)這類分類,說明它們本質上都在回答「如果做了這個動作會怎樣」的假設性問題,只是問法不同。

14 53:40
off-policy 強化學習的難題與冰山

離線資料訓練政策的一大難題是,模型對從沒見過的動作給的預測不可信;Sergey 提到可以用密度估計之類的方法,先判斷一個動作是不是落在訓練資料分布之外。至於既有資料與少量探索怎麼混用,他借用 Lex 開場的冰山比喻:99% 的經驗靠離線資料的強化學習,真正要現場摸索的是最後 1%,例如第一次打開某一種新的鎖。

15 57:04
強化學習最美的想法

Lex 問強化學習裡最美的想法;Sergey 說是不需要完整的世界模型,也能得到接近最佳的控制器。從控制理論的角度看這件事很奇怪:傳統做法是先寫下方程式再求解,強化學習卻提供了一套在不知道系統方程式時也能最佳化的數學框架。

16 59:11
深度學習解決了特徵工程

什麼是 deep RL:把強化學習演算法跟高容量神經網路接在一起;Sergey 回顧以前想替下棋、圍棋手寫特徵有多不透明(例如硬寫一條「騎士在棋盤中央」的規則),神經網路直接從原始輸入學特徵,這件事對強化學習的幫助其實比對電腦視覺更大。

17 1:02:13
卡住深度強化學習的不是網路大小

Lex 問深度強化學習的能力邊界在哪;Sergey 說真正的瓶頸不是神經網路不夠大,而是在真實世界做試錯學習時會撞上一堆額外的問題——他舉機器人學洗碗為例,結果會先把所有盤子打破,而人類擁有的「小心一點」「打破了就去買新的」這類常識鷹架,不在強化學習經典問題設定的考慮範圍內。

18 1:04:36
對比 AlphaZero:現實世界沒有無限模擬

Lex 提到 AlphaZero 在棋類遊戲裡幾乎沒有能力上限,瓶頸只是願意砸多少運算資源,反觀真實世界有「打破的盤子」這種現實限制,問接下來要怎麼推進;Sergey 認為也許要更有效地重複利用既有資料,就是前面提過的那座「冰山」,這類研究通常歸在多工學習或元學習底下。

19 1:06:40
Tesla 自動駕駛的資料怎麼用

聊到 Tesla Autopilot 用 Hydra Net 處理大量真實駕駛資料的案例;Sergey 認為這類安全攸關系統真正要解決的問題,跟離線強化學習面對的問題很像——都是要先判斷什麼時候可以信任模型的預測,再決定要不要用它去修正原本的行為。

20 1:08:47
模擬很實用,但取代不了真實經驗

Sergey 認為模擬是現階段很實用的工具,但長期而言機器要能持續進步,終究得能從真實資料學習,因為任何一個由人設計、不會自己從資料進步的環節,最後都會變成系統的瓶頸;兩人也順帶聊了幾句「我們是不是活在模擬裡」的問題。

21 1:12:40
人進入問題之後:多智能體、物理、自我對弈

Lex 問人類進入機器人問題之後會怎麼改變學習;Sergey 希望多工、能重複利用經驗的系統,處理跟人互動這件事時也能用同樣的方式自然學會。兩人接著聊到能不能直接從資料學到重力這類物理定律(他認為常見到的物理現象不難學到),以及自我對弈能不能搬到機器人身上:他認為瓶頸跟其他問題一樣,得先讓機器能從跟真實世界的互動中持續進步;棋局裡是規則在仲裁雙方的互動,出了棋盤就得跟真實環境互動。

22 1:17:55
獎勵函數從哪裡來

談獎勵函數要從哪裡來:Sergey 說可以把獎勵當成一種溝通媒介,也可以走非監督式強化學習的路線,靠「最小化預測意外程度」這類資訊理論指標(計算神經科學界,例如 Karl Friston,率先提出這類想法)讓系統自己發現有用的技能;他舉玩俄羅斯方塊為例,光是為了讓自己更容易預測局面,就會自然學會把行消掉、把盤面清乾淨。

23 1:20:59
非預期後果、對齊與存在風險

Lex 問怎麼預防獎勵函數帶來非預期的策略;Sergey 說可以直接寫一個「別做怪事」的目標,不要進入過去沒見過的低機率狀態。問到 AI 對齊,他說沒有很好的答案,但現在更擔心的是目標最佳化得不夠好、而不是太好,這在車子、飛機這類安全攸關系統上會變得迫切。Lex 接著問存在風險,他舉了三種形式:心懷不軌的人、有致命缺陷的系統、太強大的 AI,認為現階段更該擔心前兩種,尤其是心懷不軌的人。被問到強化學習有沒有教會他什麼,他說還說不準,但等強化學習更廣泛用進醫療、教育、社群媒體這類會影響人類行為的場域之後,答案也許會更清楚;Lex 也提到希望這類系統未來能更透明。

24 1:27:10
Bitter Lesson 與個人的 AI 之路

Lex 提到 Richard Sutton 那篇〈The Bitter Lesson〉,Sergey 同意大方向,但認為結論不是不用做演算法研究,而是該做「通用、可以自動蒐集真實經驗」的演算法。他也說年輕時讀 Isaac Asimov 很受啟發;至於投入 AI,2009、2010 年以前他不覺得有生之年會看到大進展,是研究所修了 Andrew Ng 開的 seminar 課,聽 Andrew Ng 在第一堂說這個領域可能在我們有生之年出現實質突破,才真正下定決心。

25 1:32:20
給新手的建議

Sergey 給想投入 AI 領域的學生的建議:先花時間想清楚自己真正想看到機器做到什麼事,再回頭推導需要哪些步驟才能做到,而不是先想著要在某個 benchmark 上刷出更好的數字。

26 1:34:09
人生的意義是什麼

節目最後問人生的意義;Sergey 說給他滿足感的,是有把握自己在做真正重要的事,不一定要親手解決那個問題;他理想中的成功,是做出一台能隨著存在時間拉長不斷變得更好的機器,一路撞到宇宙複雜度的天花板為止。