← 回到天際線 思考機器第 20 層 / 102

EP 942020-05-081:37:28

深度學習的信念,到 AGI 治理

Ilya Sutskever

OpenAI 首席科學家 Ilya Sutskever 從深度學習為什麼有效聊到要不要丟掉反向傳播,最後談他心目中 AGI 該怎麼被治理。

Ilya Sutskever: Deep Learning | Lex Fridman Podcast #94在 YouTube 看 ↗

重點6 條

  1. 信心來自一個 10 層的網路:Ilya 說 2010 年前後看到 James Martens 訓練出一個 10 層端到端的神經網路,就相信只要網路夠大、資料夠多,深度學習一定會成功;真正卡住的是算力,直到 Alex Krizhevsky 寫出夠快的 CUDA kernel 才打通。
  2. 深度學習最美的地方,是它真的有效:他把深度學習比喻成生物學與物理學的幾何平均數;這幾年一再發生同一件事——覺得已經到頂了,結果隔年又往前走,他認為大家還在嚴重低估深度學習能做到什麼。
  3. 反向傳播他不打算放棄:Lex 轉述 Geoffrey Hinton 要丟掉反向傳播、重新來過,Ilya 說 Hinton 的原意沒那麼極端:在大腦裡找不到反向傳播的話,值得看看能從大腦的學習方式學到什麼,但反向傳播很有用、應該繼續用。他說反向傳播解決了一個很根本的問題,不太可能出現根本不同的替代方案,至少現在他不會押這個注。
  4. 神經網路能不能推理:他拿 AlphaZero 下圍棋(不靠搜尋、純靠網路本身就贏過 99.9% 的人)當推理能力的存在證明;但如果訓練任務不需要推理,神經網路就不會去推理,只會用最簡單的方式解決眼前的問題。
  5. GPT-2 與分階段釋出:他說 AI 這個領域正從幼年進入成熟期,該在系統造成的影響變大之前先想清楚,這也是 GPT-2 採取分階段釋出的理由;他也談到不同公司之間該怎麼建立互信、一起討論怎麼處理這類系統。
  6. 他心目中的 AGI 治理:不同國家或城市的人投票決定屬於自己的 AGI 該做什麼,人類是董事會、AGI 是執行長,董事會隨時可以按下重設鍵;他說他非常確信做得出「自己想要被人類控制」的 AGI,就像父母樂於照顧孩子。他也說如果自己真的握有那種權力,聽起來反而很恐怖。

時間軸23 段

01 02:19
AlexNet 前夕的信心

Ilya 說 2010、2011 年前後,James Martens 訓練出一個 10 層端到端的神經網路這件事讓他確信大網路能代表複雜函式;就算參數遠多於資料也不擔心過擬合,真正的疑慮是算力夠不夠,直到 Alex Krizhevsky 寫出很快的 CUDA kernel 才打通關。

02 05:24
大腦給的靈感

他說大腦一直是深度學習研究者的靈感來源,從 60 年代的 Rosenblatt、McCulloch and Pitts 發明神經元,到 Fukushima 與 Yann LeCun 把感受野限制在局部範圍的卷積網路;他覺得瞇著眼看,人工神經元跟大腦的神經元大概差不多,就這樣假設下去。

03 07:41
大腦與神經網路的具體差異

他認為 spike 可能不是關鍵差異。Lex 問損失函數會不會拖累我們,他說 GAN 是沒有明確損失函數的例子,比較像在推理一場賽局的均衡,就像演化或經濟也說不上有損失函數;但他很喜歡損失函數,不會押注跟它作對。他也提到 STDP 這個用神經放電先後順序調整突觸強度的學習規則;接著談到某種形式的遞迴很可能會回來。Lex 拿專家系統的知識庫來比,他說比較接近的講法是知識存在連結裡、隱藏狀態只負責短期處理,也認為神經網路裡有機會建立大規模知識庫。

04 16:05
深度學習成功的關鍵

回顧 ImageNet 前後,他說想法其實都已經存在,缺的是大量標註資料、算力,以及第三樣東西:相信兩者結合起來真的會成功的信念。Lex 提到 Jitendra Malik 與 Alyosha Efros 當時的懷疑、Geoffrey Hinton 的相信,Ilya 同意 ImageNet 是轉折點,並補充當年懷疑其實很理性:神經網路那時幾乎什麼都做不好,要靠很難的 benchmark 拿出無可否認的證據。

05 19:55
機器學習裡的統一性

他說整個領域有很高的統一性,同一兩三個原則同時適用在不同任務上;視覺用 CNN、語言用 transformer 只是暫時的架構差異,未來有可能被統一。強化學習則不太一樣,因為你的行動一改變,你觀察到的東西也跟著變,這跟假設固定分布的監督式學習不同。

06 24:37
語言比視覺難嗎

針對 Chomsky 認為語言是一切根本的說法,Ilya 說「哪個問題比較難」這個問法本身有問題,難不難取決於現有工具能不能解決;他改口認為完整理解語言可能比視覺更難,也反問閱讀文字算不算視覺問題的一部分。

07 29:33
最美的地方是它真的有效

他說最讓他驚訝的是這整套東西真的有效,而且不斷超出預期;他把深度學習比喻成生物學與物理學的幾何平均數,每年都覺得到頂了,結果隔年又往前走。

08 33:37
進步會不會變難

對整個領域來說進步還會持續,但對個別研究者更難,因為研究者變多、技術堆疊變深;Lex 拿 Vladimir Vapnik 的少樣本學習來問,他認為會有很多不需要巨大算力的突破,小團隊與個人仍然有很多重要的工作可做。

09 35:59
deep double descent

他解釋這篇自己參與的論文:固定資料集慢慢加大模型,表現會先變好,在模型剛好把訓練誤差降到零的那個點最差,之後繼續加大反而又變好;原因是模型夠大時對資料裡的隨機雜訊不敏感,除非做 early stopping,不然這個現象很明顯。

10 41:10
要不要丟掉反向傳播

針對 Hinton 說要重新想過反向傳播,他說 Hinton 真正的意思是如果在大腦裡找不到反向傳播的痕跡,就該看看能不能從大腦的學習機制學到什麼;但他自己是反向傳播的支持者,認為不太可能出現根本不同的替代方案,至少現在不會押這個注。

11 42:43
神經網路能不能推理

他舉 AlphaZero 下圍棋、不靠搜尋純靠網路本身就贏過 99.9% 人類這件事,當作推理能力的存在證明;但如果訓練任務不需要推理,神經網路就不會去推理。接著重提「找最短程式」的比喻,並修正說法:與其說是小電路,不如說是權重裡資訊量很小的大電路,這可能是它們能泛化的原因。

12 50:25
長期記憶、可解釋性,以及什麼樣的推理算令人佩服

他認為參數某種程度上就是模型的長期記憶,是整個訓練經驗的聚合;可解釋性有兩種做法,直接分析神經元,或像對人一樣問它問題、看它生成的文字;他也希望神經網路能有自我覺察。被問到什麼表現會讓他佩服,他說寫出真正好的程式、證明很難的定理、解決開放式問題會是有力的指標。

13 56:37
語言模型的歷史與規模為什麼重要

他從 80 年代的 Elman network 講起,說改變軌跡的關鍵一樣是資料和算力;語言模型小的時候只能抓到表面的字元模式,大到一定程度才會開始抓到語意,他舉自己做的 sentiment neuron 實驗為例:同一個 LSTM 從 500 個 cell 加到 4000 個,才冒出一個代表整篇評論情緒的神經元。

14 1:00:30
GPT-2 與 transformer 為什麼有效

GPT-2 是一個 15 億參數的 transformer,訓練資料是從 Reddit 上獲得超過 3 個讚的貼文連到的網頁文字,約 400 億個 token;他說 transformer 成功不是只靠 attention,而是 attention、對 GPU 友善、不遞迴(比較淺、好最佳化)三者同時發生作用。

15 1:04:08
下一個門檻是經濟影響

他說圈外人已經分不出一次次進展的差別,下一個真正的門檻會是 AI 開始在 GDP 上留下明顯痕跡;翻譯已經是巨大又正面的例子,他認為自動駕駛會帶來巨大影響,只是不知道什麼時候,也談到希望模型未來能像人一樣主動選擇要學什麼資料。

16 1:08:51
GPT-2 為什麼要分階段釋出

他說整個 AI 領域正從幼年期進入成熟期,影響力越來越大,該在造成影響之前先想清楚,寧可早一點也不要太晚;GPT-2 的結果讓人覺得有可能被拿去降低製造假資訊的成本,所以採取分階段釋出,也談到不同公司之間該怎麼建立互信、討論怎麼處理這類系統。

17 1:13:37
打造 AGI 需要什麼

他說不能確定,但認為打造 AGI 會是深度學習再加上一些想法,自我對弈會是其中之一;他舉 AlphaZero、Dota、OpenAI 的捉迷藏多智能體實驗為例,說自我對弈系統一再做出讓人意外的創意解法,這種製造驚喜的能力是 AGI 很重要的一部分,現在的系統還不常展現。

18 1:16:01
模擬到真實世界的遷移

以 OpenAI 那隻完全在模擬環境訓練的機械手解 Rubik's cube 為例,他說訓練 100% 在模擬裡完成,學到的 policy 本身夠有適應性,轉移到實體世界後,連戴手套、被玩偶長頸鹿干擾這種沒見過的狀況都能應付。

19 1:18:50
AGI 需不需要身體,意識是不是必要

他認為有身體會很有用,但不是必要,舉了天生失聰失明卻仍能靠其他方式理解世界的人當例子;談到意識,他的論證是人類有意識,如果人工神經網路和大腦夠像,原則上神經網路也有可能有意識。Lex 說他太倚賴這個存在證明,他說這是他能給的最好答案,也認為大腦藏著某種讓進展卡住的特殊之處,這種可能性不高。

20 1:21:42
什麼才算真正令人佩服的智能測試

他說真正讓他佩服的,會是一個系統在翻譯、視覺這類已經很平常的任務上,完全不犯人類不會犯的那種錯。Lex 說 GPT-2 很多方面可能比人聰明,他說知識廣度確實如此。

21 1:24:49
他心目中的 AGI 治理:董事會與執行長

他理想中的畫面是不同國家或城市的人投票決定屬於他們的 AGI 該做什麼,AGI 去執行,像是把民主往前推一步;人類是董事會,AGI 是執行長,董事會永遠可以按下重設鍵,把參數重新隨機化。Lex 問人類是不是永遠按得下重設鍵,他說絕對做得出「自己想要被人類控制」的 AI,就像父母樂於照顧孩子,而且他以最高的信念相信 AGI 也能這樣設計,讓它樂於幫助人類興旺。

22 1:29:15
交出權力,以及怎麼對齊 AGI

Lex 提到 George Washington 主動交出總統權力的例子,問他做不做得到,他說自己會覺得那很 trivial,反而覺得握有那種權力的情境很恐怖;談到具體的對齊做法,他設想用一個另外訓練、專門學習人類價值判斷的系統,去當更強大強化學習系統的價值函數。

23 1:32:10
人生的意義與快樂

被問到人類存在背後隱含的目標函式、人生意義是什麼,他認為這個問題本身問錯了方向,因為它預設有一個外部答案;他說我們存在這件事本身就很了不起,該做的是盡量善用它。接著被問有沒有後悔的決定、有沒有特別驕傲的時刻,他說有後悔但試著釋懷,學術成就讓他驕傲卻不是快樂的來源;快樂很大程度上來自你怎麼看待事情,不是遇到什麼,但他說這是他目前的看法,也不敢太肯定。