EP 942020-05-081:37:28
深度學習的信念,到 AGI 治理
Ilya Sutskever
OpenAI 首席科學家 Ilya Sutskever 從深度學習為什麼有效聊到要不要丟掉反向傳播,最後談他心目中 AGI 該怎麼被治理。
Ilya Sutskever: Deep Learning | Lex Fridman Podcast #94在 YouTube 看 ↗
重點6 條
- 信心來自一個 10 層的網路:Ilya 說 2010 年前後看到 James Martens 訓練出一個 10 層端到端的神經網路,就相信只要網路夠大、資料夠多,深度學習一定會成功;真正卡住的是算力,直到 Alex Krizhevsky 寫出夠快的 CUDA kernel 才打通。
- 深度學習最美的地方,是它真的有效:他把深度學習比喻成生物學與物理學的幾何平均數;這幾年一再發生同一件事——覺得已經到頂了,結果隔年又往前走,他認為大家還在嚴重低估深度學習能做到什麼。
- 反向傳播他不打算放棄:Lex 轉述 Geoffrey Hinton 要丟掉反向傳播、重新來過,Ilya 說 Hinton 的原意沒那麼極端:在大腦裡找不到反向傳播的話,值得看看能從大腦的學習方式學到什麼,但反向傳播很有用、應該繼續用。他說反向傳播解決了一個很根本的問題,不太可能出現根本不同的替代方案,至少現在他不會押這個注。
- 神經網路能不能推理:他拿 AlphaZero 下圍棋(不靠搜尋、純靠網路本身就贏過 99.9% 的人)當推理能力的存在證明;但如果訓練任務不需要推理,神經網路就不會去推理,只會用最簡單的方式解決眼前的問題。
- GPT-2 與分階段釋出:他說 AI 這個領域正從幼年進入成熟期,該在系統造成的影響變大之前先想清楚,這也是 GPT-2 採取分階段釋出的理由;他也談到不同公司之間該怎麼建立互信、一起討論怎麼處理這類系統。
- 他心目中的 AGI 治理:不同國家或城市的人投票決定屬於自己的 AGI 該做什麼,人類是董事會、AGI 是執行長,董事會隨時可以按下重設鍵;他說他非常確信做得出「自己想要被人類控制」的 AGI,就像父母樂於照顧孩子。他也說如果自己真的握有那種權力,聽起來反而很恐怖。
時間軸23 段
Ilya 說 2010、2011 年前後,James Martens 訓練出一個 10 層端到端的神經網路這件事讓他確信大網路能代表複雜函式;就算參數遠多於資料也不擔心過擬合,真正的疑慮是算力夠不夠,直到 Alex Krizhevsky 寫出很快的 CUDA kernel 才打通關。
他說大腦一直是深度學習研究者的靈感來源,從 60 年代的 Rosenblatt、McCulloch and Pitts 發明神經元,到 Fukushima 與 Yann LeCun 把感受野限制在局部範圍的卷積網路;他覺得瞇著眼看,人工神經元跟大腦的神經元大概差不多,就這樣假設下去。
他認為 spike 可能不是關鍵差異。Lex 問損失函數會不會拖累我們,他說 GAN 是沒有明確損失函數的例子,比較像在推理一場賽局的均衡,就像演化或經濟也說不上有損失函數;但他很喜歡損失函數,不會押注跟它作對。他也提到 STDP 這個用神經放電先後順序調整突觸強度的學習規則;接著談到某種形式的遞迴很可能會回來。Lex 拿專家系統的知識庫來比,他說比較接近的講法是知識存在連結裡、隱藏狀態只負責短期處理,也認為神經網路裡有機會建立大規模知識庫。
回顧 ImageNet 前後,他說想法其實都已經存在,缺的是大量標註資料、算力,以及第三樣東西:相信兩者結合起來真的會成功的信念。Lex 提到 Jitendra Malik 與 Alyosha Efros 當時的懷疑、Geoffrey Hinton 的相信,Ilya 同意 ImageNet 是轉折點,並補充當年懷疑其實很理性:神經網路那時幾乎什麼都做不好,要靠很難的 benchmark 拿出無可否認的證據。
他說整個領域有很高的統一性,同一兩三個原則同時適用在不同任務上;視覺用 CNN、語言用 transformer 只是暫時的架構差異,未來有可能被統一。強化學習則不太一樣,因為你的行動一改變,你觀察到的東西也跟著變,這跟假設固定分布的監督式學習不同。
針對 Chomsky 認為語言是一切根本的說法,Ilya 說「哪個問題比較難」這個問法本身有問題,難不難取決於現有工具能不能解決;他改口認為完整理解語言可能比視覺更難,也反問閱讀文字算不算視覺問題的一部分。
他說最讓他驚訝的是這整套東西真的有效,而且不斷超出預期;他把深度學習比喻成生物學與物理學的幾何平均數,每年都覺得到頂了,結果隔年又往前走。
對整個領域來說進步還會持續,但對個別研究者更難,因為研究者變多、技術堆疊變深;Lex 拿 Vladimir Vapnik 的少樣本學習來問,他認為會有很多不需要巨大算力的突破,小團隊與個人仍然有很多重要的工作可做。
他解釋這篇自己參與的論文:固定資料集慢慢加大模型,表現會先變好,在模型剛好把訓練誤差降到零的那個點最差,之後繼續加大反而又變好;原因是模型夠大時對資料裡的隨機雜訊不敏感,除非做 early stopping,不然這個現象很明顯。
針對 Hinton 說要重新想過反向傳播,他說 Hinton 真正的意思是如果在大腦裡找不到反向傳播的痕跡,就該看看能不能從大腦的學習機制學到什麼;但他自己是反向傳播的支持者,認為不太可能出現根本不同的替代方案,至少現在不會押這個注。
他舉 AlphaZero 下圍棋、不靠搜尋純靠網路本身就贏過 99.9% 人類這件事,當作推理能力的存在證明;但如果訓練任務不需要推理,神經網路就不會去推理。接著重提「找最短程式」的比喻,並修正說法:與其說是小電路,不如說是權重裡資訊量很小的大電路,這可能是它們能泛化的原因。
他認為參數某種程度上就是模型的長期記憶,是整個訓練經驗的聚合;可解釋性有兩種做法,直接分析神經元,或像對人一樣問它問題、看它生成的文字;他也希望神經網路能有自我覺察。被問到什麼表現會讓他佩服,他說寫出真正好的程式、證明很難的定理、解決開放式問題會是有力的指標。
他從 80 年代的 Elman network 講起,說改變軌跡的關鍵一樣是資料和算力;語言模型小的時候只能抓到表面的字元模式,大到一定程度才會開始抓到語意,他舉自己做的 sentiment neuron 實驗為例:同一個 LSTM 從 500 個 cell 加到 4000 個,才冒出一個代表整篇評論情緒的神經元。
GPT-2 是一個 15 億參數的 transformer,訓練資料是從 Reddit 上獲得超過 3 個讚的貼文連到的網頁文字,約 400 億個 token;他說 transformer 成功不是只靠 attention,而是 attention、對 GPU 友善、不遞迴(比較淺、好最佳化)三者同時發生作用。
他說圈外人已經分不出一次次進展的差別,下一個真正的門檻會是 AI 開始在 GDP 上留下明顯痕跡;翻譯已經是巨大又正面的例子,他認為自動駕駛會帶來巨大影響,只是不知道什麼時候,也談到希望模型未來能像人一樣主動選擇要學什麼資料。
他說整個 AI 領域正從幼年期進入成熟期,影響力越來越大,該在造成影響之前先想清楚,寧可早一點也不要太晚;GPT-2 的結果讓人覺得有可能被拿去降低製造假資訊的成本,所以採取分階段釋出,也談到不同公司之間該怎麼建立互信、討論怎麼處理這類系統。
他說不能確定,但認為打造 AGI 會是深度學習再加上一些想法,自我對弈會是其中之一;他舉 AlphaZero、Dota、OpenAI 的捉迷藏多智能體實驗為例,說自我對弈系統一再做出讓人意外的創意解法,這種製造驚喜的能力是 AGI 很重要的一部分,現在的系統還不常展現。
以 OpenAI 那隻完全在模擬環境訓練的機械手解 Rubik's cube 為例,他說訓練 100% 在模擬裡完成,學到的 policy 本身夠有適應性,轉移到實體世界後,連戴手套、被玩偶長頸鹿干擾這種沒見過的狀況都能應付。
他認為有身體會很有用,但不是必要,舉了天生失聰失明卻仍能靠其他方式理解世界的人當例子;談到意識,他的論證是人類有意識,如果人工神經網路和大腦夠像,原則上神經網路也有可能有意識。Lex 說他太倚賴這個存在證明,他說這是他能給的最好答案,也認為大腦藏著某種讓進展卡住的特殊之處,這種可能性不高。
他說真正讓他佩服的,會是一個系統在翻譯、視覺這類已經很平常的任務上,完全不犯人類不會犯的那種錯。Lex 說 GPT-2 很多方面可能比人聰明,他說知識廣度確實如此。
他理想中的畫面是不同國家或城市的人投票決定屬於他們的 AGI 該做什麼,AGI 去執行,像是把民主往前推一步;人類是董事會,AGI 是執行長,董事會永遠可以按下重設鍵,把參數重新隨機化。Lex 問人類是不是永遠按得下重設鍵,他說絕對做得出「自己想要被人類控制」的 AI,就像父母樂於照顧孩子,而且他以最高的信念相信 AGI 也能這樣設計,讓它樂於幫助人類興旺。
Lex 提到 George Washington 主動交出總統權力的例子,問他做不做得到,他說自己會覺得那很 trivial,反而覺得握有那種權力的情境很恐怖;談到具體的對齊做法,他設想用一個另外訓練、專門學習人類價值判斷的系統,去當更強大強化學習系統的價值函數。
被問到人類存在背後隱含的目標函式、人生意義是什麼,他認為這個問題本身問錯了方向,因為它預設有一個外部答案;他說我們存在這件事本身就很了不起,該做的是盡量善用它。接著被問有沒有後悔的決定、有沒有特別驕傲的時刻,他說有後悔但試著釋懷,學術成就讓他驕傲卻不是快樂的來源;快樂很大程度上來自你怎麼看待事情,不是遇到什麼,但他說這是他目前的看法,也不敢太肯定。