← 回到天際線 思考機器第 37 層 / 102

EP 1442020-12-131:56:32

坐在前排看強化學習

Michael Littman

布朗大學教授回顧自己從大學時代一路近距離看著強化學習發展到 AlphaZero,也聊了寫打油歌與教書的日常。

Michael Littman: Reinforcement Learning and the Future of AI | Lex Fridman Podcast #144在 YouTube 看 ↗

重點6 條

  1. 踏進強化學習的兩條線:大學時期他一邊想寫程式教電腦玩井字棋,一邊修了一門會讀到 Pinker 與 Prince 質疑類神經網路的心理系課,兩件事讓他開始接觸「學習」與強化學習的雛形概念。
  2. 畢業後在 Bellcore 接上強化學習:同事 Dave Ackley(Boltzmann machine 論文第一作者)給了他 Rich Sutton 1984 年的 TD 論文;Ackley 說乾脆請 Sutton 來演講,他在現場聽到對方剛想出來的 Q-learning。
  3. TD-Gammon 之後有十幾年的低潮:Jerry Tesauro 讓西洋雙陸棋程式純靠自我對弈學會下棋,令人驚豔;但接下來十幾年,他和學生想把同一套方法用到別的問題上,一再失敗。文獻裡雖然有電梯調度、手機基地台交接這類漂亮的示範,據他所知都沒有真正上線。
  4. AlphaGo 讓他佩服的是工程,不只是結果:他認為最厲害的地方是把一大堆既有構想整合成一個能跑的系統;他也認為 Tesauro、David Silver 這種能讓類神經網路「聽話」的人,本身的功力常被低估。
  5. 他不太擔心超級智慧失控:對 Bostrom 式的存在風險論證,他認為要先發展出能在真實世界運作的技術,那個過程本身會讓人類同步學會怎麼控制它,不會憑空一步跳到失控。
  6. GPT-3 很強,但少了被反駁的經驗:他認為語言模型只從人類寫下的文字裡學,沒有被人「頂回去」、爭輸幾次的經驗,而那正是人類智能很重要的一部分。

時間軸26 段

01 02:21
機器人電影閒聊

從電影《Robot and Frank》聊起:片中老人把居家機器人拉進自己古怪的生活,Littman 喜歡這種讓人把科技變成自己的東西的願景,而不是把人塑造成科技需要的樣子。

02 04:57
音樂品味的告白

Littman 坦承自己幾乎沒有音樂品味:2011 年前後起固定聽告示牌前十名單曲,一首歌聽久了就會喜歡上,所以他最喜歡的歌永遠是最近聽最多的那首。

03 08:04
TurboTax 廣告插曲

他被找去拍 TurboTax 廣告,回憶片場幾十人為了控制陽光、換底片忙進忙出的場面。

04 13:04
科普打油歌

他寫過把 halting problem 塞進 Billy Joel《Piano Man》的歌詞,也跟老友 Charles Isbell 合拍了 Thriller 版本的過擬合教學影片。

05 19:00
對 AGI 風險的立場

他習慣從各個角度看事情,對超級智慧毀滅人類的論證卻很篤定地不信;他讀過 Bostrom 的書,也寫過評論回應 Musk「AI 在召喚惡魔」的說法,認為 Musk 相信點子的力量,這是他的長處,也是他的盲點。

06 26:01
反駁快速失控論

他用飛機組裝與演化類比:能做出有自主能力的技術之前,會先在過程裡學到怎麼控制它,不會像 747 憑空組裝出來讓人措手不及。

07 28:41
社群媒體算不算現成的 AGI

Lex 擔心的是根本沒人發現它已經在發生:社群媒體的演算法已經在左右人類的集體智慧。Littman 說他寧可信任維基百科也不信任 Facebook 或 YouTube;他相信社群媒體能把我們搞砸,也能帶來好處,要學會駕馭它的是在它起飛時還在念國中的那一代。他還提到人類跌跌撞撞卻總能「升級」到下一關,他的強化學習 agent 做不到。

08 37:10
井字棋與 TRS-80

他 13 歲拿到人生第一台電腦(1979 年的 TRS-80),大學時想寫程式教電腦玩井字棋;選 Yale 而不是 Princeton,因為 Yale 有電腦科學系。

09 40:20
認知心理學路線

他自稱是「認知心理學跟班」,在課堂上讀到 Pinker 與 Prince 質疑類神經網路的論文,對其中提到的強化學習概念特別有興趣。

10 44:29
Bellcore 遇見 Rich Sutton

畢業後進 Bellcore,同事 Dave Ackley 給了他 Sutton 1984 年的 TD 論文;Ackley 說乾脆請 Sutton 來演講,他在現場聽到對方剛想出來的 Q-learning。

11 48:54
worst-case 理論值不值得追求

兩人辯論最壞情況分析的價值:Littman 認為它換來的是「模組化」,能放心把一個東西接到另一個東西上,即使那些理論保證往往很弱。

12 52:34
TD-Gammon 的震撼

Tesauro 先用專家棋步訓練出評估函數,再跨到不需要老師、讓程式自己下的完整強化學習,讓 Littman 覺得非常驚人。

13 54:54
「神經網路語者」

他和一代代學生想把同一套方法套進其他問題,幾乎每次都失敗;他認為 Tesauro、後來的 David Silver 都是那種能讓類神經網路「聽話」的稀有人才,人的作用常被低估。

14 59:16
self-play 一詞從哪來

他在 1996 年的博士論文就用了 self-play,因為 Tesauro 的論文裡(他記得標題就有)已經用過這個詞;「rollout」也是西洋雙陸棋留下來、後來變成強化學習通用詞彙的術語。

15 1:00:49
AlphaGo 到 AlphaZero

Lex 說同一套自我對弈精神被 DeepMind、OpenAI 用在更複雜的遊戲上;Littman 尤其佩服 AlphaGo 團隊把一大堆構想整合進同一套系統的工程能力。

16 1:06:15
RL 沉寂的十幾年

他和學生想把 TD-Gammon 的架構套到其他問題上,一再失敗;文獻裡有幾個漂亮的示範,像電梯調度,以及 Satinder Singh 等人做的手機基地台交接,但據他所知都沒進到實際產品,類神經網路那陣子整體也在退燒。

17 1:08:03
AlphaGo 還是 AlphaGo Zero 更關鍵

他提到跟 Satinder Singh 聊過這個:Satinder 對完全不靠人類棋譜的 AlphaGo Zero 印象更深;Littman 反而覺得 AlphaGo 第一次真的跑起來才是更大的突破,之後少掉人類棋譜只是「一旦有效就是有效」。

18 1:12:00
圍棋有沒有天花板

Lex 轉述他訪問 David Silver 時聽到的說法:AlphaZero 在圍棋、西洋棋上都還沒找到天花板,投入再多運算力還是持續進步。Littman 說西洋棋的人機合作隊伍已經贏過最強的程式,棋力看起來也在逼近上限;圍棋的策略深度比西洋棋大得多,但終究是有限賽局,理論上存在最優解。

19 1:19:07
GPT-3 的限制

他認為 GPT-3 很懂語言的統計規律,卻不是通用的聰明,因為它只從人類寫下的文字裡學,沒有被人「頂回去」、爭輸幾次的經驗。

20 1:24:22
Bitter Lesson

Lex 整理 Rich Sutton〈Bitter Lesson〉的論點:真正見效的是能吃下更多運算力的簡單演算法。Littman 拿他記得是 Fred Jelinek 說的「每開除一個語言學家,效能就上升」呼應,但也提醒晶片每一代的開發成本同樣在翻倍,看起來像指數的曲線,其實只是 S 曲線的前半段。

21 1:29:41
演算法會為了自保操控人嗎

Lex 說他做過自駕車,很難反駁 Musk 的樂觀,但從工程與心理學的角度看,開車比想像中難得多。話題轉到推薦演算法,Littman 認為它們確實已經在操控人的行為,但目的不是自保;要是它們開始說服我們別把它關掉,他才會真的害怕,而從現在的技術看不出有路走到那一步。

22 1:34:39
問三本書,先講一個故事

他用說故事避開三本書的問題:Bellcore 主管 Tom Landauer 做出了 latent semantic analysis,Littman 稱他是詞嵌入的發明者;Landauer 說人的詞彙大多從閱讀學來,自認不太讀書的 Littman 不信,現在他靠有聲書補回來。

23 1:37:17
開車靠觀察學得會嗎

他教兒子開車時才發現,開車最難的不是操控,而是隨時揣摩其他駕駛與行人在想什麼。Lex 則說搭過 Waymo 之後,他開始覺得開車也許沒那麼難,Littman 笑說那是物種歧視的論證。

24 1:42:47
自駕車該怎麼上路

他多年前預測自駕車會先在封閉社區慢慢試,結果猜錯了,現在是直接放上路看會怎樣,但他仍認為漸進比較好。Lex 則認為資本主義獎勵冒險,Musk 與 Waymo 正在互相逼對方進步。

25 1:46:43
終於回答三本書

繞了一大圈之後,他推薦《Program or Be Programmed》、正在讀的《The Alignment Problem》,以及 Ted Chiang 的短篇小說集《Exhalation》。

26 1:53:34
人生意義是平衡

42 歲生日辦了一場「人生意義派對」,每人做投影片分享答案;他的答案是「平衡」,還準備了獨輪車等各種需要保持平衡的玩具當派對活動。