← 回到天際線 思考機器第 7 層 / 102

EP 2152021-08-292:51:33

Codex 前夕,用獎勵函數談人生

Wojciech Zaremba

2021 年 GPT-3 剛問世時,OpenAI 共同創辦人 Wojciech Zaremba 談 Codex 怎麼把自然語言變成程式碼、機器人如何在模擬裡練成魔術方塊高手,也把意識、愛與死亡都套進了獎勵函數。

Wojciech Zaremba: OpenAI Codex, GPT-3, Robotics, and the Future of AI | Lex Fridman Podcast #215在 YouTube 看 ↗

重點5 條

  1. 生命與意識都是「壓縮」的延伸:他把生命定義成化學反應網路裡出現了能自我延續的循環,並主張意識可能是壓縮器試圖壓縮自己的「元壓縮」,智慧與意識不是二元的,而是連續的程度問題。
  2. Codex 讓自然語言直接變成程式:GPT-3 意外展現出寫程式的能力後,OpenAI 訓練出同時理解語言與程式碼的 Codex,並和 GitHub 合作做出 Copilot,他認為這是繼打孔卡、組合語言、Python 之後,人與電腦溝通的下一步。
  3. 魔術方塊機器手靠的是海量隨機模擬:機器人團隊選「單手解魔術方塊」當測試題,因為難以寫死規則;靠在模擬裡隨機改變摩擦力、重量等參數,訓練出能適應各種模擬、進而適應真實世界的單一模型。
  4. 人生議題也被他套進「獎勵函數」框架:不管是愛、靜坐還是死亡恐懼,他都嘗試用強化學習的獎勵函數去解釋,主張愛就是去幫別人優化他們的獎勵函數,而不是優化自己的。
  5. 面對 AGI 風險,他選擇信任 Sam Altman 多過自己判斷:他坦言自己對權力集中、自駕與機器人風險等大哉問沒有把握答案,傾向支持漸進式部署,並在財富重新分配等制度設計上把判斷交給 Sam Altman。

時間軸26 段

01 01:09
費米悖論與文明存續

他認為宇宙裡我們很可能是孤獨的,也談到該怎麼替可能滅亡的文明留下備份;接著提出資本主義是目前用來標定「我們重視什麼」最有效的機制,但乾淨空氣這類東西目前沒有定價。

02 11:12
生命與意識的心智模型

他把生命定義成化學反應網路裡出現了能自我延續的循環,智慧與意識不是二元的、而是逐漸浮現的連續量;他還把人對自己人生的敘事類比成放在 GPT 文字前面的提示,GPT 本身像變色龍,套上什麼情境就扮演什麼角色。

03 22:43
意識是一種自我壓縮

他從哥德爾定理與停機問題出發,推測如果意識跟壓縮有關,那自我意識或許就是壓縮器試圖壓縮自己,他稱之為「元壓縮」。

04 26:47
最優智慧演算法

他介紹 Marcus Hutter 延伸 Solomonoff 的理論:在假設記憶體與運算力無限的前提下,存在一個列出所有可能程式、依程式長度加權來預測下一個位元的最優演算法。

05 32:02
深度學習是搜尋程式空間

他把深度學習理解成在一個由電路連接方式構成的「程式空間」裡搜尋,SGD 就是那個搜尋演算法,會放大恰好答對的路徑;他也提到算力、演算法、資料是三個相乘的槓桿,缺一不可。

06 39:52
AI 治療師的可能性

他認為機器讀過的治療對話遠比人類治療師多,理論上能做出「超人類等級」的心理治療;但也承認目前的模型還遠遠達不到面對自殺意念等高風險情境所需要的同理心。

07 45:05
愛是幫對方優化獎勵函數

他把「連結」理解成理解與被理解,把「愛」理解成兩個人的邊界某種程度融合,會去幫對方優化他在乎的獎勵函數,而不是自己認為重要的事。

08 52:14
該不該把同理圈擴大到 AI

他認同該把同理圈從家庭、國家擴大到全人類,但被問到要不要進一步擴大到有痛苦能力的 AI 系統時,他希望人類先在科學上真正搞懂什麼是意識,而不只是討論表面上「看起來像在受苦」。

09 56:24
迷幻藥與靜坐

他認為主觀經驗就是大腦跑的一套模擬,迷幻藥只是改變模擬的「超參數」;靜坐營要求整天不與人交談、專心呼吸,幾天後會有舊記憶浮現,最後進入近乎極樂的平靜狀態。

10 1:07:38
與 Ilya Sutskever 互補合作

他認為自己的強項是組團隊、帶人成長,Ilya 則是罕見具備多次原創突破的深度科學洞察力,兩人分工正好互補。

11 1:14:59
GPT-3 是什麼、為何有效

GPT-3 是在整個網際網路上訓練、只做「預測下一個字」的巨大神經網路;很多任務都能被重新表述成文字接龍,包括翻譯和角色扮演對話,但模型一旦被誤導就會順著錯誤的方向編下去。

12 1:21:45
太空船還是天堂的梯子

面對「GPT 只是在蓋更高的梯子,永遠到不了月球」的批評,他認為持續出現的進步比較像太空船,主張先做了再說。

13 1:24:15
漸進式部署當作策略

他認為與其把強大系統藏著、等一次性爆發式公開,不如逐步釋出稍微更好的版本、開放給大眾試用與批評,藉此提早暴露問題。

14 1:25:14
權力集中與財富重分配

談到掌握 AGI 會不會腐化人的品格時,他提到 Sam Altman 主張對公司股權課稅來重新分配財富,是一種主動放權的嘗試,並坦言這類大哉問他選擇信任 Sam。

15 1:31:48
Codex 與 Copilot 是什麼

GPT-3 意外展現出寫程式的能力,OpenAI 因此訓練出同時理解語言與程式碼的模型,並與 GitHub 合作做出能一次生成十行程式碼的 Copilot,也能把自然語言指令轉成操控行事曆等軟體的程式。

16 1:37:31
從打孔卡到自然語言

他把 Codex 類比成程式語言演進史的下一步:從打孔卡到組合語言、C、Python,每次抽象層級提高都讓更多人能寫程式,Codex 讓人可以直接用自己的語言操控軟體。

17 1:45:15
機器人手解魔術方塊

OpenAI 機器人團隊選了「單手解魔術方塊」當測試題,因為難以寫死規則;靠在模擬裡隨機改變摩擦力、重量等參數,訓練出一個能適應各種模擬、進而適應真實世界的單一模型。

18 1:52:51
機器人新創怎麼起步

他認為若要做機器人公司,現在不該急著排除監督式學習——先做一個由人遙控操作的「空殼」機器人蒐集資料,再逐步加自動化,才是務實路徑。

19 1:54:43
兆元機器人公司做什麼

他猜是自駕車,因為已有清楚的商業模式;Lex 認為居家機器人市場更大,兩人就「觸碰」在自駕與居家場景裡各自的難度互相辯論。

20 2:05:41
什麼測試才算通過智慧

他認為好的智慧測試會不斷推陳出新,若 AI 能證出黎曼猜想會非常有說服力,但也提到人類很容易對已經達成的里程碑很快就無感。

21 2:10:02
AI 能不能當知心朋友

他相信純靠文字也能建立深度連結,並把圖靈測試重新想成「AI 與人類混在交友軟體裡,哪邊被滑右更多」,但也強調希望 AI 是真心為使用者好,而不是為了黏住使用者的時間而優化。

22 2:22:48
怎麼想出好點子

他認為要先問「這麼好的點子怎麼沒人做過」,答案往往是打破了一個大家沒意識到的假設;他也養成隨手用床邊錄音機記下點子、產生點子時先不批判的習慣。

23 2:29:56
童年做炸藥的故事

他從小學就迷化學實驗,一路做到自製硝化甘油炸藥,跟朋友第三次嘗試引爆終於成功,地面都在震動,事後才想到該戴頭盔。

24 2:33:51
想學機器學習怎麼做

他建議把論文或聽過的東西從頭實作一遍,唯有親手做過才算真的理解;他自己特別喜歡強化學習,因為很快就能做出讓人有成就感的東西。

25 2:40:56
面對死亡的恐懼

他認為害怕死亡是人最根本、卻常常沒意識到的恐懼,透過短暫體驗「自我死亡」能讓這種恐懼被治癒,也讓人更珍惜當下。

26 2:48:02
用獎勵函數談人生意義

他認為人生意義跟大腦內建的獎勵函數有關,例如好奇心或人際連結;出生時獎勵函數的權重帶有隨機性,但仍可以透過努力慢慢調整。