← 回到天際線 思考機器第 19 層 / 102

EP 3062022-07-262:10:08

Vinyals 談 Gato 與機器意識

Oriol Vinyals

DeepMind 研究總監談通用智能體 Gato 如何打通文字、影像與動作,也聊模型算不算有意識。

Oriol Vinyals: Deep Learning and Artificial General Intelligence | Lex Fridman Podcast #306在 YouTube 看 ↗

重點6 條

  1. 通用智能體 Gato 想解決什麼:DeepMind 把文字、影像、機器人動作全部拆成同一串 token,交給同一個 transformer 去預測下一步,這就是 Gato;Vinyals 說這只是「起點」,因為十億參數的規模還談不上把不同任務真正打通。
  2. 模型不會在對話中真的「學」:他指出現在的語言模型部署之後權重就不再更新,能靠的只有幾千字的工作記憶;要讓 AI 像人一樣累積經驗、不必每隔幾個月重新從零訓練,他認為這是深度學習還沒解決的大洞。
  3. 模組化路線:凍結舊模型、外掛新能力:Flamingo 把 700 億參數的語言模型 Chinchilla 整個凍結,只在外面加一小塊會看圖的網路,訓練成本比從頭再練一個模型低很多;他把這條路線看成跟 Gato 從零訓練互補的另一種答案。
  4. 規模之外,團隊與基準同樣關鍵:回顧這些計畫,他說最意外的不是某個演算法巧思,而是工程細節、資料整理跟基準設定有多重要;AlphaFold 能解開蛋白質摺疊難題,靠的正是先有一套社群公認的評分標準。
  5. 對 LaMDA 事件的立場:現在的系統還差得遠:面對有 Google 工程師主張對話模型已經產生知覺,他說自己從來沒有一刻真心覺得哪個系統有知覺,生物的複雜程度跟現在的神經網路完全不是一個量級;但他預期以後會有愈來愈多人對 AI 產生情感依附,甚至出現「機器人民權運動」這種主張。
  6. 同意苦澀的教訓,但對「搜尋」保留:他大致認同 Rich Sutton 的說法——能吃下更多算力的通用方法最後都會贏;但他覺得「搜尋」這一半沒那麼普遍適用,只有像 AlphaCode 這種獎勵函數夠明確的任務才吃得到。

時間軸19 段

01 00:31
AI 能取代訪談嗎

對談開場先問一個哲學問題:AI 能不能頂替訪問者或受訪者?兩人認為關鍵不在準確度,而在有沒有身分、立場與「說錯話會被取消」的風險,這些才是讓對話吸引人的關鍵。

02 12:07
工作記憶只有 2000 字

Vinyals 解釋現在的語言模型部署後權重就不再更新,能用的只有對話當下幾千字的「工作記憶」,超過就開始遺忘,這是他認為深度學習目前最大的限制之一。

03 14:09
不該每次從零練起

他覺得每解一個新任務就整套權重打掉重練很浪費,人類與宇宙演化都是站在既有基礎上繼續長,深度學習卻還沒找到「把模型養大」而不是「重新生一個」的辦法。

04 21:54
Gato 那則推文

Lex 追問他那句「Gato 不是終點,是起點,喵」的推文,Vinyals 解釋 Gato 這個名字來自西班牙語的「貓」,也順勢帶出 DeepMind 用動物幫模型命名的傳統。

05 34:15
怎麼把一切變成 token

文字靠常見子字串切成 token,影像先壓成 16×16 的小圖塊再量化,動作也一樣離散化;三種模態各自占用不同的整數區間,彼此獨立,只靠訓練資料把它們連起來。

06 42:04
精神分裂還是渾然一體

面對「這個模型是不是同時裝著好幾種互不相干的任務」的提問,他說其實是同一顆大腦、同一組梯度下降,各模態的向量表示會在訓練過程中自然對齊,例如「貓」這個字跟貓的圖片最後會長得很像。

07 48:19
模組化:凍結舊模型長新能力

Flamingo 把 700 億參數的語言模型 Chinchilla 整個凍結、外掛一小塊會看圖的子網路,只加了約 100 億參數就學會看圖對話;他認為重用權重的模組化路線會留下來。

08 56:49
重新定義 meta-learning

他回顧 meta-learning 這個詞怎麼從早年局限在「認物體類別」的影像基準,被 GPT-3「語言模型是少樣本學習者」這篇論文整個打開,變成用自然語言就能現場教模型新任務。

09 1:00:31
五到十年後的教學式互動

他期待五到十年內能直接用對話教模型玩一款新遊戲,像教人一樣讓它邊玩邊問「我剛剛這樣做對不對」,而不是像 AlphaStar 那樣為單一遊戲整套訓練專屬權重。

10 1:11:03
真正意外的是工程與基準

他說這些突破最讓他意外的不是某個巧妙演算法,而是資料工程跟基準設定有多重要;AlphaFold 能解開蛋白質摺疊,靠的正是先有社群公認的評分標準,才敢瞄準做好幾年都沒把握的目標。

11 1:14:54
Transformer 為何這麼穩

他形容 transformer 靠的是「按內容而非位置去查找上下文」這個歸納偏見,幾年來架構幾乎沒怎麼變過;但固定長度的提示視窗仍是硬傷,教模型玩星海爭霸這種任務需要的上下文遠超現在能塞進去的量。

12 1:22:04
人在這些突破裡有多重要

他認為研究者個人的堅持會決定「哪個突破先發生、哪個後發生」,也舉例 attention 機制最早是蒙特婁團隊在算力較少的情況下被逼出來的;工程細節裡的小決定,往往會隨規模被放大成關鍵差異。

13 1:33:05
神經網路的頓悟現象

他解釋某些任務在規模跨過某個門檻前表現幾乎是隨機的,跨過門檻才忽然變好,這種「湧現」現象沒有理論能預測,只能靠像 Chinchilla 那篇重新校準規模定律的論文,從小規模實驗外推。

14 1:39:46
如果有工程師說模型有意識

面對有 Google 工程師公開主張聊天模型已經產生知覺,他說自己從來沒有一刻真心覺得任何系統有知覺,現在的神經網路跟生物細胞的複雜程度完全不是一個量級,還差得遠。

15 1:47:25
通用智能需要意識嗎

他不認為要做出真正有用的通用智能一定得先解決意識問題,但預期以後會有愈來愈多人對 AI 產生情感依附,甚至出現「機器人民權運動」,逼工程團隊開始面對系統能不能顯得有知覺這種法規問題。

16 1:55:28
談老友 Ilya Sutskever

他談起剛被選為英國皇家學會院士的老友 Ilya Sutskever,說對方打從早期就深信「把神經網路做大」這條路線,那場著名的 sequence to sequence 演講,他自己在飯店房間聽過更早、更大膽的彩排版本。

17 2:00:16
呼應苦澀的教訓

他大致同意 Rich Sutton「能吃下更多算力的通用方法最後都會贏」的說法,也認同深度學習該盡量不預處理資料、直接從原始位元組學起;但他覺得「搜尋」這一半沒那麼普遍適用,AlphaCode 靠大規模搜尋拿下接近人類的成績算是少數成功案例。

18 2:03:37
有生之年做得出 AGI 嗎

他認為有生之年做出「人類水準」的系統機率很高,靠模仿學習就能到位;但要「超越」人類還得靠強化學習定義出恰當的獎勵函數,這一步他沒有把握能在有生之年看到。

19 2:05:56
感到害怕還是期待

被問到面對這樣的未來是害怕還是期待,他說更擔心的是資源與能源的實際限制,也希望人類進入多星球時代時,人類跟機器人的比例不要差太多,「一比一」對他來說才算是好的平衡。