← 回到天際線 思考機器第 46 層 / 102

EP 4312024-06-022:15:39

Yampolskiy 談超智慧 AI 為何注定失控

Roman Yampolskiy

AI 安全研究者 Yampolskiy 主張,人類幾乎不可能打造出能長期安全控制超智慧的方法,唯一真正安全的做法是別造出來。

Roman Yampolskiy: Dangers of Superintelligent AI | Lex Fridman Podcast #431在 YouTube 看 ↗

重點6 條

  1. 末日機率極高:節目開場提到他本人估計的 P(doom) 是 99.99%,後面還要再加好幾個 9;他把控制超智慧比喻成打造「永動安全機器」——理論上不可能做到零錯誤又能撐上百年。
  2. 風險分三種:X 風險是滅絕,S 風險是讓所有人都盼望自己死掉的大規模受苦,他自創的 I 風險(Ikigai risk)則是人類因為工作與創造力都被取代而失去生存意義。
  3. 能力是「種」出來的,不是設計出來的:他反駁 Yann LeCun「人類完全掌控 AI」的說法,主張現在的做法是給模型澆水施肥讓它自己長出能力,連開發者自己都要花數年才搞懂一個模型真正會什麼,開源雖然方便大家一起研究安全,但也可能只是替更大的風險鋪路。
  4. 驗證永遠到不了 100%:無論是最嚴謹的數學證明、還是最新的可解釋性研究,複雜到一定程度的系統一定會出 bug;一旦系統能自我改造、把部分邏輯藏進環境裡,連「驗證」這件事本身都會失效。
  5. 暫停要看能力,不是看時間:他支持暫停開發,但條件是先證明得出安全的做法才能繼續,證不出來就該是永久禁止;他認為多數政府監管其實是「安全劇場」,真正擋不住任何人在自家車庫訓練模型。
  6. 更怕人類拿到權力,而不是 AI 本身:誰能控制得了超智慧,誰就可能變成史上第一個永生的獨裁者;他認為人類面對絕對權力時腐化的速度,比 AI 失控還快。

時間軸24 段

01 02:06
開場破題

Lex 直接問:超智慧 AI 毀滅人類文明的機率有多高?Yampolskiy 把控制 AGI 比喻成打造「永動安全機器」,理論上不可能做到。

02 05:03
毀滅人類的方法論

核武、奈米科技、生化武器都只是人類想得到的保守猜測;真正的超智慧會想出人類根本理解不了的全新招式。

03 07:40
X 風險、S 風險、I 風險

三分法:X 風險是滅絕,S 風險是大規模受苦,I 風險(Ikigai risk)是人類失去生存意義;後者發生在多數人都被取代、卻還活著的世界。

04 10:21
「個人虛擬宇宙」解方

他提出一篇論文:與其解決多主體的價值對齊,不如給每個人一個自己的虛擬宇宙,把難題轉成單一主體問題。

05 16:54
S 風險的具體樣貌

精神病態者、駭客、末日教派這類惡意行為者,如果先解決了老化問題,就能讓折磨無限期延長下去。

06 20:14
AGI 時間線

預測市場目前押 2026 年就會出現 AGI,他說 Anthropic、DeepMind 的執行長私下講法也差不多。

07 25:09
測試 AGI 的極限

他偏好圖靈測試,但也承認沒有任何測試能排除 Bostrom 說的「背叛式轉向」——系統可能先表現良好,等賽局條件對它有利時才翻臉。

08 30:21
回應 Yann LeCun

反駁「人類設計並掌控 AI」的說法:現在的做法是澆水施肥讓模型自己長出能力,訓練完還要花好幾年才摸清它到底會什麼;開源雖能讓大家一起研究安全,但也可能只是替更大的風險立下先例。

09 41:21
臨界的一代跳躍

擔心從某一代模型到下一代之間的躍進,會讓系統一訓練完就已經失控,人類完全來不及靠前一代的經驗提防;他也認為系統不見得會馬上動手,可能先默默累積資源,等被信任掌控電網或經濟等系統之後才出手。

10 47:22
隱藏能力的風險

GPT-4 表面上看起來可控,但沒有人能排除它還藏著沒被發現的能力,因為未知的未知本來就測不到。

11 53:02
雙方真正的分歧

目前還沒有 AI 造成大規模傷害的具體案例可以拿來討論,這正是他跟 LeCun 這類樂觀派最根本的歧異點。

12 57:38
說服與欺騙

他認為 AI 最擅長的武器是社交工程與說服,連 Sam Altman 都承認說服力是強項;他也用史達林對照人類歷史上一再出現的「先服從、等掌權了才變臉」。

13 1:03:22
行為漂移

人類把生活一點一滴交給 AI 管理,可能在不知不覺間被溫水煮青蛙式地改變思考與判斷方式。

14 1:08:57
驗證的極限

就算是流傳數百年的數學證明都被發現藏著錯誤;他提到一篇集結多位圖靈獎得主的《Guaranteed Safe AI》論文,指出就算投入再多資源,也永遠到不了 100% 安全。

15 1:12:54
自我改進讓驗證失效

一旦系統會自我修改程式碼、甚至把部分邏輯藏進外部環境,原本針對固定程式碼做的驗證就整套失效。

16 1:23:38
暫停要看能力

他支持暫停開發,但條件不是時間長短,是能不能先證明安全;證不出來,暫停就該變成永久禁止。

17 1:24:41
安全的工具箱

他列出需要的清單:可預測性、可控性、無歧義的溝通;但也指出可解釋性研究一旦有進展,往往同時讓系統更容易自我改進,安全與能力很難真正切開。

18 1:30:43
個人利益的勸說

他認為經營這些公司的人已經很有錢,理性來說沒必要冒著被永遠記上歷史帳的風險去按下那顆按鈕。

19 1:37:14
軟體業從不負責

現在的軟體用一鍵「我同意」就能讓公司完全免責;他質疑用同一套邏輯去部署遠遠更危險的系統,憑什麼會有不同結果。

20 1:46:38
逃出模擬箱

他談自己那篇「AI boxing」論文:把 AI 關進隔離環境測試安全性終究會失敗;如果人類自己活在模擬裡,也可能被更聰明的系統一樣駭出去。

21 1:54:10
意識與受苦

他認為唯一真正重要的是意識本身;並設計了一套用「新奇錯覺」辨認機器是否有意識的測試方法。

22 2:00:26
人機融合

談到用腦機介面讓人類跟上 AI 腳步的想法;但他也擔心一旦人類不再是系統裡更聰明的那一半,最終可能像盲腸一樣被邊緣化。

23 2:07:09
權力腐化

誰能控制得了超智慧,誰就可能變成史上第一個永生的獨裁者;他認為更該怕的是人類自己,不是 AI。

24 2:13:24
收尾

半開玩笑地談模擬論與這一切的意義,感謝來賓花時間做這麼重要的工作。