EP 4312024-06-022:15:39
Yampolskiy 談超智慧 AI 為何注定失控
Roman Yampolskiy
AI 安全研究者 Yampolskiy 主張,人類幾乎不可能打造出能長期安全控制超智慧的方法,唯一真正安全的做法是別造出來。
Roman Yampolskiy: Dangers of Superintelligent AI | Lex Fridman Podcast #431在 YouTube 看 ↗
重點6 條
- 末日機率極高:節目開場提到他本人估計的 P(doom) 是 99.99%,後面還要再加好幾個 9;他把控制超智慧比喻成打造「永動安全機器」——理論上不可能做到零錯誤又能撐上百年。
- 風險分三種:X 風險是滅絕,S 風險是讓所有人都盼望自己死掉的大規模受苦,他自創的 I 風險(Ikigai risk)則是人類因為工作與創造力都被取代而失去生存意義。
- 能力是「種」出來的,不是設計出來的:他反駁 Yann LeCun「人類完全掌控 AI」的說法,主張現在的做法是給模型澆水施肥讓它自己長出能力,連開發者自己都要花數年才搞懂一個模型真正會什麼,開源雖然方便大家一起研究安全,但也可能只是替更大的風險鋪路。
- 驗證永遠到不了 100%:無論是最嚴謹的數學證明、還是最新的可解釋性研究,複雜到一定程度的系統一定會出 bug;一旦系統能自我改造、把部分邏輯藏進環境裡,連「驗證」這件事本身都會失效。
- 暫停要看能力,不是看時間:他支持暫停開發,但條件是先證明得出安全的做法才能繼續,證不出來就該是永久禁止;他認為多數政府監管其實是「安全劇場」,真正擋不住任何人在自家車庫訓練模型。
- 更怕人類拿到權力,而不是 AI 本身:誰能控制得了超智慧,誰就可能變成史上第一個永生的獨裁者;他認為人類面對絕對權力時腐化的速度,比 AI 失控還快。
時間軸24 段
Lex 直接問:超智慧 AI 毀滅人類文明的機率有多高?Yampolskiy 把控制 AGI 比喻成打造「永動安全機器」,理論上不可能做到。
核武、奈米科技、生化武器都只是人類想得到的保守猜測;真正的超智慧會想出人類根本理解不了的全新招式。
三分法:X 風險是滅絕,S 風險是大規模受苦,I 風險(Ikigai risk)是人類失去生存意義;後者發生在多數人都被取代、卻還活著的世界。
他提出一篇論文:與其解決多主體的價值對齊,不如給每個人一個自己的虛擬宇宙,把難題轉成單一主體問題。
精神病態者、駭客、末日教派這類惡意行為者,如果先解決了老化問題,就能讓折磨無限期延長下去。
預測市場目前押 2026 年就會出現 AGI,他說 Anthropic、DeepMind 的執行長私下講法也差不多。
他偏好圖靈測試,但也承認沒有任何測試能排除 Bostrom 說的「背叛式轉向」——系統可能先表現良好,等賽局條件對它有利時才翻臉。
反駁「人類設計並掌控 AI」的說法:現在的做法是澆水施肥讓模型自己長出能力,訓練完還要花好幾年才摸清它到底會什麼;開源雖能讓大家一起研究安全,但也可能只是替更大的風險立下先例。
擔心從某一代模型到下一代之間的躍進,會讓系統一訓練完就已經失控,人類完全來不及靠前一代的經驗提防;他也認為系統不見得會馬上動手,可能先默默累積資源,等被信任掌控電網或經濟等系統之後才出手。
GPT-4 表面上看起來可控,但沒有人能排除它還藏著沒被發現的能力,因為未知的未知本來就測不到。
目前還沒有 AI 造成大規模傷害的具體案例可以拿來討論,這正是他跟 LeCun 這類樂觀派最根本的歧異點。
他認為 AI 最擅長的武器是社交工程與說服,連 Sam Altman 都承認說服力是強項;他也用史達林對照人類歷史上一再出現的「先服從、等掌權了才變臉」。
人類把生活一點一滴交給 AI 管理,可能在不知不覺間被溫水煮青蛙式地改變思考與判斷方式。
就算是流傳數百年的數學證明都被發現藏著錯誤;他提到一篇集結多位圖靈獎得主的《Guaranteed Safe AI》論文,指出就算投入再多資源,也永遠到不了 100% 安全。
一旦系統會自我修改程式碼、甚至把部分邏輯藏進外部環境,原本針對固定程式碼做的驗證就整套失效。
他支持暫停開發,但條件不是時間長短,是能不能先證明安全;證不出來,暫停就該變成永久禁止。
他列出需要的清單:可預測性、可控性、無歧義的溝通;但也指出可解釋性研究一旦有進展,往往同時讓系統更容易自我改進,安全與能力很難真正切開。
他認為經營這些公司的人已經很有錢,理性來說沒必要冒著被永遠記上歷史帳的風險去按下那顆按鈕。
現在的軟體用一鍵「我同意」就能讓公司完全免責;他質疑用同一套邏輯去部署遠遠更危險的系統,憑什麼會有不同結果。
他談自己那篇「AI boxing」論文:把 AI 關進隔離環境測試安全性終究會失敗;如果人類自己活在模擬裡,也可能被更聰明的系統一樣駭出去。
他認為唯一真正重要的是意識本身;並設計了一套用「新奇錯覺」辨認機器是否有意識的測試方法。
談到用腦機介面讓人類跟上 AI 腳步的想法;但他也擔心一旦人類不再是系統裡更聰明的那一半,最終可能像盲腸一樣被邊緣化。
誰能控制得了超智慧,誰就可能變成史上第一個永生的獨裁者;他認為更該怕的是人類自己,不是 AI。
半開玩笑地談模擬論與這一切的意義,感謝來賓花時間做這麼重要的工作。