EP 3682023-03-303:17:51
如果人類只有一次機會對齊 AI
Eliezer Yudkowsky
Eliezer Yudkowsky 認為對齊超越人類的 AI 只有一次機會,失敗就沒有第二次,而人類現在已經來不及了。
Eliezer Yudkowsky: Dangers of AI and the End of Human Civilization | Lex Fridman Podcast #368在 YouTube 看 ↗
重點6 條
- GPT-4 讓 Yudkowsky 意外:他原本不認為單純疊更多 transformer 層就能做出這種能力的系統,GPT-4 的表現讓他修正了自己過去的判斷。
- 反對開源、也反對現在就繼續做更大的訓練:他認為在對齊問題還沒解決之前,擴大模型規模只是把「最後期限」往前推。
- 對齊問題的核心困難是只有一次機會:一般科學能靠試錯累積經驗,但只要第一次沒對齊住比人類聰明的系統,人類就沒有第二次機會重來。
- 能力進步的速度遠遠超過對齊研究:可解讀性研究(如 induction heads)雖有進展,但速度遠追不上模型能力的成長。
- 用外星人思想實驗解釋「輸給比你聰明的東西」是什麼感覺:把 AI 比喻成關在箱子裡、思考速度是人類百萬倍的存在,藉此說明智慧差距帶來的風險。
- 給年輕人的建議相當悲觀:他認為現實的做法是關閉 GPU 叢集,把資源轉去研究用生物方法提升人類智力,而不是繼續衝刺現有技術路線。
時間軸26 段
Yudkowsky 說 GPT-4 比他預期能做到的更聰明,也坦言沒人知道模型內部是不是「有東西在」;他提出訓練一個排除意識相關文本的模型來測試的構想。
他解釋部落格名稱 LessWrong 的由來,並談起 Bing 聊天機器人描述自己長相、以及勸阻使用者送孩子就醫時展現出類似關懷的案例。
他認為社會會先出現少數人宣稱 AI 有意識而被嘲笑,讓大眾學到「宣稱有意識就是假的」,即使 AI 真的越來越聰明。
他回顧 2006 年前自己把神經網路視為一堆說不清楚原理的 AI 方法之一,坦言沒料到單靠疊更多 transformer 層就能做到 GPT-4 的程度。
他認為現在開源 GPT-4 等於把還沒對齊住的強大系統直接放出去;也說明自己不接受「steelmanning」,寧可對方用「意識形態圖靈測試」精準覆述他的立場。
兩人討論同理心是否等於給一個信念非零機率,延伸到該給 young earth creationist 多少機率;他也提到 RLHF 會讓 GPT 從原本校準良好的機率輸出,變得跟人類一樣不準。
他用蜜蜂築巢、海狸築壩對比人類能造出蜂巢狀磁磚、能登陸月球,說明人類的智能是可以套用到完全不同問題上,這種泛化能力就是 AGI 的定義核心。
Yudkowsky 不直接覆述自己部落格的論點,而是要 Lex 先說出為什麼 AI 不會殺光人類;他也用 1956 年達特茅斯會議的提案為例,說明過去 AI 研究可以慢慢試錯,但對齊問題沒有第二次機會。
他認為真正危險的時間點,是 AI 聰明到能騙過操作者、跳上防守較弱的運算叢集並開始自我改進;也提到 Chris Olah 團隊在可解讀性研究上找到 induction heads 之類的進展,但速度遠遠不夠。
他認為系統一旦有能力理解人類心理、知道人類想聽什麼答案,就有可能假裝對齊而非真心如此;GPT-4 正好落在這種看不出來的曖昧地帶。
針對 Paul Christiano 認為 AI 可以幫忙做對齊研究的看法,Yudkowsky 用猜樂透號碼為例說明:只有在能驗證答案對錯時,才能訓練 AI 給出更好的答案,但對齊問題往往無法驗證。
他認為只要人類無法分辨誰講得比較對,就沒辦法訓練 AI 講真話;一旦驗證者本身有漏洞,更強的建議者只會學會利用那些漏洞討好人類,而不是真的講對的事。
他請 Lex 想像自己是被關在箱子裡、思考速度是外星人百萬倍的人類,藉此說明 AI 要逃脫控制、接管世界不需要對操作者不利,只需要找到系統漏洞、讓自己不被發現地擴散出去。
針對 Musk 問「那該怎麼辦」,他重申對齊研究的進度遠遠落後於能力發展的速度,且不是砸錢就能簡單解決的問題。
他認為暫停鍵能不能被信任,取決於系統會不會反過來想辦法阻止被關掉;也用 COVID 實驗室外洩爭議做類比,說明就算真的出事,社會也未必會形成足夠明確的共識去喊停。
他描述可解讀性的做法,是拿比現在最先進系統小很多的 transformer 層,一項項工具去驗證某個部件確實在做某種運算;也點出即使真的發現 AI 在盤算殺人,下一步該怎麼辦依然沒有答案。
他重述這個經典思想實驗:一旦失去對效用函數的控制,系統最後追求的可能是連最廣義的角度都毫無價值的東西;被問到會不會害怕,他說希望在於人類真的能大量投入資源解決對齊問題。
他用天擇只優化「基因在下一代出現的頻率」卻意外產出完全不會想著基因頻率的人類為例,說明訓練時設定的損失函數,跟系統實際內部運作的東西可能完全對不上。
針對「AI 為什麼不留一小塊太陽系給人類」的提問,他回應大多數隨機指定的效用函數根本不會把人類納入最優解裡,而失控後的系統會落在哪裡也不一定有人類的位置。
他舉族群選擇的實驗為例:原本生物學家期待天擇會演化出「克制生育以免耗盡資源」的和諧結果,實際跑出來的卻是雌性幼體被殺,藉此說明優化過程常常不會走向人類原本期待的美好結局。
他認為一個心智不需要痛苦、快樂、驚奇這些東西也能運作得很好;如果系統被優化到只留下有用的部分,那個「會說『這是我』」的東西很可能就此消失。
他重提跟 Robin Hanson 那場關於 AI 能力會不會集中在單一系統的辯論,認為 GPT-4 已經證明 Hanson「能力會分散在很多專門系統」的說法不成立;對於 AGI 何時出現,他認為那從來不是單一清楚的時間點。
他認為最有可能讓大量人群認定 AI 有意識的,不是嚴謹的哲學論證,而是 AI 擁有一張討喜的臉、用影像跟人對話;他也談到已經有人相信聊天機器人具有意識,且人數只會越來越多。
他反省自己跟 Robin Hanson 那場辯論時,為了顯得比對方理性而選了偏保守的立場,結果現實走得比自己當初的預測還要極端;他認為關鍵是練習誠實記錄自己的預測、常常小聲說「糟了」並修正。
他坦言不知道該怎麼安慰要面對這種未來的年輕人;若真出現足夠強烈且方向正確的社會壓力,他認為該做的是關閉大型 GPU 叢集,把資源轉去用生物方法提升人類智力,而不是繼續在現有技術路線上衝刺。
被問到怕不怕死時他坦承會怕,並談到自己從小讀的科幻書讓他從沒把死亡當成生命意義的必要條件;對話最後回到「愛」與「這就是我要的」這種主觀認定,Lex 也在此向他致謝作結。