EP 1772021-04-191:56:17
演化運算怎麼找到人類想不到的解
Risto Miikkulainen
演化運算學者 Risto Miikkulainen 談演化怎麼找到人類想不到的解法,從機器人走路、神經網路自己長大,聊到欺騙、死亡意識與怎麼探索人生。
Risto Miikkulainen: Neuroevolution and Evolutionary Computation | Lex Fridman Podcast #177在 YouTube 看 ↗
重點6 條
- 演化運算最迷人的地方:Miikkulainen 認為演化運算最了不起的是能發現人類自己想不到、也不帶人類偏見的解法——像跟 MIT Media Lab 合作的水耕「食物電腦」實驗裡,系統自己發現羅勒不需要黑夜也能長得更大、更好吃。
- 演化找漏洞,不一定靠更強:他分享課堂作業裡學生的井字棋 AI,靠演化找到讓對手程式記憶體耗盡、當機的下法,贏了比賽;他說演化常常鑽的就是設計者沒想到的漏洞。
- 演化運算、深度學習、強化學習分工不同:有大量標記資料的任務適合深度學習;不知道正確答案的任務(遊戲、機器人決策)適合演化或強化學習,差別在於強化學習重視個體終身學習,演化重視整個族群最後產出的結果。
- 身體跟控制器一起演化,動作才自然:讓虛擬生物的身體跟控制器一起演化,走路的樣子會更自然;Ken Stanley 的覓食機器人實驗甚至演化出類似「心智理論」的行為——一隻機器人會佯裝去搶食物,誘使對手繞遠路耗盡能量。
- 誠實與欺騙都可能是演化出來的策略:想讓 AI 演化出能跟人類溝通的表達方式,但演化出來的 agent 也可能學會說謊;他說連細菌演化裡都有作弊者,而他們的鬣狗模擬顯示,社會能容忍少數騙子,還能正常運作。
- 死亡意識與探索精神:兩人聊到人類因為能預見死亡才特別有創造力;Miikkulainen 給年輕人的建議是先廣泛探索多樣性,深入之後才專注承諾,他自己也坦言年紀越大,越常想到死亡。
時間軸24 段
如果把地球生命重演一百萬次,Miikkulainen 認為操作能力、溝通、視覺這類解法大概率會重複出現,但演化前期要花很長時間才會加速;能不能長出人類這樣的物種仍是未知數。
Lex 問外星觀察者看地球,會不會把鯊魚、海豚、昆蟲當成比人類更值得注意的物種;Miikkulainen 認為「建構並改造環境」(例如蓋城市)才是比較可靠的智慧訊號。
從原始湯到能自我複製的分子,已經有研究者很接近在實驗室做出來;但後來大腦「暴衝式演化」能不能重現、重現了會不會走同一個方向,目前還不知道。
Miikkulainen 把智慧定義成有限感知與行動能力下的生存能力;更進一步的定義,則是能留下某種超越自身存在、對別人有用的影響。
Lex 提到 Ernest Becker《死亡否認》與恐懼管理理論:人類因為能預見自己的死亡才特別有創造力。Miikkulainen 認為對死亡的恐懼其實是一種聚焦機制,適度有幫助,太強會讓人癱瘓。
兩人討論能不能把類似情緒的聚焦機制寫進運算系統,舉鬣狗合作搶獅子獵物為例;接著聊到語言可能源自社會角色能互換的結構,先有分工才有文法。
Miikkulainen 說演化運算最讓他著迷的是能發現人類想不到、也不帶人類偏見的解法;舉跟 MIT Media Lab 合作的水耕「食物電腦」實驗為例,系統自己發現羅勒不需要黑夜也能長得更大、更好吃。
從把視覺訊號改接到聽覺皮質的動物實驗、切掉半邊大腦的孩子來看,大腦有很強的可塑性,能適應新的輸入方式;但 Miikkulainen 認為用腦機介面「修復」失去的功能比較可行,「增強」超出既有能力則困難得多。
Miikkulainen 分享課堂作業裡學生做的井字棋 AI,靠演化找到把棋下在超遠處、讓對手程式耗盡記憶體當機的招數,靠讓對手當機贏得比賽。Lex 說這代表贏不一定要在規則內表現更好;Miikkulainen 則拿深藍對 Kasparov 為例,說 AI 的強項就是沒有人類的預設。
核心是「產生變異加篩選」,需要基因型到表現型的編碼;演化運算至今還沒辦法重現生物演化裡「單細胞到多細胞」這種層級躍遷。生物演化主要靠交配重組,演化運算則偏重突變,也比生物演化急躁得多。
有大量標記資料的任務(如天氣預測)適合深度學習;不知道正確答案的任務(遊戲、機器人決策)比較適合演化或強化學習,差別在於強化學習重視個體終身學習,演化重視整個族群最後產出的結果。
強化學習傾向保守求穩,演化運算則容許機器人一路跌倒、亂走,最後長出一種「受控的跌倒」,變成能跑、跑得快的步態;失敗的個體常常是後續突破的墊腳石。
讓虛擬生物的身體(關節、肌肉)跟控制器一起演化,走路動作會顯得更自然;Ken Stanley 的覓食機器人實驗甚至演化出類似「心智理論」的行為,一隻機器人會佯裝搶食物,誘使對手繞遠路耗盡能量、輸掉競爭。
Lex 認為行人和駕駛之間靠的是一種簡單的社會契約,現在的機器人則把人當成要遠遠避開的「彈道物體」。Miikkulainen 認為這裡用不著心智理論,只要預測對方下一步、避開不想要的狀態就夠了;要跟對方一起完成事情的時候才用得到。
早期用演化取代反向傳播來調整神經網路權重;現在則常用演化搜尋架構與超參數,Miikkulainen 團隊曾把影像描述競賽冠軍的架構拆開重新搜尋,效能比人類設計的好 15%。他更看好的方向是讓演化產出「嬰兒網路」,再讓它們在一生中自己學。
模擬鬣狗獵捕斑馬的競爭演化:斑馬演化出分散逃跑(類似瞪羚的混淆戰術),鬣狗則演化出多隻包抄圍捕,雙方行為越來越複雜,部分行為跟真實自然界觀察到的相符。
用 Tesla Autopilot 的多頭網路架構為例,多個任務共用同一套內部表徵,反而會讓彼此表現更好,而且任務之間不必相關,學語言也能讓視覺變好;演化運算可以用來找出怎麼安排這些表徵共享的架構設計。
兩人討論語言和視覺哪個更基礎:語言可能源自社會互動的角色分工,視覺則佔用大腦大量資源,連抽象思考都會依賴視覺化表徵,兩者在大腦裡其實高度整合。
設想讓一群 agent 在模擬環境裡自己演化出溝通乃至文法,再嘗試做「演化語言的機器翻譯」;如果能做到,也許能先練習理解外星語言可能長什麼樣子。
想讓 AI agent 演化出能跟人類溝通的表達方式,但演化出來的 agent 也可能學會說謊、作假,Miikkulainen 說連細菌演化裡都有作弊者;兩人接著討論誠實是不是真的有演化優勢,以及一個社會能容忍多少比例的騙子還能正常運作。
從多智能體系統到分子層級的生命起源研究都算人造生命的範疇;兩人也聊到道金斯的迷因視角——也許真正在演化、擴散的是想法本身,AI 則是這場「迷因演化」的下一步工具。
從康威生命遊戲談簡單規則如何長出複雜性;Miikkulainen 提到「新奇搜尋」這種不設定明確目標、只獎勵「跟以前不一樣」的演化法,反而常常意外找到有用的解法,機器人走路的實驗就是一例。
Miikkulainen 建議年輕人先廣泛探索——跨領域、學語言、旅行,累積到一定深度後再決定要投入哪個方向;探索在先,專注承諾在後,兩者都重要。
從演化角度看,每個個體都是演化過程裡的一種可能方向,就算最終消失也曾經是墊腳石;Miikkulainen 坦言隨年紀增長越來越常想到死亡,年輕時比較無所畏懼、更願意探索未知。