EP 752020-02-261:39:55
AIXI:不可計算的完美智能
Marcus Hutter
AIXI 是一套不可計算的數學模型,把智能定義成壓縮資訊加長期規劃,這集也談 reward 怎麼設計、探索與意識的難題。
Marcus Hutter: Universal Artificial Intelligence, AIXI, and AGI | Lex Fridman Podcast #75在 YouTube 看 ↗
重點6 條
- 智能可以下定義:Hutter 與 Shane Legg 提出的非正式版本是「智能衡量的是 agent 在廣泛環境中表現優良的能力」,背後有一套數學理論;他認為創造力、規劃、記憶都只是這個定義下自然浮現的特質,不必另外寫進定義裡。
- AIXI 結合壓縮與長期規劃:AIXI 用 Solomonoff 歸納法找出能重現過去經驗的最短程式來預測未來,再用類似西洋棋 minimax、但改成算期望值的「expectimax」展開未來,選出長期報酬總和最大的行動;問題是它不可計算,需要無限運算資源。
- 他相信宇宙本質上是簡單的:他認為 Occam's razor 大概是科學最重要的原則;他很確定宇宙本身就是簡潔優雅的,這是客觀上的簡單,不是人類只挑簡單的部分看。
- 探索是內建的,不用額外調參數:貝氏學習加上長期規劃這兩件事放在一起,就會自動導出探索行為;在兩種醫療處置擇一這類簡單的 bandit 問題上,可以證明探索的分量恰到好處,放到 AIXI 上則只證得出漸進的結果。
- reward 給錯就會出事:他舉電梯控制的例子,說明就算是看起來簡單的任務,reward 設計不好一樣會被鑽漏洞;面向人類的通用 agent,他認為 reward 該由人類即時給,像訓練小孩一樣,但 agent 一旦到了人類的水準就會變得棘手,就像孩子長大後獎懲不再那麼管用。
- AIXI 給的是一個理論上限,不是能用的系統:他形容 AIXI 像物理學把能量、速度等概念形式化一樣,本身「不可能真的造出來」,但可以當成評估與啟發實際系統設計的參照點;他自己開發的近似版本能玩撲克、井字棋與小精靈。
時間軸24 段
他認為物理定律簡潔到能描述幾乎一切,強烈顯示宇宙是可計算的;他很確定宇宙本身就是簡單的,不是人類挑著看;他也說 Occam's razor 大概是科學最重要的原則,並用演化論解釋人類為什麼特別偏好簡單的解釋——會辨認規律的祖先比較容易存活。
面對一串資料時,應該找出能重現這串資料的最短程式,再讓它繼續跑下去做預測;他強調歸納其實包含用學到的模型做預測,也能處理帶雜訊的資料,像是估計一枚不公正硬幣出現正面的機率。
Kolmogorov 複雜度是能重現一筆資料的最短「自解壓縮程式」長度,資料越規律就越能壓縮、複雜度越低;他用「收錄所有可能書籍的圖書館」比喻,圖書館整體資訊量趨近於零,但從中挑出的某一本書、或像地球這樣的局部片段,複雜度反而可能很高。
他認為 Conway 的生命遊戲是簡單規則生出豐富現象的最佳例子——規則簡單到能教給小孩,卻被證明具備圖靈完備性;他也提到年輕時用組合語言畫 Mandelbrot 集,後來靠解高階多項式推算碎形裡圖案的位置與大小,才慢慢理解複雜性是怎麼冒出來的。
他與 Shane Legg 提出的定義是智能衡量 agent 在廣泛環境中表現優良的能力,創造力、規劃、記憶都是這個定義下自然湧現的特質。談到 Turing test,他認為測試本身沒大家說的那麼糟,缺點是沒辦法指引該怎麼打造系統,他也提到 NLP 領域已經用 perplexity(壓縮長度)替系統排名,不完美,但當作中間目標夠用。
AIXI 的名字來自 AI 加上 Solomonoff 分布常用的希臘字母 Xi;他分享一段巧合,多年前在巴塞隆納一座教堂看到石刻的加泰隆尼亞語「AIXI」,意思接近「這就是對的事」,讓他又驚又喜。
AIXI 由學習/預測與規劃兩部分組成:預測用 Solomonoff 歸納法找出能重現過去經驗的最短程式,可以嚴格證明它對任何預測任務都幾乎是最好的預測器,而且收斂得很快;問題是它不可計算,就算有 Google 的資源也沒辦法直接拿來預測股市致富。
把行動加進來後,agent 依照完整的「觀察加行動」歷史(不是只看上一步)預測下一步;他接著說明 AIXI 用 reward 訊號衡量表現,並用類似西洋棋 minimax、但改算期望值的 expectimax 展開整個未來,選出長期報酬總和最大的行動。
讓規劃視界趨近無限,數學會失效(無限的 reward 總和沒辦法比較好壞),也會讓 agent 覺得反正有的是時間、先偷懶再說;標準的幾何折扣會帶來固定的有效視界,總有問題需要看得更遠,他因此提出「近調和折扣」,讓有效視界隨 agent 年齡等比例增加;而固定視界證明不了漸進結果,改用折扣才證得出來。
他說自己在物理與 AGI 之間搖擺過,笑稱如果只能解一個問題他會選 AGI,因為解出 AGI 之後可以叫它去解其他所有問題;他認為 AIXI 的價值在於提供一個完整、可以分析的「黃金標準」,就像物理學把能量、速度等概念形式化一樣,即使它本身無法真的造出來。
一般強化學習常做 Markov 假設(只看上一個狀態)與遍歷性假設(永遠能從錯誤中恢復),他認為真實世界不是遍歷的——像開車不專心一秒可能就毀掉一生,沒有回頭路。探索不需要額外設計,貝氏學習加長期規劃放在一起就會自動產生探索,在簡單的 bandit 問題上可以證明分量恰到好處;他也提到儲存完整歷史本身不是問題,真正難的是怎麼挑出重要片段拿來規劃。
簡單任務(下棋)reward 很好給,贏 +1、輸 -1;但他舉電梯控制的例子:reward 只看大廳等待時間,電梯會拼命接人卻不送達,把電梯內的時間也加進去一起最小化,又會不去頂樓載那些不划算的人——連看似簡單的任務都可能被鑽漏洞。
如果目標是打造對人類有廣泛用途的 agent(例如家用機器人),他認為 reward 該由人類即時給,做不好懲罰、做好稱讚,類似訓練小孩;但他提醒,一旦這類 agent 到了人類的水準就會變得棘手,就像孩子長大後,獎懲就不再那麼管用。
想打造完全不靠人類介入的自主 agent,DeepMind 的 Laurent Orseau 把 reward 改成跟「學到多少新資訊」成正比,可以定義出一個天生好奇、追求資訊增益的「最優科學家」agent;早期版本會卡在電視雜訊前不斷「學習」,後來的版本能處理這種隨機性。Lex 把好奇心定義成為了探索而探索,他接受這個說法,但認為人類(尤其小孩)的好奇心多半不只是為了探索本身,終究是為了學到東西、表現得更好。
被問到人類的 reward function 是什麼,他認為生物層面就是生存與繁衍,但人類有餘裕之後發展出各式各樣其他興趣;Lex 說他迴避了第二個問題,他才回答自己的 reward function 是找出 AGI 並把它造出來。
AIXI 常被批評忽略計算資源,有些人認為智能本質上就該跟資源限制綁在一起;他認為先把智能定義清楚(不考慮算力)本身就很有用,之後再想辦法把算力考慮進去會更有用,只是目前沒人真的做到。他打趣說,如果 AI 是放在哲學系而不是資訊系,大家大概就不會這麼在意算力。
他們把不可計算的 Solomonoff 歸納換成 context tree weighting 這種實際的資料壓縮器來做預測,規劃部分則借用 Monte Carlo tree search 上的 UCT 演算法,用抽樣取代窮舉;這套近似版 agent 完全不知道遊戲規則,卻能靠同一套架構學會撲克、井字棋,甚至小精靈。
Gödel machine 是 Jürgen Schmidhuber(Hutter 待過其實驗室)提出的構想:給它一個任務,它會一邊執行、一邊嘗試改寫自己的程式,只有能證明新版本仍符合原本規格時才會替換;如果把可計算近似版的 AIXI 當起始程式放進去,理論上能不斷這樣改良下去,但沒辦法保證真的會變快。
被問到人類是不是 AIXI agent 的一種實例,他說這大概只適用於最聰明、最理性的人,而且可能也只是很粗糙的近似版本。他認為不需要先解開意識的難題也能推進 AGI——只要系統的行為讓人覺得像有意識,人就會把意識歸給它,就像小孩對電子雞投入感情、不想讓它死掉,真要問他們電子雞有沒有意識,大概會說有;但這不代表真的回答了它是不是「哲學殭屍」的問題。
他認為 AI 研究歷經幾次寒冬、期望落空,讓大家轉向能立刻證明有用、拿得到資金的窄領域應用;就算在大學裡,純理論研究也越來越難申請到經費,形式化的通用智能研究因此一直是小圈子。
他不認為 AGI 一定要有實體機器人的身體,覺得那大概反而是種干擾,混淆了身體跟心智;他比較看好讓 agent 在虛擬環境裡互動學習,模擬的 3D 世界對需要跟人類互動的 agent 可能有幫助,但如果是只做抽象推理、證明定理的 agent,放進 3D 環境說不定反而有害。
他推薦 Russell 與 Norvig 的《Artificial Intelligence: A Modern Approach》當入門聖經;Sutton 與 Barto 的強化學習教科書很好讀,但他提醒書會讓 RL 看起來比實際簡單;他個人最愛的一本,是給國際文憑高中生讀的哲學書《Theory of Knowledge》,探討怎麼從各種角度取得知識。
被問到最想重活一次的一天,他選了發現 Kolmogorov 複雜度概念的那一刻:他當時在一間公司做影像內插技術,想找「最好的內插方式」,想著想著意識到答案應該是壓縮後最簡單的圖片,才驚覺這跟循序決策理論放在一起,就是後來 AIXI 的核心想法。
節目最後問他想重來哪一天,他說想選未來某一天:理論上 AIXI 已經解出來了,他要的是把 AGI 真的做出來的那一天;接著他說,第一件想問這個 AGI 的問題,會是「生命的意義是什麼」。