EP 1152020-08-142:10:05
回饋連接與推論式視覺
Dileep George
神經科學與 AI 研究者 Dileep George,談大腦的回饋連接如何撐起知覺,以及 GPT-3 缺了什麼。
Dileep George: Brain-Inspired AI | Lex Fridman Podcast #115在 YouTube 看 ↗
重點5 條
- 回饋連接比前饋更多:George 指出視覺皮質裡的回饋連接其實比前饋連接更多,大腦不斷把「世界模型」投射回輸入上,最後看到的畫面是投射的預期與實際感官輸入拼出來的最佳解釋,康尼薩三角這類錯覺就是這樣被「幻覺」出邊緣的。
- 遞迴皮質網路(RCN):他和團隊把這些神經科學線索做成 RCN,一個能由上而下控制、靠推論而非單純前向傳播運作的生成模型,不是用反向傳播訓練;曾用少量訓練資料破解文字型驗證碼,也在 MNIST 上做過「訓練資料遠少於測試資料」的反向實驗。
- 腦啟發常被過度炒作,但他不當行銷詞:RCN 論文發表在《科學》期刊,內容是機率圖模型,期刊自己的新聞稿卻寫成「新的深度學習模型破解驗證碼」;他認為外界的懷疑多半是社群一窩蜂的效應,跟他自己鑽研生物細節的態度是兩回事。
- GPT-3 很有意思,但沒有世界模型:George 覺得 GPT 系列生成長距離連貫文字的能力很有意思,但它沒辦法在腦中模擬情境去驗證一件事是否成立;他也不認為單靠把模型做更大就能補上常識,因為很多日常道理(像是往前走比往後走容易、醫生會穿內衣)根本沒人寫進文字裡。
- 公司名 Vicarious 的由來,也牽出意識與死亡的話題:Vicarious 這個名字源自「替外界建模、不必實際行動就能推演」;他認為把同一套機制轉回自己身上,大概就是意識的由來(Lex 認為那比較像自我覺察)。談到死亡,他認為人類因此而生的急迫感不必套用在 AI 上,因為 AI 可以被複製,人卻沒辦法複製連同經驗與記憶。
時間軸27 段
Lex 問是否得先理解大腦才能打造它;George 說沒有功能層次的理論就直接堆神經元細節(像 Blue Brain 計畫那樣),結果不符預期時也無從除錯。他打個比方:就算把單一電晶體模擬得再準,不懂布林邏輯也拼不出能跑的微處理器。Lex 提到〈神經科學家能不能看懂微處理器〉那篇論文,認為神經科學的工具連邏輯閘都推不出;George 說沒那麼糟,神經科學確實找到很多有用的東西,只是得有人把它們放進計算框架裡拼起來。
George 提醒時間表很難預測:1900 年《紐約時報》有篇文章說人類可能再一百年都飛不起來,三年後萊特兄弟就飛了(Lex 補充,其中一位萊特兄弟在實驗期間也一度認為不可能)。他理解大腦的做法是:從神經科學找線索,做出真的能完成任務的功能模型,靠模型補上缺的部分,再回頭指導新的實驗,一直循環。
George 指出視覺皮質的回饋連接其實比前饋連接更多,神經科學已經很系統化地探測過每一層的作用;他舉例,大腦形成「圖形與背景」的知覺時,是先收斂在邊緣,再把內部填滿。
以康尼薩三角(只畫出三個類似小精靈的角)為例:視覺系統會自己「幻覺」出邊,而且這個訊號比真正輸入的邊緣還晚出現,說明那段延遲來自回饋連接,不是直接來自輸入本身。
大腦一直在替世界建模,並把預期投射回感官輸入上;最後的知覺不是算出差異,而是「對這個輸入最好的解釋」,這個來回的過程就是推論。
George 講「解釋消除」(explaining away):家裡警報器可能因闖空門或地震觸發,一旦聽到地震新聞,闖空門的嫌疑就會下降;他認為大腦處理多個互相競爭的假說時,用的是類似的機制。
他分享正在準備的新論文:假設每根皮質柱代表一個概念(像是否有邊、是否有物體這類二元變數),柱與柱之間的連接編碼概念之間的關係,再跟丘腦一起完成推論運算;他強調這仍是假說,但神經科學已經做過對應的探測實驗。
George 退一步解釋:他們把神經科學的線索綜合成一個計算模型,稱為遞迴皮質網路(Recursive Cortical Network,RCN)——不只是用來分類的前饋模型,而是一個由上而下可控制的生成模型,就像閉上眼也能想像瓶蓋長什麼樣子;RCN 把物體的前景與背景、形狀與紋理分開建模,他認為這些拆分能從自然訊號的連續性這類更底層的性質推導出來。Lex 提到 François Chollet 為 ARC 挑戰定義的先驗知識,George 說這些先驗不好編碼,像補完康尼薩三角這種看似抽象推理的題目,其實純粹是視覺系統在做。
卷積神經網路是前饋的特徵偵測加上池化;RCN 在同樣的前饋路徑上加了能反向跑的生成能力,還多了側向連接維持相鄰區域轉換的一致性,整套模型不是用反向傳播訓練的。
George 解釋驗證碼設計的用意就是讓人類容易解、電腦難解;RCN 靠推論而非單純的前向傳播,解決字元被擠在一起、局部看起來像別的字母的狀況(例如 r 和 n 擠在一起會像 m)。當年 2014 年前後流行的文字驗證碼就是這樣破解的;不過他說這只是攻破了防線,不算用人類的方式解決了驗證碼。
George 認為驗證碼至今仍是理解人類知覺的好題目:剛學會字母的五歲小孩,看到沒見過的驗證碼也解得出來,現在的深度學習還做不到;他引用 Douglas Hofstadter 的話,AI 的核心問題是「字母 A 是什麼」。
類神經網路要在所有組合上硬練,看起來才像會推論,其實只是「攤銷推論」;RCN 要的是執行當下才做的動態推論。
他們也把 MNIST 反過來做——訓練資料遠比測試資料少,結果只要幾十到幾百筆訓練範例就能衝到 95% 準確率,比當時其他系統好。Lex 說驗證碼很少出現在論文裡,George 同意,說一旦某個基準成了標準,研究生與學術體制就會推著大家一直追它。
Lex 問起外界對腦啟發 AI 的懷疑;George 提到 RCN 論文發表在《科學》期刊,內容講的是機率圖模型、不是深度學習,結果期刊自己的新聞稿卻寫成「新的深度學習模型破解驗證碼」——他藉這個故事說明媒體與社群的炒作邏輯,常常跟論文本身在講什麼是兩回事。
George 認為卷積神經網路的權重共享是很好的工程技巧,但大腦其實沒有平移不變性——大腦有中央小凹,中央和周邊的權重並不相同;他認為腦啟發是重要的輸入,但要懂原理才知道什麼時候該偏離它。
回顧約十年前在 Numenta 與 Jeff Hawkins 共事的時期,兩人的分歧在於學習演算法該多受限於當時已知的生物合理性;他不想因為還不完全了解大腦的生物物理機制,就提前把某種學習演算法排除掉,也認為大腦在辨識端做實驗比較容易,在學習端則還很難確定。
他們發表過一篇談「認知程式」的論文,處理機器人操作任務,重點是不靠語言、純粹從視覺與動作經驗學到可操作的概念;Lex 問他是不是不同意 Chomsky 把語言放在一切的最底層,他說完全不同意,從普遍語法開始都不同意。
George 舉一個他常用的例子:「Sally 把釘子釘在天花板上,釘子是水平還是垂直?」回答這種問題要在腦中模擬整個畫面;他認為這類知識存在視覺與動作系統裡,從五歲前的日常經驗累積出來,不是靠讀文字學來的,語言比較像是驅動這套模擬的控制介面。
談到 GPT-3,George 說自己還沒親自測過,但看到的例子讓他覺得很有意思;他指出 GPT-2、GPT-3 都可能寫出前後矛盾的句子(例如「爬上山去到山谷」),是因為它們沒有世界模型,無法在腦中跑模擬去驗證一件事是否成立;他也不認為單靠把模型做更大就能生出真正的常識,因為很多日常道理根本沒人寫進文字裡。
Lex 主動退一步,說自己在打一點魔鬼代言人:AlphaZero 的自我對弈、強化學習本身能運作、類神經網路本身能運作,都曾讓人意外,他好奇智能的核心是不是其實沒有想像中那麼玄。George 回說,說到底仍是連結加上在上面傳遞的訊息;Lex 則認為回饋機制看起來是根本。
George 認為大腦需要兩種記憶:一種是世界的統計規律,另一種是只發生過一次的個人經驗;他的假設是海馬迴儲存的是一連串事件的時間索引,要重新取用某段記憶時要靠皮質把它重新「播放」出來,而那段記憶又會反過來影響接下來看到的東西。
George 提到自己在史丹佛念書時,正是因為一場腦機介面的演講才對大腦產生興趣;他認為義肢這類應用很有價值。植入上百萬個電極,他認為非常難,因為沒人知道大腦會怎麼適應;Lex 認為最難的是安全,George 同意,說生物學常常過了很久才發現原本的做法是錯的(他舉以前切除胸腺為例)。至於是先破解大腦的通訊協定,還是讓大腦自己去適應,他覺得後者比較有希望:像設計滑鼠鍵盤一樣,讓電極接上一段原本沒被使用的腦區,由大腦自己學會用那段電路做高頻寬溝通。
George 解釋公司名 Vicarious 的由來:先是替外在世界與別人建模,讓自己不用真的行動就能在腦中推演;他認為把同一套建模機制轉回頭用在自己身上,就是意識的由來。Lex 回說那比較像自我覺察,意識難題是「身為它感覺起來像什麼」。
George 認為人類特有的、由死亡驅動的急迫感,沒有理由套用在人工系統上,因為 AI 可以被複製;人沒辦法複製一個人連同他所有的經驗與記憶,他認為這是人跟 AI 系統不同的地方。也因此他不太擔心 AI 會想殺光人類:它等著就好,何必動手。
George 推薦 Judea Pearl 的《Probabilistic Reasoning in Intelligent Systems》,喜歡書裡穿插的哲學觀察;也推薦 Douglas Hofstadter 與 Daniel Dennett 兩人一起寫的《The Mind's I》;第三本是一本講萊特兄弟的歷史書(他自己也不確定書名),說明「發明飛行」當年曾被許多人視為不可能的任務。他還說,「飛機不用拍翅膀」這件事,萊特兄弟正是觀察鳥才發現的:筆記本裡記著禿鷹(buzzard)乘著上升氣流滑翔,於是認定該先解決的是控制,推進自然會跟上。
他建議:想從工程角度理解、打造大腦的人,走電機工程或資工可能比走實驗神經科學更合適,神經科學可以自己補;單純被大腦本身吸引、想做實驗的人,走實驗神經科學才合適。他也提到十年前一場研討會的座談中,多數人認為想懂大腦該念的大學主修其實是電機工程。
面對「生命的意義是什麼」,George 的答案是完全開放,是你自己建構出來的;我們真正該努力理解的是世界運作的機制,剩下的就看你想做什麼,或當下文化流行什麼。