EP 2222021-09-202:31:57
Jay McClelland 談神經網路如何長出認知
Jay McClelland
認知科學家 Jay McClelland 回顧他與 Rumelhart、Hinton 一起發展類神經網路與反向傳播的往事,也談數學裡的直覺、專家的盲點,以及人生意義從哪裡來。
Jay McClelland: Neural Networks and the Emergence of Cognition | Lex Fridman Podcast #222在 YouTube 看 ↗
重點6 條
- 神經網路是連結生物與心智的橋樑:McClelland 說,從念研究所開始他就不相信認知能脫離神經系統獨立存在,神經網路正是讓生物基礎與抽象思考接上線的方式。
- UCSD 的黃金年代:PDP 三人組:McClelland 1974 年到加州大學聖地牙哥分校任教,結識 David Rumelhart;Geoffrey Hinton 隨後加入,三人在 1980 年代合寫出《平行分散處理》(PDP)系列著作,奠定了聯結主義的基礎。
- 反向傳播是 1982 年一次休假聊出來的:Hinton 回 UCSD 休假時提醒大家,與其從生物學找靈感,不如直接設定目標函數、用梯度下降調整連接權重——Rumelhart 聽了之後把單層的 Delta Rule 推廣到多層網路,就是反向傳播。
- 語義失智症奪走了 Rumelhart,也印證了他自己的理論:Rumelhart 晚年罹患語義失智症,逐漸失去辨認詞語與概念的能力,McClelland 說這種漸進式退化剛好呼應了分散式表徵理論裡「相似概念先互相混淆」的預測。
- 「聯結主義」不等於「什麼都不存在」:McClelland 自稱「激進湧現論的聯結主義者」而非「消除論者」——網路裡確實沒有寫死的符號或字典,但湧現出來的高層概念(比如理解)依然是真實的。
- 選研究題目也在跟死線賽跑:他坦言轉去做數學認知研究,是因為算過自己大概還有十來年可以做有意義的工作,想留給自己一個更難、更值得的問題。
時間軸26 段
McClelland 從笛卡兒的身心二元論破題:笛卡兒認為身體是機械,思想卻需要額外的東西才能解釋,而他從念研究所起就不相信認知可以脫離神經系統獨立存在。
他把自己對神經網路的信念類比達爾文的演化論:達爾文想通複雜的眼睛能無方向地演化出來,卻因此做惡夢、遲遲不敢發表。他也提到 Chomsky 認為語言源自一次「基因僥倖」的突變,演化其實是長期停滯、偶爾跳躍的「間斷平衡」。
話題轉回他自己與 Hinton 的交往:1970 年代中期他到 UCSD 任教,正好遇上 David Rumelhart 剛與 Don Norman 合寫《探索認知》一書,那種集體摸索的氣氛讓他很興奮。
聽了工程師 James Anderson 用線性代數做出的神經網路演講後,他形容自己走在校園裡「像保羅在往大馬士革的路上」頓悟:用神經網路的方式想心智,或許就能回答他一直想問的問題。
他描述 David Rumelhart 出身南達科他州小鎮,母親是圖書館員、父親是報社編輯,從小被父親鼓勵跟兄弟競爭;後來主修數學,申請進史丹佛的數理心理學博士班,1967 年成為 UCSD 心理系最早的助理教授之一。
用 Rumelhart 愛舉的例句「瑪吉聽到熟悉的冰淇淋車鈴聲,想起生日錢,跑回家」說明理解一句話要做多少推論;Rumelhart 當時想用舊式 AI 的形式邏輯與知識庫去建構這種理解,但一直卡關。
Rumelhart 發現舊式 AI 走不通後,寫了一篇〈互動式閱讀模型〉論文,主張像素、字母、單字、語意每個層次都同時互相影響、雙向更新假設。McClelland 說他們後來把這套「專家」概念換成真正的神經元單元,做出「互動激發模型」,用連接權重取代寫死的規則。
他解釋聯結主義的核心:知識就藏在連接裡,沒有另外一本字典。就像 CNN 認得出貓和狗,卻說不出為什麼——那個判斷只存在於一層層權重裡,沒有辦法讀出來變成一組命題。
他不再用「消除論聯結主義者」自稱,改稱自己是「激進湧現論聯結主義者」:借用 Douglas Hofstadter 沙丘的比喻,沙丘會流動變形,但那不代表沙丘不存在——高層概念也是這樣從底層元素湧現出來的真實存在。
McClelland 說 Rumelhart 大約在十五年前過世,死因是一種當時還沒完全弄懂的漸進性神經退化症,家屬選擇不做大體解剖,所以病理機轉至今仍不清楚。
他把 Rumelhart 比作認知科學界的霍金:霍金的退化影響運動系統,Rumelhart 的退化則侵蝕語意。他回憶帶 Rumelhart 去打保齡球、吃飯,對方已經說不出想點什麼餐,卻還能用手指出菜單上的位置——能力不是整塊消失,而是一部分一部分脫落。
1982 年 Hinton 回 UCSD 休假,和 Rumelhart、McClelland 一起成立 PDP 研究小組,連 Francis Crick 都慕名加入。Hinton 提醒大家:與其從生物學找靈感決定突觸怎麼變,不如直接設定要解決的問題,再算怎麼調整連接權重去解它。
Rumelhart 把原本只能用在單層網路的 Delta Rule(源自史丹佛電機系教授 Bernard Widrow 與 Hoff 的成果)推廣到有隱藏層的多層網路,做法是把輸出層的誤差訊號一路往回推給隱藏層,因此得名「反向傳播」。Hinton 自己當時其實更看好另一套「波茲曼機」演算法,後來才發現反向傳播效果更好。
McClelland 說 Hinton 有好幾篇領先時代的文章:其中一篇約 1981 年的作品裡已經有後來 Transformer 的雛形,另一篇談語意認知的論文則影響了他們一整個 1980 年代的思考;還有一篇 1977 年未發表的手稿,構想神經網路怎麼用快速改變的連接權重存下呼叫副程式前的狀態,做到遞迴運算。
他形容 Hinton 開會不太上黑板寫方程式,而是用手比出山谷的形狀,把梯度下降解釋成沿著山谷往下走——步伐跨太大就會跳到對面,所以才需要調低學習率。McClelland 也提到 Hinton 是邏輯學家 George Boole 的後代,出身英國學術世家。
他說自己開始用「計算智能」一詞形容 Hinton 與 DeepMind 那群人在做的事,而他自己更像「人類取向的計算智能研究者」——關心的是人腦這一種特定的解法,而不只是靠規模硬堆出智慧。
他引用 Tristan Needham 的說法:把數學簡化成符號操作,就像只教樂理卻從沒讓人聽過一個音符。數學是一整套探索理想化世界的工具——三角形、整數本身不存在於現實,卻能讓人精準蓋橋、算羊群數量、把探測器送到冥王星外的小天體上。他也引用數學家 Henri Poincaré 的話總結直覺在數學發現裡的角色,並拿西洋棋與圍棋 AI 下出的神來一手當例子,說明「直覺」在深度學習系統裡也可能開始出現。
他把「學會用形式邏輯思考」類比成學語言:歐幾里得的《幾何原本》是第一份把推論系統整理清楚的文獻,而後來的人能用那套方式思考,靠的是長期浸泡在雅典、亞歷山卓那些學院文化裡養成的習慣,不是與生俱來的天賦。
他提到 Lila Gleitman 的博士論文發現,受過形式訓練的語言學家對一個句子「該是什麼意思」的直覺,跟一般人的直覺其實很不一樣;他也提到 Chomsky 出身拉比研究學院教授家庭,從小就浸泡在深究文本的家庭文化裡。
他借數學家 Kronecker「上帝創造了自然數,其餘都是人造的」這句話說明:曾有一整代認知科學家相信自然數是與生俱來的核心知識,但現在大多數人已經接受自然數其實是文化建構出來的產物。
被問到給年輕人的建議,他回顧自己在哥倫比亞大學讀書時本來想念醫學院當精神科醫師,卻因為 1968 年校園因越戰與種族議題爆發的學運,才轉而對「人為什麼會做出這些選擇」產生興趣,一路走進心理學。他強調重點是找到會讓自己「內在有動機」投入的事,然後花時間讓它扎根。
他坦承年輕時對精神醫學的想像來自 Freud 與 Erich Fromm 那種比較人文的路線,後來發現精神醫學越來越偏藥物與生物化學,讓他失望。他也提到自己曾任美國國家心理衛生研究院的諮詢委員,見證新任院長把思覺失調症定位成純生物疾病,承諾像治癌症一樣攻克它,二十年後回頭看,那條路並沒有真正解決問題。
他說自己比較怕的不是死亡,是退化——看過 Rumelhart 的例子讓他很清楚那是什麼滋味。他也提到自己大概是抱著「還有十到十五年」的心態,才決定轉去做更難的數學認知研究,而不是繼續做能讓他很快拿到明確答案的舒適題目。
談到希望被記得的事,他說科學的樂趣在於一個人心裡還沒成形的想法,經過討論被磨得更清楚,變成具體研究成果的那個瞬間——他認為那正是 Rumelhart 聽到 Hinton 講梯度下降時發生的事。他也分享自己博士論文曾被期刊要求「把理論部分留給理論學家」,但他沒有因此放棄寫理論,提醒不要被別人貼的標籤定義自己。
面對「人活著是為了什麼」的大哉問,他認為意義不是被發現的,是每個人自己做出來的——宗教傳統也只是把這種造意義的衝動具體化的一種方式。
他說回到當年在 UCSD 遇見 Rumelhart 那個當下,本身就是一連串偶然湊在一起的脈絡;每個人都是細胞聚在一起形成的湧現過程,會替自己編故事,也會欣賞自己編的故事,一路把故事一層一層疊上去。對談最後兩人互相感謝,McClelland 說這次訪談讓他把過去沒完整表達過的想法說了出來。