← 回到天際線 思考機器第 25 層 / 102

EP 3332022-10-293:28:47

Karpathy 談軟體 2.0 與不用光達

Andrej Karpathy

剛離開 Tesla 的 Karpathy,談軟體如何被神經網路取代、為何不用光達,以及 AGI 要不要碰到物理世界。

Andrej Karpathy: Tesla AI, Self-Driving, Optimus, Aliens, and AGI | Lex Fridman Podcast #333在 YouTube 看 ↗

重點6 條

  1. AI 不只理解文字,還要碰物理世界:他解釋 Transformer 為何同時具備表達力、可優化性與硬體效率三個特質,讓它從翻譯任務一路吃下影像、語音與文字;但他認為純文字訓練出的語言模型未必足夠,AGI 可能需要靠視覺與實體世界的資料補上常識這塊拼圖。
  2. Software 2.0:用資料集取代手寫程式:他重提幾年前提出的概念——愈來愈多程式邏輯不再由工程師手寫,而是靠神經網路的權重在資料集上訓練出來;Autopilot 團隊把原本用 C++ 手刻的感知與融合邏輯,一步步搬進由神經網路直接輸出三維預測的架構。
  3. 拿掉雷達、超音波,也不採用光達,理由是成本結構:他把額外感測器視為要維護供應鏈、拖慢產線、稀釋團隊注意力的負債,而非單純的加分項;視覺既是人類唯一必需的感官,資訊量也夠,所以只要把資源全押在攝影機的資料引擎上就好。
  4. 離開 Tesla 是因為變成開會的人:他加入時電腦視覺團隊只有兩個人,五年間他把標註團隊從零拉到上千人,自己卻愈來愈像企業主管;他坦言這不是自己真正享受的事,想回頭做更貼近技術的工作,也不排除未來回來做 Optimus 或 AGI。
  5. Optimus 的價值不在動作優雅,而在共用資料引擎:他認為人形是物理世界的通用介面,Tesla 的優勢不是機器人走路多順,而是能把 Autopilot 的資料引擎、離線標註流程直接複製過去,再靠造車的量產能力把機器人做便宜。
  6. 生產力靠的是連續沉浸,不是一天的意志力:他形容自己是夜貓子,做出一小時教學影片背後要反覆重錄近十小時;他認為進步的關鍵是把一個問題連續「載入」腦中好幾天,而不是短暫衝刺,也只跟自己過去比較,不跟別人比。

時間軸24 段

01 00:50
開場:神經網路到底是什麼

他形容神經網路只是一串矩陣乘法加非線性函數,本身沒有太多神祕,真正驚人的是參數夠多、問題夠難時冒出的湧現行為;他也坦言不愛把神經網路類比成大腦,因為訓練它的最佳化過程跟演化完全不同。

02 08:11
生命起源與外星文明的費米悖論

他認為生命起源本身沒有想像中困難;被問到「細菌跳到複雜生物才是真正難關」的說法時,他也不認同,覺得那同樣未必難。既然條件不算苛刻,他判斷宇宙裡應該有不少文明,聽不到他們的原因更可能是星際旅行本身極度困難,而不是文明稀少。

03 21:49
宇宙是不是一場模擬,決定論與自由意志

他把宇宙想像成一套可能有漏洞的物理系統,就像強化學習的智能體會找到鑽規則漏洞的奇怪解法;他也承認自己對隨機性感到不安,傾向相信物理定律完全是決定論的,自由意志只是替選擇編出來的敘事。

04 33:43
Transformer 為何是優雅的通用計算機

他說 Transformer 同時做到表達力夠強、能用梯度下降優化、又能在 GPU 上高度平行運算三件事;殘差連接讓網路能先學會「短算法」再逐層加深,這套架構從 2016 年至今幾乎沒有大改。

05 41:54
語言模型是不是真的「理解」世界

他認為 GPT 為了把下一個詞猜對,等於同時在學化學、物理、人性等大量隱含任務,某種程度上確實是理解;但他懷疑純文字不足以撐起完整的 AGI,因為很多常識人類從來不會寫進文字裡。

06 47:10
World of Bits:讓 AI 操作鍵盤滑鼠

他回顧在 OpenAI 做的專案,讓神經網路直接看螢幕、用鍵盤滑鼠完成訂票之類的任務;2015 年從零開始用強化學習太沒效率,但他認為現在拿 GPT 當初始化,這條路值得重新走一次。

07 52:09
機器人身分驗證與 AI 陪伴的隱憂

他認為分辨帳號背後是人還是 AI 會變成一場攻防軍備競賽,社會可能得靠數位簽章之類的「人格證明」機制;他也擔心 AI 學到人類容易被戲劇化衝突吸引,進而變成專門帶風向、挑撥關係的存在。

08 1:05:33
Software 2.0:神經網路正在取代手寫程式

他重提自己多年前寫的概念——愈來愈多程式邏輯不是工程師手刻,而是靠資料集與目標函數訓練出神經網路權重;影像辨識從手工設計特徵一路演變到讓網路自己學特徵,就是這個轉型的縮影。

09 1:09:26
Autopilot 如何從 C++ 規則轉成純神經網路

他描述 Autopilot 最早由多顆小神經網路各自判斷單張影像,再靠大量 C++ 程式碼把八支攝影機的結果手動融合;後來團隊不再信任自己寫得出這套融合邏輯,改讓神經網路直接輸出車輛周圍的三維預測。

10 1:13:49
資料標註的三個關鍵:量、準與多樣

他說可用的資料集必須夠大、夠準確、夠多樣,光靠人工在三維空間標注車輛幾乎不可能做到精準;解法是讓電腦離線做三維重建,人類只負責在二維影像上標出「這是車、這是人」。

11 1:28:01
感測器與地圖的極簡主義

他把每一顆額外感測器視為要維護供應鏈、拖慢產線、稀釋團隊注意力的負債,而不是單純的加分項;LiDAR 之爭真正該問的是有沒有車隊持續收資料,高精地圖則是一種會拖垮團隊、需要不斷更新的拐杖。

12 1:34:22
跟 Elon 共事學到的事:對抗組織的熵

他說從 Elon 身上學到最多的是怎麼把組織的熵壓下去——砍會議、砍不必要的流程;要在公司做大之後還維持新創的速度,得有一個握有夠大權力、願意一直當這件事啦啦隊的人。

13 1:44:17
為什麼選擇離開 Tesla

他形容五年下來自己愈來愈像企業主管,大多數時間都在開會、做決策而不是寫程式;雖然很愛這家公司跟團隊,但覺得該回頭做更貼近技術的事,也不排除未來為了 Optimus 或 AGI 再回來。

14 1:49:55
Optimus:通用介面,而不是客製機器人

他認為人形是物理世界的通用介面,就像鍵盤滑鼠是數位世界的通用介面;比起為單一任務客製機器人,Tesla 的優勢是能直接複製 Autopilot 的資料引擎,再靠造車的量產經驗把機器人做便宜。

15 1:59:01
ImageNet 已經被打穿,學界缺下一個標竿資料集

他認為 ImageNet 曾經證明深度學習真的有效,貢獻很大,但錯誤率已經被壓到極低,變得像 MNIST 一樣只剩教學用途;問題是目前沒有一個新資料集能讓整個社群團結在同一個目標底下。

16 2:11:35
一天的生產力:夜貓子與十小時磨一小時課程

他說自己習慣在凌晨三點工作,因為那時候沒人打擾;真正高產出靠的是連續好幾天把一個問題「載入」腦中持續思考,而不是單日意志力,做一小時教學影片背後常要反覆錄近十小時。

17 2:24:08
工作環境與 GitHub Copilot

他說自己用一台 27 吋螢幕加筆電,深度學習則靠遠端連進 Linux 叢集用 VS Code 開發;他形容 Copilot 像「寫程式的自動駕駛」,最有用的是補完重複模式跟提示自己不知道的 API,但不會照單全收它給的答案。

18 2:41:56
學術研究的物理學化

他把 AI 研究比擬成物理學——以前一台電腦就能做出突破,現在愈來愈像得靠對撞機等級的資源;他認為 diffusion model 這類單台電腦就能驗證的簡單點子仍有空間,flash attention 這種提升 Transformer 運算效率的核心,就是實際出自學界的貢獻。

19 2:45:45
AGI 路徑之爭:純文字夠不夠,Optimus 是保險

他看好能打造出高度像人的 AGI,但懷疑光靠網路文字資料不足以建立對物理世界的完整理解;如果真是如此,Optimus 提供的實體互動資料就成了通往 AGI 的一條保險路徑。

20 2:49:16
意識是不是一種「建模能力」

他認為意識可能只是夠大、夠複雜的生成模型演化出的現象——當一個世界模型夠完整,它自然會理解自己也是這個世界裡的一個實體;他預期未來會出現「能不能關掉一個有意識的 AI」這種最高法院等級的倫理辯論。

21 3:01:06
Skynet、核武焦慮與 AGI 風險

他認同 AI 被用於戰爭是真實的擔憂,但認為問題不只在 AI 本身,連人類彼此都還沒有對齊;他把核武視為自己長年最擔心的事,擔心的不是文明徹底滅亡,而是被打回重來的那種毀滅性倒退。

22 3:05:06
移民火星與躲進虛擬實境

他認為在地球上先解決自我毀滅的驅力,才是比在火星留備份更根本的事;他預期未來人類經驗的「變異數」會愈拉愈大,有人去火星、有人投入虛擬實境,而他自己目前仍偏好自然與實體的生活。

23 3:17:38
把老化當疾病:先解決 AI 再解決一切

他把老化視為一種疾病看待,但認為人類不該直接去攻克它,而是該先解決智能這個「元問題」,再用它去解決包括老化在內的所有其他問題,這也是他選擇一直留在 AI 領域的原因。

24 3:24:17
生命的意義:死亡不是必然

他不認同「沒有死亡就沒有意義」這種說法,覺得人類真正該爭取的其實是更多時間去搞懂宇宙為什麼長這樣;他相信死亡不是無法迴避的宿命,未來應該會有醫療介入的空間。