← 回到天際線 思考機器第 34 層 / 102

EP 1322020-10-223:08:46 ROUND 2

從駭進模擬到端到端自駕

George Hotz

George Hotz 二度上節目,從外星文明聊到 comma.ai 的端到端自駕哲學,以及技術終究會贏的信念。

George Hotz: Hacking the Simulation & Learning to Drive with Neural Nets | Lex Fridman Podcast #132在 YouTube 看 ↗

重點6 條

  1. 端到端才是自駕的終局:George 認為 Tesla 按任務拆解的做法仍是特徵工程,而特徵工程終究會輸給用人類實際駕駛資料訓練出來的端到端神經網路;他認為 MuZero 稍加調整就是自駕的解法。
  2. 駕駛監控要跟著風險調整:comma 的駕駛監控依當下路況放寬或收緊警戒程度,不是一律拉到最高;他也說過 Elon 一定會在做到 Level 5 之前先推出駕駛監控,願意為此賭一萬美元。
  3. 用戶數可能反超,營收贏不了:他把 comma 對 Tesla 的關係類比成 Android 對 iOS,openpilot 的用戶數有機會超過 Autopilot,但 Tesla 賣出的車會比 comma 硬體多,營收也永遠贏不過 Tesla。
  4. Waymo 的問題在產品:他說不看好 Waymo 不是因為技術,而是產品邏輯:乘客早就能用 UberPool 拿時間換便宜,卻很少人選,自駕計程車就算便宜一點也沒有競爭力。
  5. 開場先聊外星文明與模擬論:他重申那場「駭進模擬」的 SXSW 演講本意其實是提醒人類謙卑,也聊到在紐約餐廳巧遇開發者、幫忙修改編譯器解掉技術卡點的往事。
  6. 三個改變世界觀的日子:分別是接觸 Eliezer Yudkowsky 談運算能力指數成長、發現 Hutter Prize 讓他把智慧理解成壓縮,以及讀到 Curtis Yarvin 部落格的那天。

時間軸30 段

01 02:32
外星文明與 UFO

George 說他一直認為宇宙裡曾有其他智慧文明,但都已自我毀滅;否則光靠馮紐曼探測器以次光速飛個一百萬年就足以占滿宇宙,而這顯然沒發生。Lex 提到五角大廈公開的 UFO 影片,George 說他認為所有新聞都是「心理操作」,也提到一個說法:陰謀論是 CIA 在 60 年代發明來抹黑真實事件的;像中國拘留發現冠狀病毒的醫生、貨幣早已不再由黃金支撐,這些都不是陰謀論,而是真的發生過。

02 14:41
外星語言與 DNA

George 認為程式語言和自然語言沒有想像中那麼不同,外星語言應該也差不多;他把 DNA 形容成一種 CAD 模型而非程式語言,模擬到分子層級的運算量太大,也抱怨現在的生物實驗室工具太原始。

03 18:54
駭進模擬的原意

George 說很多人誤解了他那場 SXSW 演講,重點不是真的要駭進模擬,而是提醒人類自己有多渺小;他認為人類把力氣花在衝股價這類規則被操縱的遊戲上,他說自己很喜歡資本主義,只是現在玩的不是那個遊戲。Lex 說大自然的遊戲很殘酷,George 不同意,認為大自然給的是一個開放世界的 MMORPG,想玩什麼自己選。

04 23:47
想活到知道一切

George 說他想活到知道一切再死,但不是真正死不了,而是要自己決定何時死;面對「好奇心可能只是因為生命有限才存在」的提問,他說可以改掉腦中的設定,讓自己以為生命有限,或留幾份自己的備份,定期確認方向沒有偏掉。

05 27:57
模擬論要有權力

George 說他不懷疑我們活在模擬裡,只是覺得這不重要,他只在乎它能不能給人對大自然的權力,例如找到宇宙裡類似記憶體外洩的漏洞;Lex 提到 Eric Weinstein 與 Stephen Wolfram 的萬有理論,George 說先拿出可驗證的預測再說,他只對能帶來權力的理論感興趣。

06 31:34
巧遇 Optimism

Lex 提到網路上流傳的故事:George 在紐約一家餐廳被開發者認出,對方正卡在把 Solidity 位元碼轉成 OVM 安全位元碼的問題上;George 說他問清楚問題後,直接把邏輯寫進編譯器本身,用 300 行修改取代對方原本 3000 行的轉譯器。

07 39:26
加密貨幣的想法

George 說他長期非常看好加密貨幣,看好的不是特定專案,而是兩個想法:Nakamoto 共識演算法,以及能用程式碼取代律師的智慧合約;他也認為分岔是加密貨幣世界一個很有力的想法,不同做法可以並存、讓大家用錢投票,甚至說想把 Nvidia 分岔,也歡迎別人分岔 comma。

08 49:17
學新東西沒訣竅

面對「怎麼持續學新東西」的提問,George 開玩笑說要寫一本自助書,封面就印「這些建議都沒有意義」;Lex 說這代表他沒系統化想過自己怎麼做事,George 承認自己對刻意、按計畫過日子有點排斥,他的建議就是一直做。

09 52:44
comma.ai 的任務

George 說 comma 的任務是「解決自駕車問題,同時要交出能出貨的中間產品」;出貨賺錢不只是維持公司運作,也逼自己誠實面對進度,不然很容易靠設定任意的里程碑,誤以為自己在前進。

10 56:11
comma two 與 openpilot

George 說 comma 的口號是「讓開車變輕鬆」,comma two 硬體基本上就是加了散熱與車機介面的手機,接上車輛的四條 CAN 匯流排;openpilot 是跑在上面的神經網路軟體,負責車道保持與跟車,並把資料回傳伺服器持續訓練。

11 59:21
端到端 vs. Tesla 拆解

George 說 openpilot 的橫向控制已經幾乎完全端到端,關掉車道線也能開,只是在高速公路上會稍差;目前大約每 100 英里有一次非預期的接管,一年前約 10 英里,但離需要的十萬英里還很遠。Lex 描述 Tesla 的做法是把駕駛拆成上百個子任務、各自挖邊緣案例,再問 George 為什麼認為自己是對的。

12 1:06:23
西洋棋比喻與 MuZero

George 用西洋棋比喻反駁按任務拆解的做法:開西洋棋引擎公司,不會去請一個專門負責主教的人;他說 Tesla 的做法只是抽象層級高一點的特徵工程,而特徵工程終究會輸給端到端,拆解的路不是走不通,但工程量可能超出人類的能力。他認為 MuZero 會被視為深度學習時代的基石論文,稍加調整就是自駕的解法,並估計 2020 年代後段能做到。

13 1:12:29
監控:場景自適應

George 說 comma 的駕駛監控是「場景自適應」的:車靜止時不強制監控,開在有紅綠燈、行人的路段就拉高監控強度;他也說過 Elon 一定會在做到 Level 5 之前先推出駕駛監控,願意為此賭一萬美元。

14 1:22:58
監控比感知容易

George 說駕駛監控比外部環境感知容易,因為就算判斷偶爾失準,代價也遠不如把車開偏;他也提到一旦高速公路上做到 Level 3,車上就能安心滑手機、看劇,不只是聽音樂跟有聲書。

15 1:27:40
批評 Nvidia 訂價

George 說現在訓練硬體只剩 Nvidia 和 Google 兩條路,而 Google 的服務條款不准用 Google Cloud 訓練自駕,他連碰都不想碰 TPU。他曾是 Nvidia 的粉絲,但 2018 年前後管理層換人後,公司變成「能從生態系榨多少錢就榨多少」,把 A100 訂到一萬美元;他認為 Nvidia 應該像 Intel 過去那樣,以合理價格把晶片賣給所有人,也認為 Tesla 應該把 Dojo 和車上的加速晶片對外銷售。

16 1:34:19
資料引擎 vs. 自帶標註

Lex 問到 Tesla 神經網路的大改寫,George 說 comma 也在大改:模型從 2D 換到 3D、從 TensorFlow 換到 PyTorch。Lex 稱讚 Tesla 的資料引擎,George 同意那是很厲害的工程,但只適用於真的需要監督資料的問題;駕駛本身,人怎麼開就是最好的標註,資料引擎他打算用在駕駛監控上。

17 1:40:35
怎麼裝 comma

George 說目前大概支援 91 種車款,年底前要衝到 100;有支援的車款裝一台 comma two 大概十分鐘,難度像組一件 IKEA 家具,想深度改造就要進 Discord 社群,裡面大約六成人用官方版、四成人用社群改的分支版本。

18 1:45:17
comma 的商業模式

George 說 comma 已經開始獲利,每天約有兩千台裝置在用、每月超過三千台,comma two 買家有七成天天在用;他把 comma 對 Tesla 的關係類比成 Android 對 iOS:openpilot 的用戶數有機會超過 Autopilot,但 Tesla 賣出的車會比 comma 硬體多,營收也永遠贏不過 Tesla。

19 1:51:50
併購與 Waymo 評價

被問到是否考慮被收購,George 說他當面嘲笑過找上門的併購提案;車廠裡他尊重現代多於通用,科技公司裡 Apple 最接近他能尊重的。Lex 搭過 Waymo 後稱讚它的工程,George 說他不看好不是因為技術,而是產品:乘客早就能用 UberPool 拿時間換便宜,卻很少人選,自駕計程車市場最後會像滑板車一樣殺價競爭。

20 1:58:06
接管 Tesla 或 Waymo

George 說如果讓他接手 Tesla 一年,他不會改動太多方向,頂多立刻加裝紅外線攝影機做駕駛監控;如果讓他接管 Waymo,他會把 Anthony Levandowski 從牢裡弄出來主導公司,因為他認為對方是天才,自己則只想當過渡期的 CEO。

21 2:05:53
自駕不會改變世界

George 說自駕是最酷的應用 AI 問題,因為有清楚的賺錢路徑,但不會像網路那樣改變世界,50 年前大家就想像得到;對 Lex 想做機器人的念頭,他說先把自駕解決、專注在任務上,對人可以傲慢,對大自然傲慢就是笨蛋。

22 2:12:25
誠實比造聲勢重要

George 說「技術終究會贏,說謊終究會輸」,反對靠誇大來募資;被問到 Elon 常常晚交付承諾,他說自己也有這個毛病,認為只要真的朝著目標努力、最後真的做到,晚一點交付還可以接受,問題出在明知道做不到卻硬說。他也說 Tesla 仍可能贏過 comma,因為 Elon 比他更會調度大量資源。

23 2:18:13
網路酸民心理

George 說網路上的留言者不能代表大眾,Hacker News 上的酸民見不得新創成功,是因為對方成功就等於說他們自己本來也可以走不同的路;兩人都認為這也是平台問題。George 說 Twitter 只有按讚、轉推這種正向按鈕,要表達負面只能留言,所以特別毒,YouTube 有倒讚反而好一些;靠廣告賺錢的社群網路賣的是對使用者的影響力,不可能不毒。

24 2:23:58
寫程式的習慣

George 說自己不迷戀多螢幕或特定編輯器,在飯店房間角落用一台 MacBook Air 照樣能寫,雖然公司裡也有三台 24 吋螢幕;他大多用 Vim,覺得 VS Code 適合讀程式碼,但工具其實還能做得更好。

25 2:27:25
三個轉折的日子

George 說他記得人生中三個徹底改變思考方式的日子,願意花十萬美元再換一天:讀到 Eliezer Yudkowsky 談奇點的文章,意識到電腦每 18 個月效能翻倍而人類沒有,自己這輩子就會看到人類被取代;理解 Hutter Prize 背後「無損壓縮等於智慧」的那天,之後他花了半年挑戰這個獎,從此開始學 AI;以及讀到 Curtis Yarvin 部落格 Unqualified Reservations 的那天,讓他覺得終於有個框架能解釋當時的政治局勢。

26 2:34:57
對 GPT-3 潑冷水

George 說他覺得 GPT-3 被過譽了,單純把模型規模放大也得不到通用智慧,因為它的損失函數只是字元層級的交叉熵,不是通用智慧的損失函數,而且缺乏長期記憶;他認為開車比語言更接近馬可夫性質,前一刻的資訊大多已經包含在當下的狀態裡,不太需要往回翻好幾段。

27 2:39:10
奇點與 AGI

George 說我們現在就活在奇點裡,他說的奇點是人與人之間的資訊頻寬提升、全世界連成一體;他同意 Lex 所說奇點會來自群體智慧,不相信單一 AGI 突然起飛。他說開車是通用智慧裡相當完整的子集合,comma 開發的工具也會幫助解決通用智慧,這才是他做這件事的真正原因,他並不在乎自駕車本身;真的做出 Level 5,就無可爭議地做出了有巨大經濟價值的東西。

28 2:42:16
該學的四種典範

George 說如果能選,人類去火星比解決自駕更好,但他比較適合做自駕,自稱是資訊人。他建議依序學組合語言、C、Python,體會每一層幫你省了什麼;再學 Haskell 這類函數式語言與 Verilog,理解硬體裡所有指令同時執行;第四種典範是機器學習,要學就學 PyTorch,別學 TensorFlow。至於怎麼學程式,他說看一支叫「學程式」的影片學不會,會寫程式的人都是先有想做的事再動手;學機器學習也一樣,要先有想解決的問題,不要拿著技術找問題。

29 2:51:40
書單與人生建議

George 先推薦三本書:David Foster Wallace 的《Infinite Jest》,他說這本書其實在講 wireheading;他形容 Ayn Rand 的《阿特拉斯聳聳肩》像「色情作品」——製作水準不高,但給了他一套理解人際關係的框架;還有討論複製自己的科幻小說《Permutation City》,另外也提了《The Metamorphosis of Prime Intellect》與《Snow Crash》等書。被問到給年輕人的建議,他說自助書不是設計來幫你,而是讓你感覺良好,他能給的建議大家其實早就知道。

30 2:59:50
談愛與自我評價

George 把愛分成三種:類鴉片式、催產素式,以及一種更像是對數學的愛,他對前兩種不太熱衷;談到迷幻藥,他認為每種藥都有東西可學,但學到的是關於自己而不是關於世界,門後看過一次就不必一直回去,雖然他大概一年還會再試一次。被問到自己有多瘋,他說跟 Elon Musk 或 Anthony Levandowski 比起來還好,大概六七分;他說自己就是選擇成為的樣子,看到什麼就照實說,不說謊。