EP 4592025-02-035:06:18
DeepSeek 之後的晶片與 AI 賽局
Dylan Patel、Nathan Lambert
半導體分析師與 AI 研究者從 DeepSeek 的技術細節,一路談到晶片戰、超大型資料中心與 AI 產業誰真的賺得到錢。
DeepSeek, China, OpenAI, NVIDIA, xAI, TSMC, Stargate, and AI Megaclusters | Lex Fridman Podcast #459在 YouTube 看 ↗
重點6 條
- DeepSeek 為什麼震動整個 AI 圈:V3 與 R1 用 MoE(混合專家架構)加上自創的 MLA(多頭潛在注意力),把訓練與推理成本壓到遠低於美系模型,而且完整公開技術細節,讓其他團隊真的能照著做。
- 晶片戰的實際樣貌:出口管制卡住的是高階晶片與互連頻寬,不是完全擋死;DeepSeek 為了繞過受限的互連頻寬,被迫把通訊排程寫到接近組合語言的層級,而美國真正想守住的是「AI 用量的規模」,不只是能不能訓練模型。
- 強化學習如何讓模型自己學會推理:R1-Zero 只用可驗證的答案對錯訓練,完全沒有人寫的推理範例,模型卻自己長出「等等,我重新想一下」這種反思行為,兩位來賓認為這比模仿學習重要得多。
- 超大型資料中心的軍備競賽:從 OpenAI 的 Stargate、xAI 在孟菲斯自建天然氣電廠,到 Google 的 TPU 叢集,幾家公司都在蓋以數十萬顆 GPU、數十億瓦電力計的設施,電力與冷卻常常比晶片本身更早卡關。
- 誰在這場競賽裡真的賺錢:目前只有 NVIDIA 穩賺不賠,雲端與晶片巨頭大多是帳面獲利,OpenAI 與 Anthropic 得持續募資才能撐住;兩人認為單純聊天應用撐不起這些投資,真正的錢在 agent、程式開發與電腦操作這類可驗證任務。
- 開源與資料倫理的灰色地帶:R1 用寬鬆的 MIT 授權釋出,推了整個開源社群一把,但也牽出「用別家模型輸出訓練算不算蒸餾偷竊」的爭議;兩人認為業界長年互相訓練彼此的輸出,DeepSeek 只是把這件事攤在陽光下。
時間軸26 段
說明 V3(一般對話模型)與 R1(推理模型)差在哪裡,以及預訓練、指令微調、偏好對齊、強化學習這些後訓練步驟各自在做什麼。
解釋「open weights」跟嚴格定義的開源差在哪裡,並釐清開放模型本身不會偷你的資料,真正握有資料的是提供服務的那一方。
對照 V3 直接給答案、R1 會先展示一長串思考過程,並現場展示 R1 回答「人類有什麼真正新穎的洞察」時的推理內容。
拆解 MoE(混合專家架構)如何只啟動一小部分參數運算,以及 DeepSeek 自創的 MLA(多頭潛在注意力)如何大幅省下記憶體。
描述大型訓練跑失敗時的 loss 突波是怎麼回事,以及業界所謂「YOLO run」——把所有資源押上去豪賭一次的決策方式。
說明 DeepSeek 母公司幻方量化這家避險基金的來歷,以及創辦人梁文鋒的風格;也點出官方公布的 GPU 數字跟業界推估落差很大。
解釋 H100 與依出口管制降規互連頻寬的 H800 差在哪裡,以及美國管制規則怎麼從「兩個指標」收斂成「只看算力」。
討論 Anthropic 執行長 Dario Amodei 主張的「超級 AI 帶來軍事優勢」論點,以及兩人對 AGI 時間點的各自看法。
談烏克蘭戰場上人類操控的無人機仍遠勝全自動系統,以及出口管制若把中國逼到牆角,可能反而升高對台灣的軍事風險。
說明晶圓代工模式為什麼贏過垂直整合廠,以及台灣在人才、work ethic 與產業聚落上的優勢,還有美國要複製這一切要花多少錢跟時間。
拆解 flops(每秒浮點運算)、記憶體頻寬與互連頻寬這三個維度,說明為什麼砍掉 flops、保留記憶體優勢的 H20 對「推理」反而更好用;接著解釋 transformer 的 KV cache 是什麼、為什麼推理模型輸出的 token 越長,伺服端要吃的記憶體就越誇張。
分析 MLA 省下的記憶體、OpenAI 的高利潤率,以及 DeepSeek 自家 GPU 根本撐不住流量、註冊都得暫停的現實。
討論 Anthropic 這類重視安全的實驗室為什麼發布得比較慢,以及思維鏈公開反而帶來的風險,還有「競速到底線」與「競速到頂端」的分野。
從中國模型迴避六四天安門的例子,談到 Gemini 一度亂生成人物圖片的失控案例,以及模型在預訓練階段就可能被灌進特定立場。
說明 DeepSeek 如何只用可驗證的獎勵訓練出會自我反思的模型,並引用 Andrej Karpathy 對這件事的評論,對照 AlphaGo 到 AlphaZero 的類比。
談可驗證任務未來會擴展到操作網頁、機器人這類領域,模型靠大量自我對弈慢慢逼近真正的通用能力。
用「說一個關於人類的真正新穎洞察」這題,現場比較 Gemini Flash Thinking 的回答,Lex 事後也補充了 R1、O1 Pro、O3 Mini 的表現心得。
分析 DeepSeek 發布後 NVIDIA 股價重挫的真正原因,以及「效率提升反而讓需求暴增」這個現象在 GPU 市場上實際發生的證據。
討論 OpenAI 指控 DeepSeek 用自家模型輸出訓練是否構成違規,以及矽谷業界挖角、換公司帶走點子這類日常的灰色地帶。
從 Stargate 在德州艾比林的規劃、xAI 在孟菲斯自建天然氣電廠與水冷系統,談到電力與冷卻才是真正的瓶頸。
分析 Google TPU 為何不對外賣、AMD 硬體不錯但軟體生態差太多,以及 Intel 在製程與 AI 晶片上全面落後的處境。
比較 Microsoft、Meta、OpenAI、Anthropic 各自的獲利狀況,以及為什麼有既有產品線的大公司比純模型公司更有機會撐下去。
拆解「agent」這個詞被過度濫用的現況,並解釋為什麼軟體工程最有機會最早被 agent 大幅接管,也談到低程式碼成本會怎麼改變產業結構。
介紹 AI2 的開源後訓練模型 Tulu,以及 DeepSeek R1 寬鬆授權對整個開源社群帶來的意義,還有開源 AI 目前缺乏正向回饋循環的困境。
拆解 Stargate 五千億美元宣傳數字背後真正到位的資金有多少,軟銀得賣掉 ARM 持股才湊得出錢,以及川普政府在法規鬆綁與反托拉斯上扮演的角色。
兩人各自講未來幾年最想看到的東西——叢集建置的規模、post-training 的突破、光通訊與跨資料中心訓練;也談到晶片越堆越多為什麼不會線性變快,最後收在對人類長期未來的看法。