← 回到天際線 思考機器第 53 層 / 102

EP 4592025-02-035:06:18

DeepSeek 之後的晶片與 AI 賽局

Dylan Patel、Nathan Lambert

半導體分析師與 AI 研究者從 DeepSeek 的技術細節,一路談到晶片戰、超大型資料中心與 AI 產業誰真的賺得到錢。

DeepSeek, China, OpenAI, NVIDIA, xAI, TSMC, Stargate, and AI Megaclusters | Lex Fridman Podcast #459在 YouTube 看 ↗

重點6 條

  1. DeepSeek 為什麼震動整個 AI 圈:V3 與 R1 用 MoE(混合專家架構)加上自創的 MLA(多頭潛在注意力),把訓練與推理成本壓到遠低於美系模型,而且完整公開技術細節,讓其他團隊真的能照著做。
  2. 晶片戰的實際樣貌:出口管制卡住的是高階晶片與互連頻寬,不是完全擋死;DeepSeek 為了繞過受限的互連頻寬,被迫把通訊排程寫到接近組合語言的層級,而美國真正想守住的是「AI 用量的規模」,不只是能不能訓練模型。
  3. 強化學習如何讓模型自己學會推理:R1-Zero 只用可驗證的答案對錯訓練,完全沒有人寫的推理範例,模型卻自己長出「等等,我重新想一下」這種反思行為,兩位來賓認為這比模仿學習重要得多。
  4. 超大型資料中心的軍備競賽:從 OpenAI 的 Stargate、xAI 在孟菲斯自建天然氣電廠,到 Google 的 TPU 叢集,幾家公司都在蓋以數十萬顆 GPU、數十億瓦電力計的設施,電力與冷卻常常比晶片本身更早卡關。
  5. 誰在這場競賽裡真的賺錢:目前只有 NVIDIA 穩賺不賠,雲端與晶片巨頭大多是帳面獲利,OpenAI 與 Anthropic 得持續募資才能撐住;兩人認為單純聊天應用撐不起這些投資,真正的錢在 agent、程式開發與電腦操作這類可驗證任務。
  6. 開源與資料倫理的灰色地帶:R1 用寬鬆的 MIT 授權釋出,推了整個開源社群一把,但也牽出「用別家模型輸出訓練算不算蒸餾偷竊」的爭議;兩人認為業界長年互相訓練彼此的輸出,DeepSeek 只是把這件事攤在陽光下。

時間軸26 段

01 03:33
DeepSeek 的基本輪廓

說明 V3(一般對話模型)與 R1(推理模型)差在哪裡,以及預訓練、指令微調、偏好對齊、強化學習這些後訓練步驟各自在做什麼。

02 05:14
開放權重不等於開放原始碼

解釋「open weights」跟嚴格定義的開源差在哪裡,並釐清開放模型本身不會偷你的資料,真正握有資料的是提供服務的那一方。

03 19:17
用起來的差別

對照 V3 直接給答案、R1 會先展示一長串思考過程,並現場展示 R1 回答「人類有什麼真正新穎的洞察」時的推理內容。

04 25:13
訓練為什麼這麼便宜

拆解 MoE(混合專家架構)如何只啟動一小部分參數運算,以及 DeepSeek 自創的 MLA(多頭潛在注意力)如何大幅省下記憶體。

05 43:14
訓練現場的壓力

描述大型訓練跑失敗時的 loss 突波是怎麼回事,以及業界所謂「YOLO run」——把所有資源押上去豪賭一次的決策方式。

06 51:34
幻方與 DeepSeek 的背景

說明 DeepSeek 母公司幻方量化這家避險基金的來歷,以及創辦人梁文鋒的風格;也點出官方公布的 GPU 數字跟業界推估落差很大。

07 58:55
Hopper 架構與受限晶片

解釋 H100 與依出口管制降規互連頻寬的 H800 差在哪裡,以及美國管制規則怎麼從「兩個指標」收斂成「只看算力」。

08 1:00:52
出口管制到底在防什麼

討論 Anthropic 執行長 Dario Amodei 主張的「超級 AI 帶來軍事優勢」論點,以及兩人對 AGI 時間點的各自看法。

09 1:17:04
無人機戰場現實與台海風險

談烏克蘭戰場上人類操控的無人機仍遠勝全自動系統,以及出口管制若把中國逼到牆角,可能反而升高對台灣的軍事風險。

10 1:31:11
台積電與半導體供應鏈

說明晶圓代工模式為什麼贏過垂直整合廠,以及台灣在人才、work ethic 與產業聚落上的優勢,還有美國要複製這一切要花多少錢跟時間。

11 1:55:14
H20 與推理的記憶體瓶頸

拆解 flops(每秒浮點運算)、記憶體頻寬與互連頻寬這三個維度,說明為什麼砍掉 flops、保留記憶體優勢的 H20 對「推理」反而更好用;接著解釋 transformer 的 KV cache 是什麼、為什麼推理模型輸出的 token 越長,伺服端要吃的記憶體就越誇張。

12 2:09:42
R1 為什麼定價這麼低

分析 MLA 省下的記憶體、OpenAI 的高利潤率,以及 DeepSeek 自家 GPU 根本撐不住流量、註冊都得暫停的現實。

13 2:17:48
安全考量與競速壓力

討論 Anthropic 這類重視安全的實驗室為什麼發布得比較慢,以及思維鏈公開反而帶來的風險,還有「競速到底線」與「競速到頂端」的分野。

14 2:32:10
審查、對齊與模型裡的意識形態

從中國模型迴避六四天安門的例子,談到 Gemini 一度亂生成人物圖片的失控案例,以及模型在預訓練階段就可能被灌進特定立場。

15 2:43:37
R1-Zero 與湧現的推理能力

說明 DeepSeek 如何只用可驗證的獎勵訓練出會自我反思的模型,並引用 Andrej Karpathy 對這件事的評論,對照 AlphaGo 到 AlphaZero 的類比。

16 2:51:30
通往下一步的沙盒訓練

談可驗證任務未來會擴展到操作網頁、機器人這類領域,模型靠大量自我對弈慢慢逼近真正的通用能力。

17 2:59:13
同一題目比較不同模型

用「說一個關於人類的真正新穎洞察」這題,現場比較 Gemini Flash Thinking 的回答,Lex 事後也補充了 R1、O1 Pro、O3 Mini 的表現心得。

18 3:14:43
NVIDIA 股價暴跌與 Jevons paradox

分析 DeepSeek 發布後 NVIDIA 股價重挫的真正原因,以及「效率提升反而讓需求暴增」這個現象在 GPU 市場上實際發生的證據。

19 3:25:41
蒸餾爭議與產業間諜

討論 OpenAI 指控 DeepSeek 用自家模型輸出訓練是否構成違規,以及矽谷業界挖角、換公司帶走點子這類日常的灰色地帶。

20 3:36:13
超大型叢集怎麼蓋出來的

從 Stargate 在德州艾比林的規劃、xAI 在孟菲斯自建天然氣電廠與水冷系統,談到電力與冷卻才是真正的瓶頸。

21 3:59:08
誰能挑戰 NVIDIA

分析 Google TPU 為何不對外賣、AMD 硬體不錯但軟體生態差太多,以及 Intel 在製程與 AI 晶片上全面落後的處境。

22 4:11:29
AI 淘金潮誰真的賺錢

比較 Microsoft、Meta、OpenAI、Anthropic 各自的獲利狀況,以及為什麼有既有產品線的大公司比純模型公司更有機會撐下去。

23 4:21:39
Agent 與軟體工程的未來

拆解「agent」這個詞被過度濫用的現況,並解釋為什麼軟體工程最有機會最早被 agent 大幅接管,也談到低程式碼成本會怎麼改變產業結構。

24 4:37:35
開源生態與 Tulu

介紹 AI2 的開源後訓練模型 Tulu,以及 DeepSeek R1 寬鬆授權對整個開源社群帶來的意義,還有開源 AI 目前缺乏正向回饋循環的困境。

25 4:47:11
Stargate 的錢從哪裡來

拆解 Stargate 五千億美元宣傳數字背後真正到位的資金有多少,軟銀得賣掉 ARM 持股才湊得出錢,以及川普政府在法規鬆綁與反托拉斯上扮演的角色。

26 4:54:34
接下來最期待什麼

兩人各自講未來幾年最想看到的東西——叢集建置的規模、post-training 的突破、光通訊與跨資料中心訓練;也談到晶片越堆越多為什麼不會線性變快,最後收在對人類長期未來的看法。