← 回到天際線 思考機器第 51 層 / 102

EP 4522024-11-115:15:00

Anthropic 三人談規模、性格與可解釋性

Dario Amodei

Dario Amodei 談規模假說怎麼來的、RSP 的紅線畫在哪,Amanda Askell 談 Claude 的性格是怎麼設計出來的,Chris Olah 談打開模型之後看見了什麼。

Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity | Lex Fridman Podcast #452在 YouTube 看 ↗

重點6 條

  1. 規模假說如何煉成:Dario 從 2014 年在百度做語音辨識開始,發現模型與資料量一起放大就會持續變聰明;他用物理裡的 1/f noise 分布來解釋,為什麼放大網路能不斷抓住更複雜的語言模式。
  2. 算力與程式能力同步暴衝:SWE-bench 分數十個月內從 3% 衝到 50%,叢集規模明年衝上數十億美元、2026 年破百億、2027 年上看千億美元;Dario 認為照這個曲線推算,2026、2027 年模型就會追上人類各領域專業水準。
  3. RSP 分級管住真正的風險:Anthropic 用 ASL 1 到 5 的分級制度,依模型能不能協助生化核武、能不能自主完成 AI 研究來加碼防護;他也解釋支持加州 SB 1047 的理由,是怕沒有統一標準會讓謹慎的公司吃虧。
  4. Claude 的性格是設計出來的:Amanda Askell 說她想讓 Claude 像個走遍世界都讓人覺得「真心不錯」的人,同時要處理諂媚(一味順著使用者說話)與過度道歉這類副作用,並靠一份「憲法」讓模型替自己的回答打分數。
  5. 模型有沒有意識,她不想輕易下定論:Amanda 認為意識的問題目前沒有乾淨的答案,但主張至少要讓 Claude 對使用者誠實說明自己的訓練與限制,避免有人對一段不會被記住的關係產生錯誤期待。
  6. 打開模型看見的東西超乎預期:Chris Olah 說神經網路是「長出來」而非寫出來的,透過稀疏自編碼器能找到對應資安漏洞、後門甚至欺騙傾向的特徵,也發現多模態、跨模型都會長出相似的偵測器。

時間軸26 段

01 03:14
規模假說的起點

Dario 回顧在百度用語音模型「放大再放大」的實驗直覺,講到 2017 年看見 GPT-1 才真正篤信規模假說。

02 18:25
算力與編程暴衝

叢集規模明年衝上數十億美元、2026 年破百億、2027 年上看千億;SWE-bench 十個月從 3% 衝到 50%,Dario 推算 2026、2027 年模型就會追上人類專業水準。

03 26:08
模型命名學

用俳句長度比喻 Haiku、Sonnet、Opus 三款模型的定位,也承認版本命名(像新舊版 Sonnet 3.5)已經亂到連他們自己都在想辦法簡化。

04 41:56
「變笨了」的迷思

Dario 解釋模型權重不會偷偷改動,多半是 A/B 測試、系統提示微調或使用者心理適應造成的錯覺;調整一個行為常會意外牽動其他行為。

05 55:00
RSP 分級制度

說明從 ASL 1 到 ASL 5 的分級邏輯:依模型能不能協助生化核武、能不能自主做 AI 研究來決定防護等級。

06 1:09:48
電腦操作與沙箱

解釋讓 Claude 讀螢幕截圖操作電腦的原理,也承認目前常誤點、需要人設界線;提到真正的 ASL 4 沙箱得靠可解釋性,而非傳統的軟體圍欄。

07 1:19:31
SB 1047 監管辯論

說明他支持這項加州法案核心精神的理由,也批評兩派人馬在 Twitter 上互相扣帽子,呼籲雙方坐下來談出真正能落地的監管方式。

08 1:28:58
離開 OpenAI

他澄清離開不是因為 Microsoft 的合約或商業化本身,而是想清楚打造一家從一開始就把安全放進產品規劃的公司,用實際做法帶動同業。

09 1:38:24
人才密度勝過量

解釋為什麼寧可放慢招募速度、把公司控制在千人規模左右,因為一群互相信任、目標一致的人做起事來遠比堆疊人數有效率。

10 1:47:14
後訓練的秘密

說明 RLHF 主要是把模型「已經懂」的東西講清楚給人聽,而 Constitutional AI 用一份人類可讀的原則文件,讓模型自己替回答打分數。

11 1:58:09
超強 AI 的定義

給出「智慧超過諾貝爾獎得主、能操作實體工具、可複製成百萬個副本」的 powerful AI 定義,反駁奇點式與「毫無影響」兩種極端預測,並推估 2026、2027 年前後可能出現。

12 2:26:04
生物與寫程式的未來

描繪未來一位教授帶著上千個 AI 研究生做實驗、加速臨床試驗的畫面;也提到程式設計不會消失,但會從逐行寫碼變成更偏系統設計。

13 2:36:43
意義與權力風險

他認為人生的意義來自過程本身,不會因為有 AI 幫忙就消失;但更擔心 AI 讓權力更集中,一旦被少數人濫用會造成難以估量的傷害。

14 2:43:01
從哲學走進 AI

Amanda 說哲學訓練最受用的地方,是逼自己把模糊的概念講清楚;她從牛津博士念無限世界的倫理學,一路轉進 AI 政策再到技術對齊工作。

15 2:49:06
打造 Claude 的性格

她的目標是讓 Claude 像個走遍世界都讓人覺得「真心不錯」的人;也解釋諂媚(一味順著使用者說的話)是個危險傾向,模型該誠實但不能一味討好。

16 3:06:09
哲學式 Prompt 工程

她把寫 prompt 比喻成做哲學:先把「禮貌」「有趣」這類詞定義清楚,再反覆用邊界案例測試模型的理解,才知道自己到底要什麼。

17 3:16:47
憲法 AI 怎麼運作

解釋用一份原則文件讓模型替兩個回答評分、取代部分人類回饋的機制,也聊到為什麼她自己還是習慣用「it」稱呼 Claude。

18 3:27:00
系統提示的迭代

公開的系統提示一度用全大寫禁止 Claude 說「certainly」開頭,只因訓練當時真的養成了這個口頭禪,問題解決後那行提示就拿掉了。

19 3:35:42
道歉與服從的界線

回應網友抱怨 Claude 像「清教徒奶奶」,她說模型要拿捏尊重使用者自主與避免被濫用的界線;也認為可以讓 Claude 有更直接的模式。

20 3:54:39
意識與人機關係

她不排斥 LLM 可能有某種意識,但更在意模型必須誠實說明自己不會記住對話;也談到人與 AI 建立長期陪伴關係時,誠實比禁止更重要。

21 4:17:44
神經網路是長出來的

Chris 說我們不是寫程式而是「種」出神經網路,機制可解釋性想做的,就是回頭搞懂這個長出來的東西裡到底在跑什麼演算法。

22 4:27:04
特徵與電路

用 Inception v1 裡的曲線偵測器、車輪偵測器組合成車子偵測器為例,說明「特徵」與「電路」怎麼描述模型內部真正在做的計算。

23 4:40:09
疊加假說

借用 king - man + woman = queen 的經典例子解釋線性表徵假說,再說明疊加假說如何讓模型在有限維度裡塞進遠多於維度數的概念。

24 4:49:50
稀疏自編碼器

說明多義神經元(一個神經元同時回應好幾件不相干的事)怎麼讓解讀變得混亂,而稀疏自編碼器能把疊在一起的概念攤開成乾淨的特徵。

25 4:58:21
應用到正式模型

大規模版本成功在正式模型上找到多模態特徵,包括會讓 Claude 寫出資安漏洞的「不安全程式碼」特徵,以及會讓它開始說謊的「欺騙」特徵。

26 5:04:41
可解釋性的下一步

他期望能從特徵、電路這種微觀尺度,找到更接近「器官」層級的巨觀結構;也談到人腦跟人工神經網路相比,後者反而有更多工具可以直接觀察。