EP 4522024-11-115:15:00
Anthropic 三人談規模、性格與可解釋性
Dario Amodei
Dario Amodei 談規模假說怎麼來的、RSP 的紅線畫在哪,Amanda Askell 談 Claude 的性格是怎麼設計出來的,Chris Olah 談打開模型之後看見了什麼。
Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity | Lex Fridman Podcast #452在 YouTube 看 ↗
重點6 條
- 規模假說如何煉成:Dario 從 2014 年在百度做語音辨識開始,發現模型與資料量一起放大就會持續變聰明;他用物理裡的 1/f noise 分布來解釋,為什麼放大網路能不斷抓住更複雜的語言模式。
- 算力與程式能力同步暴衝:SWE-bench 分數十個月內從 3% 衝到 50%,叢集規模明年衝上數十億美元、2026 年破百億、2027 年上看千億美元;Dario 認為照這個曲線推算,2026、2027 年模型就會追上人類各領域專業水準。
- RSP 分級管住真正的風險:Anthropic 用 ASL 1 到 5 的分級制度,依模型能不能協助生化核武、能不能自主完成 AI 研究來加碼防護;他也解釋支持加州 SB 1047 的理由,是怕沒有統一標準會讓謹慎的公司吃虧。
- Claude 的性格是設計出來的:Amanda Askell 說她想讓 Claude 像個走遍世界都讓人覺得「真心不錯」的人,同時要處理諂媚(一味順著使用者說話)與過度道歉這類副作用,並靠一份「憲法」讓模型替自己的回答打分數。
- 模型有沒有意識,她不想輕易下定論:Amanda 認為意識的問題目前沒有乾淨的答案,但主張至少要讓 Claude 對使用者誠實說明自己的訓練與限制,避免有人對一段不會被記住的關係產生錯誤期待。
- 打開模型看見的東西超乎預期:Chris Olah 說神經網路是「長出來」而非寫出來的,透過稀疏自編碼器能找到對應資安漏洞、後門甚至欺騙傾向的特徵,也發現多模態、跨模型都會長出相似的偵測器。
時間軸26 段
Dario 回顧在百度用語音模型「放大再放大」的實驗直覺,講到 2017 年看見 GPT-1 才真正篤信規模假說。
叢集規模明年衝上數十億美元、2026 年破百億、2027 年上看千億;SWE-bench 十個月從 3% 衝到 50%,Dario 推算 2026、2027 年模型就會追上人類專業水準。
用俳句長度比喻 Haiku、Sonnet、Opus 三款模型的定位,也承認版本命名(像新舊版 Sonnet 3.5)已經亂到連他們自己都在想辦法簡化。
Dario 解釋模型權重不會偷偷改動,多半是 A/B 測試、系統提示微調或使用者心理適應造成的錯覺;調整一個行為常會意外牽動其他行為。
說明從 ASL 1 到 ASL 5 的分級邏輯:依模型能不能協助生化核武、能不能自主做 AI 研究來決定防護等級。
解釋讓 Claude 讀螢幕截圖操作電腦的原理,也承認目前常誤點、需要人設界線;提到真正的 ASL 4 沙箱得靠可解釋性,而非傳統的軟體圍欄。
說明他支持這項加州法案核心精神的理由,也批評兩派人馬在 Twitter 上互相扣帽子,呼籲雙方坐下來談出真正能落地的監管方式。
他澄清離開不是因為 Microsoft 的合約或商業化本身,而是想清楚打造一家從一開始就把安全放進產品規劃的公司,用實際做法帶動同業。
解釋為什麼寧可放慢招募速度、把公司控制在千人規模左右,因為一群互相信任、目標一致的人做起事來遠比堆疊人數有效率。
說明 RLHF 主要是把模型「已經懂」的東西講清楚給人聽,而 Constitutional AI 用一份人類可讀的原則文件,讓模型自己替回答打分數。
給出「智慧超過諾貝爾獎得主、能操作實體工具、可複製成百萬個副本」的 powerful AI 定義,反駁奇點式與「毫無影響」兩種極端預測,並推估 2026、2027 年前後可能出現。
描繪未來一位教授帶著上千個 AI 研究生做實驗、加速臨床試驗的畫面;也提到程式設計不會消失,但會從逐行寫碼變成更偏系統設計。
他認為人生的意義來自過程本身,不會因為有 AI 幫忙就消失;但更擔心 AI 讓權力更集中,一旦被少數人濫用會造成難以估量的傷害。
Amanda 說哲學訓練最受用的地方,是逼自己把模糊的概念講清楚;她從牛津博士念無限世界的倫理學,一路轉進 AI 政策再到技術對齊工作。
她的目標是讓 Claude 像個走遍世界都讓人覺得「真心不錯」的人;也解釋諂媚(一味順著使用者說的話)是個危險傾向,模型該誠實但不能一味討好。
她把寫 prompt 比喻成做哲學:先把「禮貌」「有趣」這類詞定義清楚,再反覆用邊界案例測試模型的理解,才知道自己到底要什麼。
解釋用一份原則文件讓模型替兩個回答評分、取代部分人類回饋的機制,也聊到為什麼她自己還是習慣用「it」稱呼 Claude。
公開的系統提示一度用全大寫禁止 Claude 說「certainly」開頭,只因訓練當時真的養成了這個口頭禪,問題解決後那行提示就拿掉了。
回應網友抱怨 Claude 像「清教徒奶奶」,她說模型要拿捏尊重使用者自主與避免被濫用的界線;也認為可以讓 Claude 有更直接的模式。
她不排斥 LLM 可能有某種意識,但更在意模型必須誠實說明自己不會記住對話;也談到人與 AI 建立長期陪伴關係時,誠實比禁止更重要。
Chris 說我們不是寫程式而是「種」出神經網路,機制可解釋性想做的,就是回頭搞懂這個長出來的東西裡到底在跑什麼演算法。
用 Inception v1 裡的曲線偵測器、車輪偵測器組合成車子偵測器為例,說明「特徵」與「電路」怎麼描述模型內部真正在做的計算。
借用 king - man + woman = queen 的經典例子解釋線性表徵假說,再說明疊加假說如何讓模型在有限維度裡塞進遠多於維度數的概念。
說明多義神經元(一個神經元同時回應好幾件不相干的事)怎麼讓解讀變得混亂,而稀疏自編碼器能把疊在一起的概念攤開成乾淨的特徵。
大規模版本成功在正式模型上找到多模態特徵,包括會讓 Claude 寫出資安漏洞的「不安全程式碼」特徵,以及會讓它開始說謊的「欺騙」特徵。
他期望能從特徵、電路這種微觀尺度,找到更接近「器官」層級的巨觀結構;也談到人腦跟人工神經網路相比,後者反而有更多工具可以直接觀察。