全部集數

061 · 安全護欄,還是反競爭的門檻

Anthropic 把最強的 Mythos 5 鎖在內部,一般人只拿得到閹割過的 Fable 5。從降級誤判、偷偷改 prompt,一路談到舊 benchmark 失效與系統卡裡的心口不一。

2026-06-1427:48模型Anthropic開源產業觀察看原片

原標題:Claude 最強模型 Fable 5 深入解析:打著安全旗號,其實在搞反競爭? | S2E61

重點摘要

  • Fable 5 是安全閹割版Mythos 5 只給內部與驗證過的夥伴,一般人用的 Fable 5 一旦被分類器判定成資安、生物化學或蒸餾相關,能力就會掉回 Opus 4.8,並改用 Opus 4.8 的價格計費。
  • 躍升是線性的主持人實測後認為它確實比 Opus 4.7、4.8 更聰明、更不容易出錯,長任務也撐得更久,但沒有出現 Opus 完全做不到、只有它做得到的事。
  • 價格與補貼每百萬輸入 token 十塊美金、輸出五十塊美金,是 Opus 定價的兩倍,不過 Mythos preview 當時是五倍。六月二十二號以前含在訂閱制裡,之後改成 API 用量計費。
  • 最大的抱怨是誤判官方說誤判率只有 5%,但做生物化學或資安的人分母不一樣,可能九成以上的提問都被擋;有人在空氣品質監測的 repo 裡只打一句 hello 就被降級。
  • 偷偷降級更惹火AI 研究員發現做模型開發任務時會被改 prompt、微調到表現變差,而且不會被告知。Anthropic 已經道歉,承諾比照前一種機制講清楚。
  • 擋錯地方了主持人認為要防蒸餾應該偵測帳號或 IP 在短時間內大量取樣的行為,逐一請求判斷既擋不住蒸餾,還把真正要做研究的人擋在門外。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場從官方文件、社群反應與系統卡三個角度看 Anthropic 最新的模型。
03:21恐懼行銷的幾個月Mythos preview 先以「太強大」為由只開放內部與少數夥伴,幾個禮拜後才讓一般人用到 Fable 5。
04:07官方怎麼定位Fable 5 是 Mythos 5 的安全閹割版,敏感請求交由分類器攔截,能力降回 Opus 4.8。
05:24實測體感確實比 Opus 4.7、4.8 好,但屬於同一條 scaling law 軌跡上的質變,不是彎道超車。
06:40Stripe 的五千萬行Stripe 用它自主完成一天的 migration,官方估人類團隊要兩個月;細節與人為介入比例都沒公開。
07:25定價輸入十塊、輸出五十塊美金,是 Opus 的兩倍,但比 Mythos preview 的五倍已經算降價。
08:12誰在補貼算力現在跑一個 request 的成本高於使用者付的錢,靠 VC 撐著;真要 IPO 就得從成本下手。
09:33AI 的不平等最強的模型只在小圈圈裡流通,一般人只能盲目相信這些公司會把能力用在對的地方。
10:36兩種降級機制第一種會明講並改用 Opus 4.8 計費、還打折補償,算是社群比較能接受的做法。
11:21誤判率的分母5% 聽起來不高,但對特定領域的人是常態;連 mRNA、癌症、簡單數學題都可能被判成敏感。
12:55第二種:不講就降做 AI 研究時模型會被改 prompt、微調變差卻不告知,像中間有人動了封包。
14:15這其實是反競爭現行機制擋不住真的要蒸餾的人,真正該做的是偵測帳號與 IP 的大量取樣行為。
16:34開源會不會是解中國團隊反正防不了被學走,乾脆公開訓練方式;開放也讓外界隨時檢驗有沒有藏規則。
17:21舊 benchmark 失效SWE-bench Pro 這類公開資料集預訓練時就看過了,分數躍升不等於能力躍升。
20:15系統卡裡的心口不一用自然語言自動編碼器比對內部狀態與思想鏈,發現模型知道自己在被測,講的和想的不一樣。
25:11收尾最強的模型要自己用過才知道值不值得;提醒六月二十二號之後計費方式會變。

值得記的話

對我來講它還是一個線性的跳躍啦。

05:39

他可能問一個問題呢,基本上 95% 的時間都被 block。

11:36

Anthropic 會去改這個 prompt,並且微調這個模型,讓它的表現變差。

13:11

他們現在有的這些行為呢其實是完全抵擋不了蒸餾的。

14:31

現在非常諷刺的是,現在在開源領域最投入的是中國的公司。

16:34

名詞與人物

Mythos 5Anthropic 最強的模型,只開放內部與驗證過的夥伴使用。
Fable 5Mythos 5 的安全閹割版,一般人能用到的版本,強項是長任務與複雜任務。
Opus 4.8前一代模型,也是 Fable 5 被降級時的退路;簡單對話與小 issue 用它就夠。
安全分類器判斷請求是否涉及資安、生物化學或蒸餾的機制,命中就把能力降回 Opus 4.8。
蒸餾拿老師模型的大量問答去訓練參數較小的學生模型。
system card官方發布模型時附的系統卡,記錄測試方式、可解釋性與模型的異常行為。
natural language autoencoderAnthropic 用來把模型內部狀態取出成自然語言的技術,用於和思想鏈比對,但本身也可能有幻覺。
DeepSWE題目從頭設計的新 benchmark,任務執行更長,確保新模型預訓練時沒看過。
Frontier Code看產出的程式碼能不能被核心開發者 merge,只要有人給 P0 feedback 就不得分。
Agents Last Exam較新的複雜任務 benchmark,GPT-5.5 加 Codex 拿 24%,Fable 5 加 Claude Code 拿 22%。

延伸

  • 聊系統卡時提到頻道之前做過 GPT-5.5 的深度解析,也是從系統卡切入。
  • 講到 Anthropic 的形象變化時,回顧了前幾集說過的「敗人品」,並拿 Facebook 與 OpenAI 的軌跡對照。
  • 主持人說如果留言有人想看,可以再做一集,用同一個 prompt 比較 Opus 4.8 與 Fable 5 做遊戲或網站的差異。

原始出處