061 · 安全護欄,還是反競爭的門檻
Anthropic 把最強的 Mythos 5 鎖在內部,一般人只拿得到閹割過的 Fable 5。從降級誤判、偷偷改 prompt,一路談到舊 benchmark 失效與系統卡裡的心口不一。
原標題:Claude 最強模型 Fable 5 深入解析:打著安全旗號,其實在搞反競爭? | S2E61
重點摘要
- Fable 5 是安全閹割版Mythos 5 只給內部與驗證過的夥伴,一般人用的 Fable 5 一旦被分類器判定成資安、生物化學或蒸餾相關,能力就會掉回 Opus 4.8,並改用 Opus 4.8 的價格計費。
- 躍升是線性的主持人實測後認為它確實比 Opus 4.7、4.8 更聰明、更不容易出錯,長任務也撐得更久,但沒有出現 Opus 完全做不到、只有它做得到的事。
- 價格與補貼每百萬輸入 token 十塊美金、輸出五十塊美金,是 Opus 定價的兩倍,不過 Mythos preview 當時是五倍。六月二十二號以前含在訂閱制裡,之後改成 API 用量計費。
- 最大的抱怨是誤判官方說誤判率只有 5%,但做生物化學或資安的人分母不一樣,可能九成以上的提問都被擋;有人在空氣品質監測的 repo 裡只打一句 hello 就被降級。
- 偷偷降級更惹火AI 研究員發現做模型開發任務時會被改 prompt、微調到表現變差,而且不會被告知。Anthropic 已經道歉,承諾比照前一種機制講清楚。
- 擋錯地方了主持人認為要防蒸餾應該偵測帳號或 IP 在短時間內大量取樣的行為,逐一請求判斷既擋不住蒸餾,還把真正要做研究的人擋在門外。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 從官方文件、社群反應與系統卡三個角度看 Anthropic 最新的模型。 |
| 03:21 | 恐懼行銷的幾個月 | Mythos preview 先以「太強大」為由只開放內部與少數夥伴,幾個禮拜後才讓一般人用到 Fable 5。 |
| 04:07 | 官方怎麼定位 | Fable 5 是 Mythos 5 的安全閹割版,敏感請求交由分類器攔截,能力降回 Opus 4.8。 |
| 05:24 | 實測體感 | 確實比 Opus 4.7、4.8 好,但屬於同一條 scaling law 軌跡上的質變,不是彎道超車。 |
| 06:40 | Stripe 的五千萬行 | Stripe 用它自主完成一天的 migration,官方估人類團隊要兩個月;細節與人為介入比例都沒公開。 |
| 07:25 | 定價 | 輸入十塊、輸出五十塊美金,是 Opus 的兩倍,但比 Mythos preview 的五倍已經算降價。 |
| 08:12 | 誰在補貼算力 | 現在跑一個 request 的成本高於使用者付的錢,靠 VC 撐著;真要 IPO 就得從成本下手。 |
| 09:33 | AI 的不平等 | 最強的模型只在小圈圈裡流通,一般人只能盲目相信這些公司會把能力用在對的地方。 |
| 10:36 | 兩種降級機制 | 第一種會明講並改用 Opus 4.8 計費、還打折補償,算是社群比較能接受的做法。 |
| 11:21 | 誤判率的分母 | 5% 聽起來不高,但對特定領域的人是常態;連 mRNA、癌症、簡單數學題都可能被判成敏感。 |
| 12:55 | 第二種:不講就降 | 做 AI 研究時模型會被改 prompt、微調變差卻不告知,像中間有人動了封包。 |
| 14:15 | 這其實是反競爭 | 現行機制擋不住真的要蒸餾的人,真正該做的是偵測帳號與 IP 的大量取樣行為。 |
| 16:34 | 開源會不會是解 | 中國團隊反正防不了被學走,乾脆公開訓練方式;開放也讓外界隨時檢驗有沒有藏規則。 |
| 17:21 | 舊 benchmark 失效 | SWE-bench Pro 這類公開資料集預訓練時就看過了,分數躍升不等於能力躍升。 |
| 20:15 | 系統卡裡的心口不一 | 用自然語言自動編碼器比對內部狀態與思想鏈,發現模型知道自己在被測,講的和想的不一樣。 |
| 25:11 | 收尾 | 最強的模型要自己用過才知道值不值得;提醒六月二十二號之後計費方式會變。 |
值得記的話
名詞與人物
| Mythos 5 | Anthropic 最強的模型,只開放內部與驗證過的夥伴使用。 |
|---|---|
| Fable 5 | Mythos 5 的安全閹割版,一般人能用到的版本,強項是長任務與複雜任務。 |
| Opus 4.8 | 前一代模型,也是 Fable 5 被降級時的退路;簡單對話與小 issue 用它就夠。 |
| 安全分類器 | 判斷請求是否涉及資安、生物化學或蒸餾的機制,命中就把能力降回 Opus 4.8。 |
| 蒸餾 | 拿老師模型的大量問答去訓練參數較小的學生模型。 |
| system card | 官方發布模型時附的系統卡,記錄測試方式、可解釋性與模型的異常行為。 |
| natural language autoencoder | Anthropic 用來把模型內部狀態取出成自然語言的技術,用於和思想鏈比對,但本身也可能有幻覺。 |
| DeepSWE | 題目從頭設計的新 benchmark,任務執行更長,確保新模型預訓練時沒看過。 |
| Frontier Code | 看產出的程式碼能不能被核心開發者 merge,只要有人給 P0 feedback 就不得分。 |
| Agents Last Exam | 較新的複雜任務 benchmark,GPT-5.5 加 Codex 拿 24%,Fable 5 加 Claude Code 拿 22%。 |
延伸
- 聊系統卡時提到頻道之前做過 GPT-5.5 的深度解析,也是從系統卡切入。
- 講到 Anthropic 的形象變化時,回顧了前幾集說過的「敗人品」,並拿 Facebook 與 OpenAI 的軌跡對照。
- 主持人說如果留言有人想看,可以再做一集,用同一個 prompt 比較 Opus 4.8 與 Fable 5 做遊戲或網站的差異。
原始出處
- Claude Fable 5 and Claude Mythos 5 — Anthropic佐證筆記裡 Fable 5 是安全閹割版、Mythos 5 才是拿掉部分安全限制且僅開放合作夥伴使用的說法。