062 · 封禁前的最後一場模型對決
美國商務部把 Anthropic 的 Fable 與 Mythos 系列列入出口管制,模型一夜下架。Kenji 剛好在那之前跑完同一份 prompt,留下兩邊做 3D 皮卡丘小遊戲的完整對照。
原標題:Fable 5 vs Opus 4.8 正面對決:誰的皮卡丘 Flappy Bird 比較好玩?(封禁前最後實測)| S2E62
重點摘要
- 出口管制第一次管到軟體Fable 5 上線沒幾天,美國商務部就對 Fable 與 Mythos 系列發出口管制,禁止任何外國人使用。Anthropic 分不出誰是美國身份,只能整個系列下架。
- 理由被認為站不住腳據報導是 Amazon 執行長 Andy Jassy 向政府反映有越獄漏洞。Kenji 指出,丟一份程式碼請模型找漏洞,在 GPT-5.5 等其他模型上同樣做得到,這個理由說服力不足。
- 恐懼行銷的反作用力Anthropic 長期強調 Mythos 系列強到不該給一般人用,這套鋪陳某種程度上替管制鋪了路。Kenji 猜測模型之後會以「閹割版」回歸,不會永久消失。
- 同樣的 prompt 對 Opus 不利兩邊都用 xhigh effort、同一句 one-shot 需求。但官方文件提到 Opus 偏好條列清楚的指令,Fable 5 只要給目標就好,所以這場比較本身是偏向 Fable 5 的。
- 過程風格差很多Fable 5 話少、直接動手,跑十七分三十一秒;Opus 4.8 先講設計決策、寫語法檢查、遇到問題會說明,跑二十四分二十三秒。透明度是 Opus 勝。
- 成品高下明顯Opus 的版本管道太窄、字體被切掉,Kenji 只拿到三到四分;Fable 5 的版本有音效、場景轉換與光暈,第一次挑戰就飛到六十四分。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | 這集要讓 Fable 5 與 Opus 4.8 用同一份 prompt 做 3D 皮卡丘版 Flappy Bird,測試是在模型被封禁前跑完的。 |
| 01:38 | 第一次進場看世界盃 | Kenji 踢球二三十年,這次終於帶兒子 Leon 到現場。妹妹 Chloe 選擇去學校,省下一打二的難題。 |
| 05:30 | 球場氣氛與賽事 | 比利時對埃及,當天西雅圖三十一度,場面偏悶。Lukaku 替補上場不到十秒就製造烏龍球,終場一比一。 |
| 07:32 | 兩大模型被封禁 | Fable 5 才推出一個多禮拜,美國商務部就對 Fable 與 Mythos 系列發出口管制,過去這招多半只用在晶片上。 |
| 08:49 | 導火線與官方理由 | 據報導是 Amazon 執行長向政府通報越獄漏洞。Anthropic 回應說同樣的事在其他模型上都做得到,且只有口頭說明、沒有詳細報告。 |
| 09:53 | 政治因素與行銷反噬 | Kenji 認為理由太薄,背後有政治成分;同時 Anthropic 自己長期強調模型危險,也替這個結果加了一把火。 |
| 10:40 | 接下來會怎麼走 | 他預測模型會修改到符合商務部的安全規範後回歸,不會原封不動,也不會走到「最強模型只給特定人使用」的極端。 |
| 11:41 | 實測怎麼設定 | 兩個 Claude Code 視窗並排,左邊 Fable 5、右邊 Opus 4.8,effort level 都設成 xhigh。 |
| 12:12 | 那句 prompt | 要求做 3D 版 Flappy Bird,鳥換成皮卡丘、視覺要有獨特風格,每得十分要有動畫或場景轉換,其餘細節自行決定。 |
| 12:42 | 提示詞風格的差異 | 官方文件說兩系列吃的提示方式不同:Opus 要條列清楚,Fable 5 給目標就好。用同一份 prompt 其實對 Opus 不利。 |
| 13:43 | Fable 5 的做法 | 先載入前端設計 skill,做完自己用 Playwright 檢查中段與結算畫面,改完再跑一次自動駕駛飛到六十分以上。過程說明很少。 |
| 15:16 | Opus 4.8 的做法 | 一開始先交代設計決策與六個場景,額外寫語法檢查檔、提供 debug 網址,遇到問題會講清楚再自己修。 |
| 17:23 | Opus 成品試玩 | 管道太窄、難度過高,字體被切掉還莫名分成兩行。關卡高低有動態變化,但 Kenji 只拿到三到四分,看不到場景轉換。 |
| 18:57 | Fable 5 成品試玩 | 雲朵飄浮、3D 浮雕風格與音效都在,難度適中,場景會依分數切換。第一次挑戰就飛到六十四分。 |
| 21:07 | 遊戲會被動態生成嗎 | 從這次體驗延伸,Kenji 想像未來的內容推薦可能從貼文影片延伸到遊戲,每個人玩到的版本與美術風格都不一樣。 |
| 22:07 | 一次性測試的但書 | 這次結果不代表 Opus 全面較差;條件本來就對 Fable 5 有利。原本要測的精簡 prompt 版本,測到一半就遇上封禁。 |
值得記的話
名詞與人物
| Fable 5 | Anthropic 這次被出口管制的模型之一,這集測試中做出較好玩的成品,只花十七分三十一秒。 |
|---|---|
| Mythos 5 | 與 Fable 同時被列入管制的系列,Anthropic 先前一再強調它強到需要特別注意安全性。 |
| Opus 4.8 | 對照組模型,過程說明詳細、驗證步驟多,但成品難度失衡,這次耗時二十四分二十三秒。 |
| 出口管制 | 美國商務部這次祭出的手段,過去多用於晶片,禁止任何外國人使用受管制的模型。 |
| Andy Jassy | Amazon 執行長,據報導是他向美國政府通報模型可以用簡單方式越獄。 |
| effort level | Claude Code 裡控制模型思考投入程度的設定,這次兩邊都固定在 xhigh。 |
| one-shot prompt | 只給一次需求、不再補充來回的提示方式,這集的測試就是這種形式。 |
| Playwright | 瀏覽器自動化工具,Fable 5 沒被要求就自己拿它驗證遊戲畫面。 |
| Frontier Code benchmark | 他引用的評測,依那份成績,Fable 5 用 medium effort 的表現應該比 xhigh 還好。 |
延伸
- 上一集談過 Fable 5 實際拿來 coding、跑任務的體感,這集是同一條線往下做的實測。
- Kenji 原本在測「Fable 5 搭配 high effort 加上精簡過的 prompt」,測到一半模型就被封禁,這個版本的結果沒能做完。
- 他也提到條列式、講很細的 prompt 會讓 Fable 5 跑上一兩個小時,成果反而不理想,但這集沒有展開細節。
原始出處
- Redeploying Claude Fable 5 — Anthropic佐證筆記裡美國商務部對 Fable 5、Mythos 5 祭出出口管制、Anthropic 被迫全面下架又重新上線的經過,以及起因疑似與 Amazon 通報越獄漏洞有關。