063 · 不訓練模型,改當模型的指揮官
日本新創 Sakana AI 不自己蓋前沿模型,改用一個 7 billion 參數的指揮官去調度 Opus、GPT 與 Gemini,號稱追得上 Fable。這集拆解它的運作原理,也帶上社群回饋與實測結果。
原標題:Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5? | S2E63
重點摘要
- 不比算力,改比組合Sakana AI 2023 年成立、總部在東京,創辦人認為砸錢買 GPU 跟美國一線公司硬拚,最後一定會輸。改走的路是用演化和集體智慧,把現成模型組出新的能力。
- 日本身分是籌碼因為不在中美任何一邊,可以自由取用兩邊的模型,不受出口管制影響。官方發表 Fugu Ultra 時也拿這點當賣點。
- 7 billion 的指揮官請求進來先過一個小模型,由它把任務拆開,分派給 Opus 4.8、GPT 5.5、Gemini 3.1 Pro。對外的 API 格式跟 OpenAI 一樣,原本怎麼呼叫就怎麼呼叫。
- 輸出的是工作流程,不是答案指揮官用 reinforcement learning 訓練,產出三件事——有哪些子任務、每個交給哪個模型、這個工人看得到前面哪幾步的結果。給子模型的是自然語言 prompt,不是寫死的流程;指揮官自己也能被指派成子任務的工人,於是可以一層一層遞迴下去。
- 回饋函數相當陽春工作流程格式錯拿零分,格式對但答案錯拿 0.5 分,答案對拿一分。代表只有能被驗證的任務才吃得到持續進步,品味這種難量化的能力就卡在外面。
- 實測沒有想像中好官方 benchmark 對上 Fable 5 有贏有輸,但實際用起來又慢又燒 token,品質大致跟 Opus 4.8 同級。Kenji 的結論是概念方向對,這一版還沒到位。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Sakana AI 丟出 Fugu Ultra,號稱媲美 Anthropic 的 Fable 與 Mythos 系列,社群立刻炸鍋。 |
| 03:53 | Sakana AI 是誰 | 2023 年成立、總部東京。在美國閉源與中國開源的對抗之外,難得冒出第三邊的玩家。 |
| 04:42 | 不做更大的模型 | 公司核心目標不是蓋更強的模型,而是用演化和集體智慧,把已有的模型組出新的能力。 |
| 04:57 | 為什麼走這條路 | 創辦人受訪講過,日本公司資源受限,比算力注定落後;但也因此能自由使用中美兩邊的模型。 |
| 05:59 | 兩位創辦人 | CEO David Ha 待過 Google Brain 與 Stability AI,CTO Llion Jones 是 Transformer 論文八位共同作者之一。 |
| 06:59 | Google 的人才流失 | 八位作者現在沒有一個留在 Google。Kenji 認為短期會打擊外界信心,長期只要研究體質夠好還是追得上。 |
| 09:03 | 兩種 Fugu | Fugu 是從模型池裡挑一個出來用,Fugu Ultra 才是多個模型互相組合,也是效能比較好的那個。 |
| 09:34 | 指揮官怎麼調度 | 前面掛一個 7 billion 參數的小模型判斷請求,再往後調度御三家的模型一起給答案。 |
| 10:39 | 各家模型的強項 | Sakana 自己的說法是 GPT 系列擅長數學推理,Opus 系列強在寫程式與資安,Gemini 系列則偏事實性回應與科學研究。 |
| 11:39 | 輸出一份工作流程 | 指揮官用 RL 訓練,目標不是討好人類的答案,而是生出子任務、分工,以及每個工人看得到的上下文。 |
| 12:58 | 陽春的回饋函數 | 格式錯零分、答案錯 0.5 分、答案對一分。設計簡單,但目前看起來某種程度上是有效的。 |
| 13:58 | 可驗證的才跑得快 | 數學和程式能被驗證,所以進步得快;前端美醜沒辦法量化打分,這也是品味變稀缺的原因。 |
| 15:16 | 本質是駕馭工程 | 模型本體沒動,只是在外面疊架構。要問的是這套架構會不會被半年後的新模型直接吃掉。 |
| 16:19 | benchmark 怎麼看 | 官方數字對 Fable 5 有贏有輸,但完全碾壓它自己調度的那三個模型。Kenji 提醒多數 benchmark 已經失準。 |
| 17:52 | 又慢又貴 | 社群與自行實測的共識一致:速度慢、吃 token 兇,品質卻沒有明顯勝過 Opus 4.8。 |
| 19:43 | 這間公司會被記得嗎 | Kenji 預期 Sakana AI 本身可能被淡忘,但重新組合既有模型的概念會留下,大廠說不定自己就做了。 |
值得記的話
名詞與人物
| Sakana AI | 2023 年成立、總部在東京的日本 AI 新創,主打把現有模型組合出新能力。 |
|---|---|
| Fugu | 從自家模型池裡挑一個模型出來處理請求,不是這集的重點。 |
| Fugu Ultra | 靠一個小模型指揮多家前沿模型協作的版本,官方宣稱表現可比 Fable 與 Mythos 系列。 |
| 指揮官模型 | Fugu Ultra 前端那個 7 billion 參數的小模型,負責拆子任務、分派模型、決定誰看得到什麼。 |
| 御三家 | 這集指 Fugu Ultra 背後調度的 Opus 4.8、GPT 5.5 與 Gemini 3.1 Pro。 |
| David Ha | Sakana AI 現任 CEO,2016 到 2022 年在 Google Brain,與 Jeff Dean 合作過,之後待過 Stability AI。 |
| Llion Jones | Sakana AI 的 CTO,2017 年 Transformer 那篇論文的八位共同作者之一。 |
| 駕馭工程 | harness engineering,不動模型本體,用外圍架構與工具把輸出做得更好。 |
| FrontierCode、DeepSWE | 節目認為還有指標性、可以繼續看的 benchmark。 |
延伸
- 模型封閉化這條線前幾集聊過:Fable 目前沒辦法被存取,OpenAI 的 GPT 5.6 也被要求先經過美國政府審核才能釋出,OpenAI 表示不希望這變成常態。
- 上一集實測過 3D 皮卡丘版本的 Flappy Bird,這集拿同一個 prompt 對 Fugu Ultra 再跑一次來對照。
- 人才大洗牌只點到沒有展開:2024 年與 Demis Hassabis 一起拿諾貝爾化學獎的 John Jumper 最近也離開了 Google。
原始出處
- Sakana Fugu: One Model to Command Them All — Sakana AI佐證筆記裡 Fugu / Fugu Ultra 不是單一前沿模型,而是用一個模型去調度、組合多個現成模型(如 Opus、GPT、Gemini)完成任務的架構。
- Attention Is All You Need — arXiv佐證筆記裡 Sakana AI 的 CTO Llion Jones 是 2017 年 Transformer 論文八位共同作者之一的說法。