全部集數

063 · 不訓練模型,改當模型的指揮官

日本新創 Sakana AI 不自己蓋前沿模型,改用一個 7 billion 參數的指揮官去調度 Opus、GPT 與 Gemini,號稱追得上 Fable。這集拆解它的運作原理,也帶上社群回饋與實測結果。

2026-06-2821:42模型Agent研究產業觀察看原片

原標題:Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5? | S2E63

重點摘要

  • 不比算力,改比組合Sakana AI 2023 年成立、總部在東京,創辦人認為砸錢買 GPU 跟美國一線公司硬拚,最後一定會輸。改走的路是用演化和集體智慧,把現成模型組出新的能力。
  • 日本身分是籌碼因為不在中美任何一邊,可以自由取用兩邊的模型,不受出口管制影響。官方發表 Fugu Ultra 時也拿這點當賣點。
  • 7 billion 的指揮官請求進來先過一個小模型,由它把任務拆開,分派給 Opus 4.8、GPT 5.5、Gemini 3.1 Pro。對外的 API 格式跟 OpenAI 一樣,原本怎麼呼叫就怎麼呼叫。
  • 輸出的是工作流程,不是答案指揮官用 reinforcement learning 訓練,產出三件事——有哪些子任務、每個交給哪個模型、這個工人看得到前面哪幾步的結果。給子模型的是自然語言 prompt,不是寫死的流程;指揮官自己也能被指派成子任務的工人,於是可以一層一層遞迴下去。
  • 回饋函數相當陽春工作流程格式錯拿零分,格式對但答案錯拿 0.5 分,答案對拿一分。代表只有能被驗證的任務才吃得到持續進步,品味這種難量化的能力就卡在外面。
  • 實測沒有想像中好官方 benchmark 對上 Fable 5 有贏有輸,但實際用起來又慢又燒 token,品質大致跟 Opus 4.8 同級。Kenji 的結論是概念方向對,這一版還沒到位。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Sakana AI 丟出 Fugu Ultra,號稱媲美 Anthropic 的 Fable 與 Mythos 系列,社群立刻炸鍋。
03:53Sakana AI 是誰2023 年成立、總部東京。在美國閉源與中國開源的對抗之外,難得冒出第三邊的玩家。
04:42不做更大的模型公司核心目標不是蓋更強的模型,而是用演化和集體智慧,把已有的模型組出新的能力。
04:57為什麼走這條路創辦人受訪講過,日本公司資源受限,比算力注定落後;但也因此能自由使用中美兩邊的模型。
05:59兩位創辦人CEO David Ha 待過 Google Brain 與 Stability AI,CTO Llion Jones 是 Transformer 論文八位共同作者之一。
06:59Google 的人才流失八位作者現在沒有一個留在 Google。Kenji 認為短期會打擊外界信心,長期只要研究體質夠好還是追得上。
09:03兩種 FuguFugu 是從模型池裡挑一個出來用,Fugu Ultra 才是多個模型互相組合,也是效能比較好的那個。
09:34指揮官怎麼調度前面掛一個 7 billion 參數的小模型判斷請求,再往後調度御三家的模型一起給答案。
10:39各家模型的強項Sakana 自己的說法是 GPT 系列擅長數學推理,Opus 系列強在寫程式與資安,Gemini 系列則偏事實性回應與科學研究。
11:39輸出一份工作流程指揮官用 RL 訓練,目標不是討好人類的答案,而是生出子任務、分工,以及每個工人看得到的上下文。
12:58陽春的回饋函數格式錯零分、答案錯 0.5 分、答案對一分。設計簡單,但目前看起來某種程度上是有效的。
13:58可驗證的才跑得快數學和程式能被驗證,所以進步得快;前端美醜沒辦法量化打分,這也是品味變稀缺的原因。
15:16本質是駕馭工程模型本體沒動,只是在外面疊架構。要問的是這套架構會不會被半年後的新模型直接吃掉。
16:19benchmark 怎麼看官方數字對 Fable 5 有贏有輸,但完全碾壓它自己調度的那三個模型。Kenji 提醒多數 benchmark 已經失準。
17:52又慢又貴社群與自行實測的共識一致:速度慢、吃 token 兇,品質卻沒有明顯勝過 Opus 4.8。
19:43這間公司會被記得嗎Kenji 預期 Sakana AI 本身可能被淡忘,但重新組合既有模型的概念會留下,大廠說不定自己就做了。

值得記的話

所以在資源上面,絕對是沒辦法跟這些美國一線公司去比拼的。

05:12

但是不用被出口管制,這個真的是相當諷刺。

10:06

你看到這些新的架構出來的時候,你要想這個架構會不會被六個月的模型能力取代。

16:03

可以比一個大模型還強的,就是三個臭皮匠勝過一個諸葛亮的這個概念。

17:36

我就先儲值了二十塊美金去用一個 prompt 去產生結果,二十塊已經燒完了,結果它還在 debug。

19:13

名詞與人物

Sakana AI2023 年成立、總部在東京的日本 AI 新創,主打把現有模型組合出新能力。
Fugu從自家模型池裡挑一個模型出來處理請求,不是這集的重點。
Fugu Ultra靠一個小模型指揮多家前沿模型協作的版本,官方宣稱表現可比 Fable 與 Mythos 系列。
指揮官模型Fugu Ultra 前端那個 7 billion 參數的小模型,負責拆子任務、分派模型、決定誰看得到什麼。
御三家這集指 Fugu Ultra 背後調度的 Opus 4.8、GPT 5.5 與 Gemini 3.1 Pro。
David HaSakana AI 現任 CEO,2016 到 2022 年在 Google Brain,與 Jeff Dean 合作過,之後待過 Stability AI。
Llion JonesSakana AI 的 CTO,2017 年 Transformer 那篇論文的八位共同作者之一。
駕馭工程harness engineering,不動模型本體,用外圍架構與工具把輸出做得更好。
FrontierCode、DeepSWE節目認為還有指標性、可以繼續看的 benchmark。

延伸

  • 模型封閉化這條線前幾集聊過:Fable 目前沒辦法被存取,OpenAI 的 GPT 5.6 也被要求先經過美國政府審核才能釋出,OpenAI 表示不希望這變成常態。
  • 上一集實測過 3D 皮卡丘版本的 Flappy Bird,這集拿同一個 prompt 對 Fugu Ultra 再跑一次來對照。
  • 人才大洗牌只點到沒有展開:2024 年與 Demis Hassabis 一起拿諾貝爾化學獎的 John Jumper 最近也離開了 Google。

原始出處