日本 Sakana AI 用「調度器」打前沿模型:Fugu Ultra v2 在池子裡沒放最強模型,分數卻更高
2026年9月13日
2026 年 9 月 11 日,Sakana AI 推出 Fugu Max 與 Fugu Ultra v2。它們不是單一大模型,而是被訓練來「把任務分派給其他模型再縫合答案」的調度器。最刺眼的一點:Ultra v2 的模型池裡刻意不放當前最強的三個系統,成績卻宣稱贏過它們。
一位在新竹做 SaaS 的技術長給我看過一張表:他們產品每個月的 LLM 帳單,從去年十月的四萬多塊,漲到今年八月的二十七萬。功能沒增加多少,使用者成長了三倍,但成本成長了六倍——因為團隊在追求品質的過程中,一路把模型往最貴的那一檔換。
「我知道有些請求根本不需要用到那麼強的模型,」他說,「但要一個一個判斷太麻煩了。」
2026 年 9 月 11 日,日本的 Sakana AI 端出的東西,恰好就是在回答這個問題。
事件背景
Sakana AI 發布了 Fugu Max 與 Fugu Ultra v2。它們不是傳統意義上的新模型——Fugu 是一個調度器(orchestrator):一個被訓練來把任務分派給其他模型、再把答案縫合起來的語言模型。你送出一個請求給一個 API,Fugu 在背後決定池子裡的哪些模型該做這份工,必要時還會遞迴呼叫自己的實例。
這條路線 Sakana 走了一段時間。這家公司從成立起就不走「把模型做更大」的主流路線,而是研究模型之間怎麼合作、怎麼演化。Fugu 系列是這個理念第一次做成商業產品。
官方文章的標題是「Orchestrating the Pareto Frontier」——編排帕累托前緣。這句話說出了它的企圖:不是在單一維度上超越誰,而是在「成本與品質」這張圖上,把可行解的邊界往外推。
本次重點
- 發布日期:2026 年 9 月 11 日,兩個型號同時推出。
- Fugu Max(性價比取向):每百萬輸入 token 2 美元、輸出 6 美元。官方稱比 Sonnet 5、GPT-5.6 Terra 與 Kimi K3 低 40% 到 60%。模型池整合了「前所未有數量」的開放權重與專用模型,包含透過與 NVIDIA 合作納入的 Nemotron 系列。官方稱它在 Terminal Bench 2.1、SWEFish 等六項基準上取得最佳總體成績。
- Fugu Ultra v2(品質取向):設計給複雜推理、自主研究與全端軟體工程。官方揭露的分數包括 Chartography(視覺推理與資料判讀)48.3,對比 Opus 5 的 27.3 與 Fable 5 的 29.5;DeepSWE 74.3,官方稱勝過每 token 貴上三到五倍的模型。
- 最值得注意的一句話:Sakana 表示 Fugu Ultra v2 的代理池中不包含 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra——當前最強的三個系統——卻仍宣稱在基準上勝過它們。
這些數字全部來自 Sakana 官方發布頁,屬廠商自評,尚無獨立第三方複驗。看的時候請保留合理懷疑。
市場影響分析
對台灣使用者:短期內幾乎無感,因為 Fugu 是給開發者用的 API,不是消費級聊天介面。但如果它證明可行,你會在別的地方感受到——你常用的那些 AI 應用,成本結構會改善,而成本改善最終會反映在訂閱價格或免費額度上。
對企業應用:這則新聞對 CTO 的意義比對工程師大。過去兩年企業導入 LLM 的典型路徑是「先挑一個最強的模型把功能做出來,之後再說」,而「之後」往往就是帳單失控的那一天。調度器提供了第三條路:不必自己寫一套路由邏輯(那很難維護,模型一更新就全部重調),也不必單押一家供應商。
但要提醒兩個現實問題。第一是可觀測性:當一個請求背後可能經過三個模型,出問題時你怎麼知道是哪一層錯了?這件事的除錯成本比單一模型高一個量級。第二是穩定性:模型池的組成會變(官方自己就強調 Ultra v2 換掉了池子內容),而池子一變,你的輸出品質也可能跟著變,這對需要一致性的產品是風險。導入前一定要問清楚版本凍結(version pinning)的機制。
對開發者:技術上最有意思的一點是「遞迴呼叫自己的實例」。這代表 Fugu 不只是一層路由表,而是可以做多層分解——把一個大任務拆成子任務、子任務再拆。這跟目前主流的 agent 框架(見我們寫過的 AI Agent 是什麼)在概念上重疊,差別是 Sakana 把編排能力訓練進模型本身,而不是寫在外部的程式碼裡。
哪一種比較好?現在下定論太早。外部編排的優點是可控、可讀、可測試;模型內建編排的優點是不必人工維護規則。我的直覺是兩者最後會混用——粗粒度的流程用程式碼控,細粒度的模型選擇交給調度器。
未來發展趨勢
第一,「用哪個模型」會逐漸變成基礎設施問題,而不是產品決策。 就像你今天不會為了每個 HTTP 請求手動挑一台伺服器一樣,未來多數應用不會為每個請求手動挑模型。誰做好這層抽象,誰就拿到一個很有價值的位置。
第二,開源與專用模型的價值會被重新定價。 如果組織得好的中等模型池能贏過單一前沿模型,那麼一個在特定任務上很強的小模型,價值就不再只是「便宜的替代品」。這對台灣做垂直領域模型的團隊是正面訊號。
第三,benchmark 的可信度會受到更多挑戰。 當廠商同時控制「模型池組成」與「路由策略」,benchmark 分數的可調空間變得很大。我預期接下來會有更多關於「調度器是不是在針對測試集最佳化」的討論,這是健康的。
TheAI學院 總結與評語
我在新竹那位技術長的辦公室裡想過一個問題:如果他當初有一個夠聰明的路由層,那二十七萬的帳單會變成多少?
答案不知道,但方向很清楚——他們付的錢裡,有很大一部分是為了「不想花時間判斷」而支付的保險費。用最貴的模型處理所有請求,是一種買安心的行為。而 Sakana 的主張,本質上是把這份安心變成可以外包的服務。
對台灣的開發團隊,我的具體建議是:
別急著整包搬過去,但一定要做 A/B。 挑你產品裡量最大、但品質要求不是最高的那條流程(客服第一線回覆、內容分類、摘要生成都是典型),用 Fugu Max 跑兩週,比較成本與品質。這種實驗的成本很低,結論卻能直接換成錢。
如果你要用,先把可觀測性做起來。 記下每個請求走了哪條路徑、花了多少 token、用了多久。沒有這些紀錄,你會在某天品質下降時完全無法排查。
最後,這件事對台灣的產業意義比對個人大。 我們不太可能在基礎模型的軍備競賽裡贏,但「怎麼把有限的運算資源組織得最好」,是一個完全可以競爭的題目——而且它更接近台灣擅長的那種工程紀律。想找適合串進工作流的模型與工具,可以從站上的 AI 開發者工具 逛起,也可以看看 提示詞範本 有沒有能直接套用的起點。
評語:Sakana 賭的是「組織勝過單點能力」,這個論點如果成立,對資源有限的團隊是解放——你不必比誰燒得起錢,可以比誰編排得好。但所有數字目前都是廠商自評,而且模型池會變動,導入前務必自己跑過 A/B,並先把可觀測性做起來。
資料來源
- Sakana AI — Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier
- MarkTechPost — Sakana AI Launches Fugu Max and Fugu Ultra v2(2026-09-10)
- DataNorth — Sakana AI launches Fugu Max and Fugu Ultra v2
本文依公開資訊整理,以官方為準。文中所有基準分數與價格比較皆為 Sakana AI 官方發布之自評數據,尚無獨立第三方複驗。
常見問題
什麼叫「調度器模型」?
它本身也是一個語言模型,但被訓練來做的事是路由:收到請求後判斷該交給池子裡的哪個模型處理,再把各方的答案縫合成最終輸出,必要時還會遞迴呼叫自己的實例。對使用者來說介面不變——你還是打一個 API,只是背後有好幾個模型在分工。
Fugu Max 跟 Fugu Ultra v2 差在哪?
兩者共用同一套核心調度架構,但任務取向不同。Fugu Max 主打性價比,每百萬輸入 token 2 美元、輸出 6 美元,官方稱比 Sonnet 5、GPT-5.6 Terra 與 Kimi K3 低 40% 到 60%;Fugu Ultra v2 主打品質優先,定價較高,設計給複雜推理、自主研究與全端軟體工程。
「池子裡沒放最強模型」為什麼重要?
Sakana 表示 Fugu Ultra v2 的代理池中不含 Claude Fable 5、Fable 5.1 或 GPT-6 Astra,卻仍宣稱在多項基準上勝過這三者。如果站得住腳,這代表在某些任務上,把數個中等模型組織好,勝過單押一個最強模型——這對成本結構的意義很大。
台灣團隊現在該換過去嗎?
不建議直接替換,但值得做 A/B 測試。調度器的價值高度取決於你的任務分布:任務類型越多樣、越能被拆解,路由的效益越明顯;如果你的產品只做一件很窄的事,直接挑一個最合適的模型通常更簡單也更好除錯。
資料來源:TheAI學院編輯團隊原創