Sakana Fugu Ultra BEATS Fable 5 & GPT-5.5? (Fully Tested)
三句話摘要
Sakana AI 發佈的 Fugu Ultra 多智能體編排系統聲稱媲美 Fable 5,但實際能力接近 GLM 4.2,速度慢且成本高。 Fugu Ultra 是印象深刻的編排系統工程成就,設計品質優異但不是真正的前沿模型,實際應用中往往比 Opus 4.8 和 GPT 4.5 更慢更貴。 架構設計的雙面性:Fugu Ultra 的協調器將任務分解、路由到最合適模型、驗證與合成結果。這種設計在結構化問題(編程基準測試)上超越獨立模型,但在長上下文任務上因為額外的規劃、驗證、模型切換而增加延遲和成本。
重點整理
重點- 1
架構設計的雙面性:Fugu Ultra 的協調器將任務分解、路由到最合適模型、驗證與合成結果。這種設計在結構化問題(編程基準測試)上超越獨立模型,但在長上下文任務上因為額外的規劃、驗證、模型切換而增加延遲和成本。
- 2
基準測試需要理解背景:高分反映的是整個編排系統的性能,而非底層智能與 Fable 5 或 Mythos 5 相當。實際使用中 Fugu Ultra 往往比真正前沿模型更慢、更貴、更不穩定。
- 3
實戰成本效益差:交易桌任務中 Fugu Ultra 花費 $0.51,但 Opus 4.8 只需 $0.31、GPT 4.5 只需 $0.26。Crossy Road 遊戲克隆中 Fugu Ultra 花費 $7.32 和 22 分鐘,而 Opus 4.8 雖花費 $37.79 但品質更優;大多數場景下 GPT 4.5 和 Opus 4.8 成本效益更好。
- 4
工程成就但非真正前沿:Fugu Ultra 本質上協調多個現有模型而非獨立運行,展示了編排系統的威力,但它不是獨立的前沿智能,適合特定場景而非通用替代品。
實用技巧與重點
乾貨- 成本與性能數據:
- 交易桌任務:Fugu Ultra(22k tokens、$0.51)vs Opus 4.8(16k tokens、$0.31)vs GPT 4.5(11k tokens、$0.26)vs GLM 4.2(13k tokens、$0.03)
- Crossy Road 克隆:Fugu Ultra(90k tokens、$7.32、22分鐘)vs Opus 4.8(~100萬tokens、$37.79)
- 國際象棋盲棋:Fugu Ultra 對陣三個前沿模型及 Stockfish 2100 ELO 四連勝
- 模型對比:
- 基準測試優於:Fable 5、Mythos 5、GPT 4.5
- 實際能力相當於:GLM 4.2
- 綜合表現弱於:Fable 5、Mythos 5
- 訪問方式:
- 通過 API 提供商存取
- 歐洲某些地區有限制
- 任務示例:
- 交易桌(前端後端完整實現)、Crossy Road 遊戲克隆、黑洞物理模擬、無限地形飛行模擬器
結論
結論“Fugu Ultra 是印象深刻的編排系統工程成就,設計品質優異但不是真正的前沿模型,實際應用中往往比 Opus 4.8 和 GPT 4.5 更慢更貴。”
完整解析
詳細Sakana AI 最近推出的 Fugu Ultra 一經發佈就引起廣泛關注,因為官方聲稱它能媲美 Fable 5 和 Mythos 5,並避免出口管制風險。在各項基準測試上,Fugu Ultra 確實表現亮眼,甚至在 LiveCodeBench 等測試中超越 Fable 5。但深入使用後發現,現實遠比表面複雜。
Fugu Ultra 的本質不是傳統的單一基礎模型,而是一個多智能體編排系統。它的工作原理是:協調器首先將複雜任務分解成更小的子任務,隨後將這些子任務路由到最適合的模型,再對輸出進行批判性驗證,最後將所有結果合成為最終答案。這種架構在結構化問題上表現出色—特別是在需要仔細檢查和系統化推理的基準測試(如編程基準測試)上,它往往超越許多獨立模型,這就是為什麼基準分數看起來如此令人印象深刻。然而,這種優勢在長上下文、需要快速反應的實際任務上卻變成了劣勢。每一次額外的規劃步驟、每一次驗證通過、每一次模型之間的切換都會引入延遲、成本和潛在的失敗點。
實際應用測試清楚地表明這一點。在構建完整交易桌(包含前端和後端)的任務中,Fugu Ultra 花費 22k tokens 和 $0.51,成本最低,生成的介面最精緻、功能最完整。但相比之下,Opus 4.8 只需 $0.31、GPT 4.5 只需 $0.26,它們都提供了更好的速度和成本效益平衡。在 Crossy Road 遊戲克隆測試中,雖然 Fugu Ultra 相對快速便宜($7.32、22分鐘),但存在倒轉機制錯誤和攝像頭系統不穩定等問題。相比之下,Opus 4.8 雖然花費 $37.79 和 100 萬 tokens,但整體品質更高、問題更少。在黑洞模擬和飛行模擬器等複雜視覺任務上,Fugu Ultra 確實展現出出色的品質,但這些優勢往往被高成本所抵消。
最終,Fugu Ultra 本質上是通過協調多個現有模型來完成工作,而非進行獨立的智能推理。雖然這確實是一個工程成就,展示了編排、路由和驗證系統的力量,但它不應被理解為新的前沿智能。在現實世界中,它往往比真正的前沿模型更慢、更貴、更不一致。如果 Sakana 繼續改進編排系統並訓練更強的基礎模型,未來可能會有更優的版本,但目前 Fugu Ultra 最好被視為一個強大的工程系統,適合特定場景而非通用替代品。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


