I Battle Tested Sakana Fugu's Fable Killer
三句話摘要
Sakana AI 推出的 Fugu Ultra 多模型編排系統性能評測——驗證其聲稱與 Fable 等同效能的真實性。 Fugu Ultra 展示多模型編排的潛力與 AI 產業的演進方向,但目前的性能-成本比不夠優,真正的價值將在於開發者學會為不同任務動態選擇最適模型組合的能力。 Fugu 是編排系統,非獨立模型
重點整理
重點- 1
Fugu 是編排系統,非獨立模型
- 2
Fugu Ultra 不是比 Fable 更強的語言模型,而是包含一個「管理器」模型,會接收任務、分析複雜度,然後將不同部分分配給最適合的專門模型(Opus 寫作、GPT 除錯、Gemini 研究)。這套架構與 Claude Code 的子代理系統邏輯相同,只是跨越不同廠商模型。
- 3
多模型編排的兩個核心環節
- 4
第一是任務分配——決定各部分由哪個模型執行;第二是結果合成——用另一個 LLM 整合所有回應後呈現。這與 OpenRouter Fusion API 不同,後者是並行發送相同提示給多個模型,而非序列分配任務。
- 5
性能與成本的嚴重反差
- 6
36 項任務平手、2 項 Opus 勝出,但 Fugu 需要 357 分鐘 vs Opus 80 分鐘,成本 $50 vs $10。甚至簡單任務(Opus 6 秒)Fugu 也要多分鐘完成,說明編排延遲的實質影響。
- 7
未來 AI 經濟的關鍵技能
- 8
隨著模型成本可能上升、多廠商提供不同強項,學會針對各類任務挑選性價比最高的模型組合,將成為 AI 開發必備能力。
實用技巧與重點
乾貨- Fugu Ultra 測試數據
- 任務數量:38 項
- 結果:36 平手、2 場 Opus 4.8 獲勝
- 總耗時:Fugu 357 分鐘、Opus 80 分鐘(Fugu 慢 4.5 倍)
- 簡單任務響應時間:Opus 6 秒 vs Fugu 多分鐘
- 總成本:Fugu $50、Opus $10(Fugu 貴 5 倍)
- 訂閱與計費
- Sakana.ai 提供訂閱:$100/月、$200/月
- 也支持按量付費 API 計費
- 講者 $200/月方案一週內達 34% 使用限額
- Fugu 包含的模型
- Claude Opus、GPT、Gemini、其他前沿模型
- 測試場景
- 謎題、邏輯陷阱、規格理解、複雜演算法等 4 類
- 集成方式
- 可在 Claude Code 中使用(需要配置檔案和 API 密鑰)
- 資源已上傳至講者免費社群(需 markdown 配置檔案)
結論
結論“Fugu Ultra 展示多模型編排的潛力與 AI 產業的演進方向,但目前的性能-成本比不夠優,真正的價值將在於開發者學會為不同任務動態選擇最適模型組合的能力。”
完整解析
詳細Sakana AI 推出的 Fugu Ultra 在社群中掀起波瀾,聲稱能透過多模型編排達到與 Fable、Mythos 等同的性能。講者決定親自驗證這項聲明的真實性。
Fugu 的核心創新不在於開發更強大的單一 LLM,而是一套智慧編排系統。當用戶提交任務時,一個「管理器」模型會分析需求的複雜度與特性,然後動態決定将任務的各個部分分配給不同的專門模型。例如,寫作任務可能由 Claude 處理,程式碼除錯由 GPT 負責,事實查證交給 Gemini。這個概念對 AI 開發者而言並不陌生——講者每天在使用 Claude Code 和多個模型時就是手動執行類似的協調工作。Fugu 的價值在於將這種策略自動化,無需人工決策哪個模型最適合。
為了進行公正評估,講者設計了一套嚴格的測試框架:38 項涵蓋謎題、邏輯陷阱、規格理解和複雜演算法的任務,由 Claude 進行盲測評分以排除偏見。Fugu Ultra 與 Opus 4.8 在任務完成質量上基本平手(36 項平手、2 項 Opus 略勝)。然而,性能與成本的差距令人失望:Fugu 耗時 357 分鐘完成所有測試,Opus 僅需 80 分鐘;Fugu 花費 $50,Opus 僅 $10。特別值得注意的是延遲的普遍性——Opus 能在 6 秒內完成的簡單任務,Fugu 往往需要多分鐘。
講者也在實際工作中測試了 Fugu。雖然在 Claude Code 中整合順利(功能上沒有問題),但使用體驗遠低於單用 Opus 或 Fable,主要因為等待時間過長導致工作流中斷。從商業層面,Sakana 的訂閱方案($100 或 $200 月費)消耗速度遠快於 Claude Code,講者在 $200/月方案下一週內即達 34% 限額。
講者的結論是,Fugu 代表了 AI 產業的未來方向——擺脫單一廠商依賴,透過動態編排實現最優成本效益。這個方向確實有價值,OpenRouter 的 Fusion API 也在推行類似理念。但在目前階段,Fugu 對其使用場景的收益與成本仍不匹配。他認為隨著模型成本可能上升、新一代模型推出,掌握模型選擇與編排的單位經濟優化將成為 AI 開發的核心競爭力。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


