KeyFrame內部研究專用

I Battle Tested Sakana Fugu's Fable Killer

Nate Herk·6月23日週二·12 min英文

三句話摘要

Sakana AI 推出的 Fugu Ultra 多模型編排系統性能評測——驗證其聲稱與 Fable 等同效能的真實性。 Fugu Ultra 展示多模型編排的潛力與 AI 產業的演進方向,但目前的性能-成本比不夠優,真正的價值將在於開發者學會為不同任務動態選擇最適模型組合的能力。 Fugu 是編排系統,非獨立模型

重點整理

重點
  • 1

    Fugu 是編排系統,非獨立模型

  • 2

    Fugu Ultra 不是比 Fable 更強的語言模型,而是包含一個「管理器」模型,會接收任務、分析複雜度,然後將不同部分分配給最適合的專門模型(Opus 寫作、GPT 除錯、Gemini 研究)。這套架構與 Claude Code 的子代理系統邏輯相同,只是跨越不同廠商模型。

  • 3

    多模型編排的兩個核心環節

  • 4

    第一是任務分配——決定各部分由哪個模型執行;第二是結果合成——用另一個 LLM 整合所有回應後呈現。這與 OpenRouter Fusion API 不同,後者是並行發送相同提示給多個模型,而非序列分配任務。

  • 5

    性能與成本的嚴重反差

  • 6

    36 項任務平手、2 項 Opus 勝出,但 Fugu 需要 357 分鐘 vs Opus 80 分鐘,成本 $50 vs $10。甚至簡單任務(Opus 6 秒)Fugu 也要多分鐘完成,說明編排延遲的實質影響。

  • 7

    未來 AI 經濟的關鍵技能

  • 8

    隨著模型成本可能上升、多廠商提供不同強項,學會針對各類任務挑選性價比最高的模型組合,將成為 AI 開發必備能力。

實用技巧與重點

乾貨
  • Fugu Ultra 測試數據
  • 任務數量:38 項
  • 結果:36 平手、2 場 Opus 4.8 獲勝
  • 總耗時:Fugu 357 分鐘、Opus 80 分鐘(Fugu 慢 4.5 倍)
  • 簡單任務響應時間:Opus 6 秒 vs Fugu 多分鐘
  • 總成本:Fugu $50、Opus $10(Fugu 貴 5 倍)
  • 訂閱與計費
  • Sakana.ai 提供訂閱:$100/月、$200/月
  • 也支持按量付費 API 計費
  • 講者 $200/月方案一週內達 34% 使用限額
  • Fugu 包含的模型
  • Claude Opus、GPT、Gemini、其他前沿模型
  • 測試場景
  • 謎題、邏輯陷阱、規格理解、複雜演算法等 4 類
  • 集成方式
  • 可在 Claude Code 中使用(需要配置檔案和 API 密鑰)
  • 資源已上傳至講者免費社群(需 markdown 配置檔案)

結論

結論

Fugu Ultra 展示多模型編排的潛力與 AI 產業的演進方向,但目前的性能-成本比不夠優,真正的價值將在於開發者學會為不同任務動態選擇最適模型組合的能力。

完整解析

詳細

Sakana AI 推出的 Fugu Ultra 在社群中掀起波瀾,聲稱能透過多模型編排達到與 Fable、Mythos 等同的性能。講者決定親自驗證這項聲明的真實性。

Fugu 的核心創新不在於開發更強大的單一 LLM,而是一套智慧編排系統。當用戶提交任務時,一個「管理器」模型會分析需求的複雜度與特性,然後動態決定将任務的各個部分分配給不同的專門模型。例如,寫作任務可能由 Claude 處理,程式碼除錯由 GPT 負責,事實查證交給 Gemini。這個概念對 AI 開發者而言並不陌生——講者每天在使用 Claude Code 和多個模型時就是手動執行類似的協調工作。Fugu 的價值在於將這種策略自動化,無需人工決策哪個模型最適合。

為了進行公正評估,講者設計了一套嚴格的測試框架:38 項涵蓋謎題、邏輯陷阱、規格理解和複雜演算法的任務,由 Claude 進行盲測評分以排除偏見。Fugu Ultra 與 Opus 4.8 在任務完成質量上基本平手(36 項平手、2 項 Opus 略勝)。然而,性能與成本的差距令人失望:Fugu 耗時 357 分鐘完成所有測試,Opus 僅需 80 分鐘;Fugu 花費 $50,Opus 僅 $10。特別值得注意的是延遲的普遍性——Opus 能在 6 秒內完成的簡單任務,Fugu 往往需要多分鐘。

講者也在實際工作中測試了 Fugu。雖然在 Claude Code 中整合順利(功能上沒有問題),但使用體驗遠低於單用 Opus 或 Fable,主要因為等待時間過長導致工作流中斷。從商業層面,Sakana 的訂閱方案($100 或 $200 月費)消耗速度遠快於 Claude Code,講者在 $200/月方案下一週內即達 34% 限額。

講者的結論是,Fugu 代表了 AI 產業的未來方向——擺脫單一廠商依賴,透過動態編排實現最優成本效益。這個方向確實有價值,OpenRouter 的 Fusion API 也在推行類似理念。但在目前階段,Fugu 對其使用場景的收益與成本仍不匹配。他認為隨著模型成本可能上升、新一代模型推出,掌握模型選擇與編排的單位經濟優化將成為 AI 開發的核心競爭力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。