KeyFrame內部研究專用

Sakana Fugu Ultra BEATS Fable 5 & GPT-5.5? (Fully Tested)

World of AI·6月23日週二·11 min英文

三句話摘要

Sakana AI 發佈的 Fugu Ultra 多智能體編排系統聲稱媲美 Fable 5,但實際能力接近 GLM 4.2,速度慢且成本高。 Fugu Ultra 是印象深刻的編排系統工程成就,設計品質優異但不是真正的前沿模型,實際應用中往往比 Opus 4.8 和 GPT 4.5 更慢更貴。 架構設計的雙面性:Fugu Ultra 的協調器將任務分解、路由到最合適模型、驗證與合成結果。這種設計在結構化問題(編程基準測試)上超越獨立模型,但在長上下文任務上因為額外的規劃、驗證、模型切換而增加延遲和成本。

重點整理

重點
  • 1

    架構設計的雙面性:Fugu Ultra 的協調器將任務分解、路由到最合適模型、驗證與合成結果。這種設計在結構化問題(編程基準測試)上超越獨立模型,但在長上下文任務上因為額外的規劃、驗證、模型切換而增加延遲和成本。

  • 2

    基準測試需要理解背景:高分反映的是整個編排系統的性能,而非底層智能與 Fable 5 或 Mythos 5 相當。實際使用中 Fugu Ultra 往往比真正前沿模型更慢、更貴、更不穩定。

  • 3

    實戰成本效益差:交易桌任務中 Fugu Ultra 花費 $0.51,但 Opus 4.8 只需 $0.31、GPT 4.5 只需 $0.26。Crossy Road 遊戲克隆中 Fugu Ultra 花費 $7.32 和 22 分鐘,而 Opus 4.8 雖花費 $37.79 但品質更優;大多數場景下 GPT 4.5 和 Opus 4.8 成本效益更好。

  • 4

    工程成就但非真正前沿:Fugu Ultra 本質上協調多個現有模型而非獨立運行,展示了編排系統的威力,但它不是獨立的前沿智能,適合特定場景而非通用替代品。

實用技巧與重點

乾貨
  • 成本與性能數據:
  • 交易桌任務:Fugu Ultra(22k tokens、$0.51)vs Opus 4.8(16k tokens、$0.31)vs GPT 4.5(11k tokens、$0.26)vs GLM 4.2(13k tokens、$0.03)
  • Crossy Road 克隆:Fugu Ultra(90k tokens、$7.32、22分鐘)vs Opus 4.8(~100萬tokens、$37.79)
  • 國際象棋盲棋:Fugu Ultra 對陣三個前沿模型及 Stockfish 2100 ELO 四連勝
  • 模型對比:
  • 基準測試優於:Fable 5、Mythos 5、GPT 4.5
  • 實際能力相當於:GLM 4.2
  • 綜合表現弱於:Fable 5、Mythos 5
  • 訪問方式:
  • 通過 API 提供商存取
  • 歐洲某些地區有限制
  • 任務示例:
  • 交易桌(前端後端完整實現)、Crossy Road 遊戲克隆、黑洞物理模擬、無限地形飛行模擬器

結論

結論

Fugu Ultra 是印象深刻的編排系統工程成就,設計品質優異但不是真正的前沿模型,實際應用中往往比 Opus 4.8 和 GPT 4.5 更慢更貴。

完整解析

詳細

Sakana AI 最近推出的 Fugu Ultra 一經發佈就引起廣泛關注,因為官方聲稱它能媲美 Fable 5 和 Mythos 5,並避免出口管制風險。在各項基準測試上,Fugu Ultra 確實表現亮眼,甚至在 LiveCodeBench 等測試中超越 Fable 5。但深入使用後發現,現實遠比表面複雜。

Fugu Ultra 的本質不是傳統的單一基礎模型,而是一個多智能體編排系統。它的工作原理是:協調器首先將複雜任務分解成更小的子任務,隨後將這些子任務路由到最適合的模型,再對輸出進行批判性驗證,最後將所有結果合成為最終答案。這種架構在結構化問題上表現出色—特別是在需要仔細檢查和系統化推理的基準測試(如編程基準測試)上,它往往超越許多獨立模型,這就是為什麼基準分數看起來如此令人印象深刻。然而,這種優勢在長上下文、需要快速反應的實際任務上卻變成了劣勢。每一次額外的規劃步驟、每一次驗證通過、每一次模型之間的切換都會引入延遲、成本和潛在的失敗點。

實際應用測試清楚地表明這一點。在構建完整交易桌(包含前端和後端)的任務中,Fugu Ultra 花費 22k tokens 和 $0.51,成本最低,生成的介面最精緻、功能最完整。但相比之下,Opus 4.8 只需 $0.31、GPT 4.5 只需 $0.26,它們都提供了更好的速度和成本效益平衡。在 Crossy Road 遊戲克隆測試中,雖然 Fugu Ultra 相對快速便宜($7.32、22分鐘),但存在倒轉機制錯誤和攝像頭系統不穩定等問題。相比之下,Opus 4.8 雖然花費 $37.79 和 100 萬 tokens,但整體品質更高、問題更少。在黑洞模擬和飛行模擬器等複雜視覺任務上,Fugu Ultra 確實展現出出色的品質,但這些優勢往往被高成本所抵消。

最終,Fugu Ultra 本質上是通過協調多個現有模型來完成工作,而非進行獨立的智能推理。雖然這確實是一個工程成就,展示了編排、路由和驗證系統的力量,但它不應被理解為新的前沿智能。在現實世界中,它往往比真正的前沿模型更慢、更貴、更不一致。如果 Sakana 繼續改進編排系統並訓練更強的基礎模型,未來可能會有更優的版本,但目前 Fugu Ultra 最好被視為一個強大的工程系統,適合特定場景而非通用替代品。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。