KeyFrame內部研究專用

The State of Model Routing — NVIDIA, Cognition, OpenRouter

AI Engineer·8月6日週四·48 min中文

三句話摘要

AI時代的多模型路由策略——如何在成本和性能間取得平衡。 多模型路由的核心不是找最小的模型,而是透過智慧協作與快取優化,讓不同能力的模型各展所長,在成本與性能間找到最優曲線。 反直覺的協作優勢:更聰明的模型在委託工作時表現更好。不是用最小的模型完成所有任務,而是讓前沿模型進行監督與複雜決策,將實施細節委託給較小(或開源)模型。這樣既便宜又更全面——例如派三個子代理探索程式碼庫,可能比單個大模型直接探索更徹底。

重點整理

重點
  • 1

    反直覺的協作優勢:更聰明的模型在委託工作時表現更好。不是用最小的模型完成所有任務,而是讓前沿模型進行監督與複雜決策,將實施細節委託給較小(或開源)模型。這樣既便宜又更全面——例如派三個子代理探索程式碼庫,可能比單個大模型直接探索更徹底。

  • 2

    模型各有專長,不存在唯一最優:每個模型根據其訓練語料庫在不同子領域有不同優勢(如資料視覺化、程式編碼、模型構建)。簡單看編碼基準分數高就認定該模型全面最優是誤區,路由系統必須深入理解不同模型的行為模式,才能適配具體任務。

  • 3

    任務複雜度動態變化,路由也要動態調整:基於任務類型的靜態路由很脆弱。真實場景中用戶問題會逐步深化(先問架構理解→再請實現功能→再要測試調試),複雜度不斷變化,需要一個主前端代理持續監控,判斷何時需要切換到更聰明的模型。

  • 4

    快取和上下文壓縮是成本決定因素:多模型系統容易無意中增加成本(每個模型都讀同一文件= 費用×3)。透過上下文預設只指向一個模型、使用壓縮和文件引用、探針檢測幻覺程度,可大幅降低無謂的令牌消耗。快取命中率和持續時間(通常5分鐘)對成本的影響往往超過簡單的模型替換。

實用技巧與重點

乾貨
  • 涉及的模型與工具:
  • Neotron 模型(NVIDIA,開源權重+配方)
  • Fable 模型系列(前沿模型)
  • Devon(Cognition AI軟體工程師)
  • Fusion(Cognition 路由模型,性能媲美 Fable 但成本低 40%)
  • Open Router 自動路由器、Pareto Frontier 編碼、Fusion 功能
  • OpenClaw 應用(心跳機制問題觸發路由爆發)
  • 具體數字與成本指標:
  • Fusion 成本相對 Fable 等級智慧降低 40%
  • 多模型編排準確率可提升約 10%(取決於模型池和任務)
  • Opus 性能約為 Haiku 的 3 倍,但成本只有 Haiku 的十分之一
  • 上下文窗口建議:不超過 20 萬個令牌(最理想 10 萬以下),超過此值性能如斷崖式下跌
  • KV 快取價格約為原始令牌的 1/10
  • 快取預設刷新週期約 5 分鐘
  • 方法與技術:
  • 上下文壓縮(保留狀態、文件引用代替全文傳遞)
  • KV 快取感知路由、Sidecar 架構(主代理 + 輔助代理,共用快取)
  • 探針技術(Probe)檢測模型內部困惑度和幻覺程度
  • 強化學習訓練模型協作與委託能力
  • 自動提示調整(根據生產使用信號持續優化)
  • 自託管 vs API 提供者成本模型差異

結論

結論

多模型路由的核心不是找最小的模型,而是透過智慧協作與快取優化,讓不同能力的模型各展所長,在成本與性能間找到最優曲線。

完整解析

詳細

AI 產品在生產環境中部署時,面臨一個核心矛盾:前沿模型性能最強但成本極高,而小型或開源模型成本低但能力受限。業界正在探索「多模型路由」作為解決方案——即動態決定將哪些任務分配給哪些模型,以在成本與性能間取得最優平衡。

Cognition、NVIDIA、Open Router 等公司的從業者指出,這個領域仍処於早期探索階段。傳統的做法是按任務類型靜態分類(小模型做簡單任務,大模型做複雜任務),但實踐中這種方式很脆弱。更有效的策略是讓前沿大模型扮演協調者與監督者的角色——進行複雜決策和高階規劃——同時將具體實施工作委託給成本較低的小模型或開源模型。看似反直覺的是,這種分工往往能獲得更好的結果:大模型因為更聰慧,懂得更精準地指導;小模型因為成本低,可以被派遣多個副本並行探索,甚至比單個大模型直接操作還要全面。

Cognition 開發的 Fusion 路由模型正是這一理念的實踐。與 Fable 等前沿模型相比,Fusion 性能不遜色,卻將成本降低了 40%,訣竅在於智慧委託而非簡單下沉。同時,系統需要一個持續的監控機制:當被委託的小模型遇到超出能力的複雜任務時,能自動升級到大模型,避免陷入「錯誤模型無法完成任務,又要付昂貴的代價重做」的困境。

成本控制的另一個關鍵是 KV 快取管理。多模型系統容易無意中倍增成本——如果五個模型都讀同一份文件,費用就乘以五。應對辦法包括上下文預設只指向一個模型、透過檔案引用而非全文傳遞、以及使用探針技術(Probe)檢測模型內部狀態,判斷其困惑度或幻覺程度。上下文壓縮技術也很有用,尤其當系統需要在多個模型間切換並丟失快取時。此外,快取的持續時間(通常 5 分鐘)、是否自託管或使用 API 提供者,都對經濟性有巨大影響。自託管模型雖然需投入硬體成本,但可針對特定工作負載進行優化,長期可能更經濟。

業界共識是,這個領域需要更多研究與創新。未來的模型應被設計為天生具有協作精神,懂得何時委託任務、如何向其他模型傳遞上下文。同時,路由系統本身也在演進——不再是靜態的決策樹,而是根據任務實時複雜度、緩存狀態、甚至用戶反饋(升級/降級選擇)進行自動調整的自適應系統。路由從前沿問題變成了基礎設施問題,涉及模型設計、硬體部署、快取策略、提示優化等多個層面的協同。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。