KeyFrame內部研究專用

我讓 Fable 當腦,Sonnet 當手,省了一半 Token

Gary Chen·8月5日週三·15 min中文

三句話摘要

通過模型分工(Model Routing)在不同工作階段分配不同等級的 AI 模型,在不降低品質的前提下將成本降低 50% 以上。 AI 時代真正的競爭力不是永遠追趕最強模型,而是學會在每一步精準分配算力,用對的成本做出對的決策。 模型分工的四象限策略:模型選擇(強/弱)乘以推理強度(高/低),產生四種組合。高價值決策(產品策略、架構審查、高風險審查)用強模型高推理;快速判斷則用強模型低推理;技術執行細節用便宜模型高推理;格式整理、分類、摘要等機械工作用便宜模型低推理。決策品質和走錯代價決定了模型等級。

重點整理

重點
  • 1

    模型分工的四象限策略:模型選擇(強/弱)乘以推理強度(高/低),產生四種組合。高價值決策(產品策略、架構審查、高風險審查)用強模型高推理;快速判斷則用強模型低推理;技術執行細節用便宜模型高推理;格式整理、分類、摘要等機械工作用便宜模型低推理。決策品質和走錯代價決定了模型等級。

  • 2

    實際成本結構遠複雜於單價:API 單價只是冰山一角,真正成本還包括模型重跑次數、人工審查時間,以及方向錯誤導致推倒重來的代價。便宜模型若無清晰規格就亂做,最後重跑三次反而更貴。因此「完成一份可用成品的總成本」才是衡量標準。

  • 3

    流程拆解是 Model Routing 的基礎:一個完整的工作必須拆成清晰的階段(Research → Design/Spec → Execute → Review → Fix),每階段都要有明確的輸入、輸出和驗收標準。每步的產出成為下步的輸入,問題時才知道該退回哪裡檢查。沒有這條交付鏈,模型分工只是猜測。

實用技巧與重點

乾貨
  • 模型選擇的兩道前置限制
  • 公司准用工具(不能因為便宜就外洩客户資料、財務資料)
  • 任務是否需要特殊能力(Live Web、X API、內部資料庫)
  • 工作流程的五個階段
  • Research:強模型當經理定方向 → 便宜模型搜資料 → 強模型彙整決策報告
  • Design/Spec:強模型寫清楚,列出頁面、資料來源、成功標準、禁區
  • Execute:便宜模型按規格大量生產(寫 Code、改頁面、轉資料格式)
  • Review:分頭檢查(速度、SEO、Accessibility、Broken Links、引用事實),強模型判決
  • Fix/Deploy:便宜模型照問題清單修改
  • 成本計算案例(做中型行銷網站)
  • 全用 Claude Fable 5:82 萬 Input Token + 27 萬 Output Token = $21.7
  • Model Routing(Fable 規劃、Sonnet 執行、Opus 審查、Sonnet 修正):$9.15
  • 節省:58%($12.55)
  • 提到的模型與平台
  • Anthropic:Fable 5(高階)、Sonnet 5(中階)、Opus 4.8(審查用)
  • OpenAI:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.4
  • 模型聚合平台:OpenRouter(支援按量計費、不同模型一個 API 入口)
  • 驗收判斷標準
  • 能自己清楚驗收的工作適合便宜模型(格式對不對、連結能不能打開、測試過沒)
  • 自己都不知道什麼叫好的工作,便宜模型快速做反而製造垃圾

結論

結論

AI 時代真正的競爭力不是永遠追趕最強模型,而是學會在每一步精準分配算力,用對的成本做出對的決策。

完整解析

詳細

大多數人用 AI 時犯的第一個錯誤,就是把最強模型當成一把萬能鑰匙。每次開始工作就派出 API 最貴的模型,做完所有事情,然後驚訝地發現 Token 用量爆表。但仔細想想,一個完整的工作其實並不需要每一步都用最高層級的思維。就像公司不會派薪水最高的人整天複製貼上和整理表格,AI 也不應該被這樣浪費。

Model Routing 的核心概念是「算力分配」,而不只是「模型選擇」。它包括兩個維度:第一是選擇模型的等級(是派最強的還是成本低的),第二是決定推理強度(要它快速回答還是深度思考、多花 Token 檢查)。這兩個維度組合出來,就能為每一步工作找到最適合的配置。高價值決策(產品策略、系統架構、重要審查)需要強模型加高推理;快速判斷(在三個方向中選一個研究)可以用強模型但不用最高推理;明確規格下的技術執行可以用便宜模型但提高推理強度去處理難題;格式轉換、資料分類這些機械工作就用便宜模型低推理。

但在選模型之前,要先過兩道關。第一道是公司的資安政策——某些資料根本不能丟到外部 API。第二道是任務特殊需求——如果需要 Live Web 或 X 的實時資訊,就不能只看單純的模型實力,而是看誰能接到那條資料流。

真實的成本結構遠比 API 單價複雜。一個實驗驗證了這一點:同樣的網站專案,用 Fable 5 從頭到尾做,成本是 $21.7;如果用 Model Routing——Fable 負責規劃和審查、Sonnet 負責執行、Opus 做中間判決、Sonnet 負責修正——成本掉到 $9.15,節省了 58%。這不是因為便宜模型品質差,而是因為規格清楚後,執行階段本身就不需要最高層級的判斷力。更重要的是,這套分配方式還要求你建立清晰的交接流程:Research 產出研究包、Design/Spec 產出清楚的規格書、Execute 產出可檢查的成品、Review 產出問題清單、Fix 按清單修改。每一步的輸出成為下一步的輸入。當問題出現時,你才知道該退回哪一步。

這個流程還有個隱藏好處:它讓不同模型能無誤協作。便宜模型不會因為規格模糊而亂做;強模型不會被浪費在機械工作上。一旦 Spec 寫得很清楚,便宜模型即使在執行時提高推理強度去處理複雜邏輯,成本仍然比強模型便宜。但有個條件——如果執行時發現問題不是實作錯而是 Spec 本身錯了,就必須升級回強模型重新處理方向,不要讓便宜模型硬改。

這套方法的精妙之處在於,它不綁定特定的模型排行榜。模型會變、價格會變、平台政策也會變,但架構不變:任務可以拆、模型可以換、資料權限清楚、驗收標準存在、出錯可以回退。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。