我讓 Fable 當腦,Sonnet 當手,省了一半 Token
三句話摘要
通過模型分工(Model Routing)在不同工作階段分配不同等級的 AI 模型,在不降低品質的前提下將成本降低 50% 以上。 AI 時代真正的競爭力不是永遠追趕最強模型,而是學會在每一步精準分配算力,用對的成本做出對的決策。 模型分工的四象限策略:模型選擇(強/弱)乘以推理強度(高/低),產生四種組合。高價值決策(產品策略、架構審查、高風險審查)用強模型高推理;快速判斷則用強模型低推理;技術執行細節用便宜模型高推理;格式整理、分類、摘要等機械工作用便宜模型低推理。決策品質和走錯代價決定了模型等級。
重點整理
重點- 1
模型分工的四象限策略:模型選擇(強/弱)乘以推理強度(高/低),產生四種組合。高價值決策(產品策略、架構審查、高風險審查)用強模型高推理;快速判斷則用強模型低推理;技術執行細節用便宜模型高推理;格式整理、分類、摘要等機械工作用便宜模型低推理。決策品質和走錯代價決定了模型等級。
- 2
實際成本結構遠複雜於單價:API 單價只是冰山一角,真正成本還包括模型重跑次數、人工審查時間,以及方向錯誤導致推倒重來的代價。便宜模型若無清晰規格就亂做,最後重跑三次反而更貴。因此「完成一份可用成品的總成本」才是衡量標準。
- 3
流程拆解是 Model Routing 的基礎:一個完整的工作必須拆成清晰的階段(Research → Design/Spec → Execute → Review → Fix),每階段都要有明確的輸入、輸出和驗收標準。每步的產出成為下步的輸入,問題時才知道該退回哪裡檢查。沒有這條交付鏈,模型分工只是猜測。
實用技巧與重點
乾貨- 模型選擇的兩道前置限制
- 公司准用工具(不能因為便宜就外洩客户資料、財務資料)
- 任務是否需要特殊能力(Live Web、X API、內部資料庫)
- 工作流程的五個階段
- Research:強模型當經理定方向 → 便宜模型搜資料 → 強模型彙整決策報告
- Design/Spec:強模型寫清楚,列出頁面、資料來源、成功標準、禁區
- Execute:便宜模型按規格大量生產(寫 Code、改頁面、轉資料格式)
- Review:分頭檢查(速度、SEO、Accessibility、Broken Links、引用事實),強模型判決
- Fix/Deploy:便宜模型照問題清單修改
- 成本計算案例(做中型行銷網站)
- 全用 Claude Fable 5:82 萬 Input Token + 27 萬 Output Token = $21.7
- Model Routing(Fable 規劃、Sonnet 執行、Opus 審查、Sonnet 修正):$9.15
- 節省:58%($12.55)
- 提到的模型與平台
- Anthropic:Fable 5(高階)、Sonnet 5(中階)、Opus 4.8(審查用)
- OpenAI:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.4
- 模型聚合平台:OpenRouter(支援按量計費、不同模型一個 API 入口)
- 驗收判斷標準
- 能自己清楚驗收的工作適合便宜模型(格式對不對、連結能不能打開、測試過沒)
- 自己都不知道什麼叫好的工作,便宜模型快速做反而製造垃圾
結論
結論“AI 時代真正的競爭力不是永遠追趕最強模型,而是學會在每一步精準分配算力,用對的成本做出對的決策。”
完整解析
詳細大多數人用 AI 時犯的第一個錯誤,就是把最強模型當成一把萬能鑰匙。每次開始工作就派出 API 最貴的模型,做完所有事情,然後驚訝地發現 Token 用量爆表。但仔細想想,一個完整的工作其實並不需要每一步都用最高層級的思維。就像公司不會派薪水最高的人整天複製貼上和整理表格,AI 也不應該被這樣浪費。
Model Routing 的核心概念是「算力分配」,而不只是「模型選擇」。它包括兩個維度:第一是選擇模型的等級(是派最強的還是成本低的),第二是決定推理強度(要它快速回答還是深度思考、多花 Token 檢查)。這兩個維度組合出來,就能為每一步工作找到最適合的配置。高價值決策(產品策略、系統架構、重要審查)需要強模型加高推理;快速判斷(在三個方向中選一個研究)可以用強模型但不用最高推理;明確規格下的技術執行可以用便宜模型但提高推理強度去處理難題;格式轉換、資料分類這些機械工作就用便宜模型低推理。
但在選模型之前,要先過兩道關。第一道是公司的資安政策——某些資料根本不能丟到外部 API。第二道是任務特殊需求——如果需要 Live Web 或 X 的實時資訊,就不能只看單純的模型實力,而是看誰能接到那條資料流。
真實的成本結構遠比 API 單價複雜。一個實驗驗證了這一點:同樣的網站專案,用 Fable 5 從頭到尾做,成本是 $21.7;如果用 Model Routing——Fable 負責規劃和審查、Sonnet 負責執行、Opus 做中間判決、Sonnet 負責修正——成本掉到 $9.15,節省了 58%。這不是因為便宜模型品質差,而是因為規格清楚後,執行階段本身就不需要最高層級的判斷力。更重要的是,這套分配方式還要求你建立清晰的交接流程:Research 產出研究包、Design/Spec 產出清楚的規格書、Execute 產出可檢查的成品、Review 產出問題清單、Fix 按清單修改。每一步的輸出成為下一步的輸入。當問題出現時,你才知道該退回哪一步。
這個流程還有個隱藏好處:它讓不同模型能無誤協作。便宜模型不會因為規格模糊而亂做;強模型不會被浪費在機械工作上。一旦 Spec 寫得很清楚,便宜模型即使在執行時提高推理強度去處理複雜邏輯,成本仍然比強模型便宜。但有個條件——如果執行時發現問題不是實作錯而是 Spec 本身錯了,就必須升級回強模型重新處理方向,不要讓便宜模型硬改。
這套方法的精妙之處在於,它不綁定特定的模型排行榜。模型會變、價格會變、平台政策也會變,但架構不變:任務可以拆、模型可以換、資料權限清楚、驗收標準存在、出錯可以回退。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


