没换模型没改prompt,成本砍掉86%
三句話摘要
多智能體研究管道通過在模型調用之間插入代碼清洗層,實現 86% 成本降低與 78% 延遲改善。 最貴模型別讓它干最便宜的活——86% 的成本節省完全來自用代碼代替高端模型處理數據清洗,工程設計的價值遠超模型選擇。 --- 最值得截圖記下的四句工程啟示: 1. 先測量再優化—— 每次優化前量一下流進高端模型的原始 token 數 2. 多 Worker 配 Reducer —— 先做確定性規約再動 Prompt 3. 確定性邏輯歸代碼 —— 模型只做真正擅長的推理判斷 4. 一致性和分歧是信號 —— 應由代碼算出,不留給模型重新發現
重點整理
重點- 1
- 2
管道成本的真正來源:多數人以為優化在於選便宜模型、改 Prompt、減少 Worker,實際上最大浪費發生在高端模型(Sonnet)被迫讀取 40 份未清洗的原始輸出。這 41,200 個 token 裡有 15 份重複、6 份機械性錯誤,模型要自己完成數據清洗才能開始推理。
- 3
長上下文中的準確率陷阱:Stanford 2024 年研究表明,模型在長上下文中間提取信息的準確率明顯下降(邮行曲線)。原始管道的輸出堆積正好落在性能最差區間,造成質量和成本雙重損失。
- 4
Reducer 層的三層邏輯:介入純代碼 reducer(無任何模型調用),負責過濾(丟棄不完整數據)、分組(去重複並歸一化)、選拔(每組保留最優代表),同時暴露 Worker 間的分歧和矛盾。這些都是確定性操作,適合代碼實現。
- 5
工程結構的戰略價值:成本節省全部來自讓 Sonnet 少讀 87% 的垃圾輸入,與模型能力、Prompt 品質都無關。標誌著多智能體系統正從「拼模型能力」轉向「拼工程結構」,規約層將成為框架標準組件。
- 6
實用技巧與重點
乾貨- 原始架構與數字:
- 40 個 Worker:Claude 3 Haiku;最終層:Claude Sonnet
- 原始成本:$1.38、延遲 51 秒;Sonnet 輸入:41,200 token
- Reducer 的三個核心操作:
- 過濾:缺結論、缺證據、缺來源 → 直接丟棄
- 分組:結論文本歸一化,相同含意歸到同組
- 選拔:每組保留信息度最高的代表,附註「另有 N 個 worker 獨立確認」
- Reducer 的四道護欄:
- 缺字段丟棄,記錄但不進分組
- 同一事實結論衝突 → 標記為矛盾,交給 Sonnet 處理
- 單獨發現原樣放行,不虛假加信心
- 空列表 → 跳過綜合環節
- 優化後的結果:
- 輸入 token:41,200 → 5,300(降 87%)
- 成本:$1.38 → $0.19(降 86%)
- 延遲:51 秒 → 11 秒(降 78%)
- 獨立發現:40 份 → 34 份(去重 6 份機械性數據)
- 人工兜底次數:50 次運行中 6 次 → 1 次
結論
結論“ 最貴模型別讓它干最便宜的活——86% 的成本節省完全來自用代碼代替高端模型處理數據清洗,工程設計的價值遠超模型選擇。 --- 最值得截圖記下的四句工程啟示: 1. 先測量再優化—— 每次優化前量一下流進高端模型的原始 token 數 2. 多 Worker 配 Reducer —— 先做確定性規約再動 Prompt 3. 確定性邏輯歸代碼 —— 模型只做真正擅長的推理判斷 4. 一致性和分歧是信號 —— 應由代碼算出,不留給模型重新發現”
完整解析
詳細做多智能體系統的人常常陷入一個思維陷阱:優化管道就是換更便宜的模型、改寫更好的 Prompt、增加 Worker 數量。Jip 的案例打破了這個直覺。
他搭建的是標準分層研究管道:用戶給研究問題,系統拆解成 40 個子問題分派給 40 個 Haiku worker,每個 worker 抓來源、提結論、附證據。然後所有輸出無差別地拼進 prompt,交給 Sonnet 做最終綜合。架構看起來合理——便宜模型負責廣覆蓋,昂貴模型只出場一次做收尾。
問題藏在賬單裡。Sonnet 每次要讀的輸入是 41,200 個 token,但成色糟糕。40 份輸出裡有 15 份近乎重複(只是換說法或引用格式),6 份機械性殘缺(缺字段、壞時間戳、只有結論沒證據)。本質上 Sonnet 拿到的不是經過清洗的研究材料,而是一堆原始數據,必須自己完成去重、缺陷檢測、歸一化才能開始推理。而每一個字都在計費。
更深的問題是,Stanford 研究表明模型在長上下文中間的信息提取準確率明顯下降。那 41,200 個 token 的無序堆積正好把關鍵信息推到性能最差區間。不僅為低質量數據多付錢,還買到更差的閱讀質量。
Jip 的解法是在 Worker 層和 Sonnet 之間插入 reducer 層——純代碼實現,無任何模型調用。邏輯很樸素:過濾不完整數據、分組去重複、每組保留最優代表,並在證據後附註「另有 N 個 worker 獨立確認」。這個一致性信號本身就是可信度提升,代碼直接算出來擺在 Sonnet 面前,模型不用重新花 token 發現。Reducer 還配備防禦性檢查:衝突時標記不擅自調和,孤立發現原樣放行,空列表時跳過綜合。
結果是輸入 token 從 41,200 降到 5,300(降 87%),成本從 $1.38 降到 $0.19,延遲從 51 秒降到 11 秒。Reducer 還順帶發現了 23 組 worker 間的直接矛盾——原始拼接方案一組都沒暴露過。人工介入次數也從 50 次運行中的 6 次降到 1 次。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


