KeyFrame內部研究專用

没换模型没改prompt,成本砍掉86%

Why QQ·8月16日週日·12 min中文

三句話摘要

多智能體研究管道通過在模型調用之間插入代碼清洗層,實現 86% 成本降低與 78% 延遲改善。 最貴模型別讓它干最便宜的活——86% 的成本節省完全來自用代碼代替高端模型處理數據清洗,工程設計的價值遠超模型選擇。 --- 最值得截圖記下的四句工程啟示: 1. 先測量再優化—— 每次優化前量一下流進高端模型的原始 token 數 2. 多 Worker 配 Reducer —— 先做確定性規約再動 Prompt 3. 確定性邏輯歸代碼 —— 模型只做真正擅長的推理判斷 4. 一致性和分歧是信號 —— 應由代碼算出,不留給模型重新發現

重點整理

重點
  • 1

  • 2

    管道成本的真正來源:多數人以為優化在於選便宜模型、改 Prompt、減少 Worker,實際上最大浪費發生在高端模型(Sonnet)被迫讀取 40 份未清洗的原始輸出。這 41,200 個 token 裡有 15 份重複、6 份機械性錯誤,模型要自己完成數據清洗才能開始推理。

  • 3

    長上下文中的準確率陷阱:Stanford 2024 年研究表明,模型在長上下文中間提取信息的準確率明顯下降(邮行曲線)。原始管道的輸出堆積正好落在性能最差區間,造成質量和成本雙重損失。

  • 4

    Reducer 層的三層邏輯:介入純代碼 reducer(無任何模型調用),負責過濾(丟棄不完整數據)、分組(去重複並歸一化)、選拔(每組保留最優代表),同時暴露 Worker 間的分歧和矛盾。這些都是確定性操作,適合代碼實現。

  • 5

    工程結構的戰略價值:成本節省全部來自讓 Sonnet 少讀 87% 的垃圾輸入,與模型能力、Prompt 品質都無關。標誌著多智能體系統正從「拼模型能力」轉向「拼工程結構」,規約層將成為框架標準組件。

  • 6

實用技巧與重點

乾貨
  • 原始架構與數字:
  • 40 個 Worker:Claude 3 Haiku;最終層:Claude Sonnet
  • 原始成本:$1.38、延遲 51 秒;Sonnet 輸入:41,200 token
  • Reducer 的三個核心操作:
  • 過濾:缺結論、缺證據、缺來源 → 直接丟棄
  • 分組:結論文本歸一化,相同含意歸到同組
  • 選拔:每組保留信息度最高的代表,附註「另有 N 個 worker 獨立確認」
  • Reducer 的四道護欄:
  • 缺字段丟棄,記錄但不進分組
  • 同一事實結論衝突 → 標記為矛盾,交給 Sonnet 處理
  • 單獨發現原樣放行,不虛假加信心
  • 空列表 → 跳過綜合環節
  • 優化後的結果:
  • 輸入 token:41,200 → 5,300(降 87%)
  • 成本:$1.38 → $0.19(降 86%)
  • 延遲:51 秒 → 11 秒(降 78%)
  • 獨立發現:40 份 → 34 份(去重 6 份機械性數據)
  • 人工兜底次數:50 次運行中 6 次 → 1 次

結論

結論

最貴模型別讓它干最便宜的活——86% 的成本節省完全來自用代碼代替高端模型處理數據清洗,工程設計的價值遠超模型選擇。 --- 最值得截圖記下的四句工程啟示: 1. 先測量再優化—— 每次優化前量一下流進高端模型的原始 token 數 2. 多 Worker 配 Reducer —— 先做確定性規約再動 Prompt 3. 確定性邏輯歸代碼 —— 模型只做真正擅長的推理判斷 4. 一致性和分歧是信號 —— 應由代碼算出,不留給模型重新發現

完整解析

詳細

做多智能體系統的人常常陷入一個思維陷阱:優化管道就是換更便宜的模型、改寫更好的 Prompt、增加 Worker 數量。Jip 的案例打破了這個直覺。

他搭建的是標準分層研究管道:用戶給研究問題,系統拆解成 40 個子問題分派給 40 個 Haiku worker,每個 worker 抓來源、提結論、附證據。然後所有輸出無差別地拼進 prompt,交給 Sonnet 做最終綜合。架構看起來合理——便宜模型負責廣覆蓋,昂貴模型只出場一次做收尾。

問題藏在賬單裡。Sonnet 每次要讀的輸入是 41,200 個 token,但成色糟糕。40 份輸出裡有 15 份近乎重複(只是換說法或引用格式),6 份機械性殘缺(缺字段、壞時間戳、只有結論沒證據)。本質上 Sonnet 拿到的不是經過清洗的研究材料,而是一堆原始數據,必須自己完成去重、缺陷檢測、歸一化才能開始推理。而每一個字都在計費。

更深的問題是,Stanford 研究表明模型在長上下文中間的信息提取準確率明顯下降。那 41,200 個 token 的無序堆積正好把關鍵信息推到性能最差區間。不僅為低質量數據多付錢,還買到更差的閱讀質量。

Jip 的解法是在 Worker 層和 Sonnet 之間插入 reducer 層——純代碼實現,無任何模型調用。邏輯很樸素:過濾不完整數據、分組去重複、每組保留最優代表,並在證據後附註「另有 N 個 worker 獨立確認」。這個一致性信號本身就是可信度提升,代碼直接算出來擺在 Sonnet 面前,模型不用重新花 token 發現。Reducer 還配備防禦性檢查:衝突時標記不擅自調和,孤立發現原樣放行,空列表時跳過綜合。

結果是輸入 token 從 41,200 降到 5,300(降 87%),成本從 $1.38 降到 $0.19,延遲從 51 秒降到 11 秒。Reducer 還順帶發現了 23 組 worker 間的直接矛盾——原始拼接方案一組都沒暴露過。人工介入次數也從 50 次運行中的 6 次降到 1 次。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。