Improving Agents is a Data Mining Problem — Vivek Trivedy, LangChain
三句話摘要
通過追蹤數據挖掘與持續實驗,建立自動化迴圈來系統性改進 AI agents 的性能和成本效益。 啟用 tracing 並用另一個 agent 自動分析是最簡單的開始,通過 traces 挖掘出的信號可以驅動可測量的 agent 改進。 Traces 是理解 agents 的基礎 — Agent 在環境中每次運行都產生 traces(工具調用、API 請求、輸出等),比起傳統代碼閱讀無法預測 prompt 改變的影響,traces 提供了細粒度的實際行為信號。
重點整理
重點- 1
Traces 是理解 agents 的基礎 — Agent 在環境中每次運行都產生 traces(工具調用、API 請求、輸出等),比起傳統代碼閱讀無法預測 prompt 改變的影響,traces 提供了細粒度的實際行為信號。
- 2
數據驅動的分層優化 — 先用 harness 工程快速迭代(2 分鐘反饋),達到天花板後轉向模型微調;再用 traces 中的真實例子做知識蒸餾,訓練小模型(9B~13B)來取代大模型。
- 3
經濟學的轉移 — 高推理負載下,從按 token 計費轉向獨立運行集群的硬體成本更便宜;開源模型搭配領域特定微調可匹配 Opus 級性能卻便宜 1~2 個數量級。
- 4
持續學習的三維度改進 — 必須同時更新訓練數據(觀察 traces)、harness/提示詞(因為模型按 harness 模式訓練)、記憶結構(高效更新而非 append-only)。
實用技巧與重點
乾貨- 產品與工具:
- LangSmith Engine(自動化 trace 挖掘、評估生成、人類反饋準備)
- Langchain 開源模型微調服務
- 成本對比案例:
- Harvey 法律基準測試:開源模型成本達 Opus 的 1/100 ~ 1/10
- 推薦模型規模:9B、13B 模型
- 改進策略三層次:
- Harness 工程反饋時間:約 2 分鐘
- 推薦流程:快速收集反饋 → Harness 工程 → 模型微調 → 再做 Harness 工程
- 微調技術:知識蒸餾(Distillation SFT)、評估生成、人類審查內容
- 模型選擇流程:
- 驗證任務可行性:優先用 Opus、GPT-5.5
- 探索替代方案:試驗開源模型並進行 harness 工程
- 達到性能天花板後:進行領域特定微調
結論
結論“啟用 tracing 並用另一個 agent 自動分析是最簡單的開始,通過 traces 挖掘出的信號可以驅動可測量的 agent 改進。”
完整解析
詳細軟體工程的代碼閱讀方法在 agent 世界失效了。傳統代碼你可以看著函式調用、控制流大致理解邏輯,但 agents 由動態提示詞、工具、hooks、中介件、甚至互相調用的其他 agents 組成——prompt 的改變如何影響醫療與法律領域的 agent 表現完全不同,人腦無法預測。過去四年我們交換了確定性換取自主性,現在需要工具來理解這些自主運行的系統。
Langchain 的做法是中央化所有 agent 生成的數據到一個 tracing project,然後派遣 agents 去讀取其他 agents 的 traces。這樣可以找出用戶滿意與不滿的交互案例、檢測 agent 在長 context 下是否性能衰減、跨模型比較(GPT-5.5 vs GLM-5.2 同一任務表現如何)、觀察細粒度的實際行為。數據現在是最小的——未來 agents 將在月、週、日尺度上大規模運行,數據量會呈指數成長,所以需要開發高效的 agent-to-agent 挖掘系統,而不是直接把所有 traces 餵給另一個 agent 的 context。
在 Harvey 的法律基準測試合作中,Langchain 驗證了開源模型的驚人潛力。先用 Opus 和 GPT-5.5 驗證任務可行性,確認後開始探索開源模型。通過 harness 工程(改進 prompt、給模型更多指導)和領域特定微調,9B、13B 模型可以達到 Opus 級性能,成本只需 1/100 到 1/10。還有個經濟學轉變:高推理負載下,購買獨立集群並獲得無限推理 > 按 token 計費。
LangSmith Engine 自動化了這個循環的三個關鍵應用:第一,知識蒸餾——從大模型的好 traces 提取例子,微調小模型模擬其行為;第二,評估生成——agent 行為由其評估定義,自動從 traces 生成評估能覆蓋真實使用模式;第三,人類內容準備——法律、醫療等高信任領域需要人類審查,但無法手動讀取百萬級 traces,自動摘要很關鍵。
策略上遵循古典機器學習原則:找到好的擬合函數(fit function)和好數據。實踐上先做 harness 工程(2 分鐘反饋循環),直到天花板再嘗試微調。持續學習需要三維度同時推進:訓練數據(觀察 traces)、harness 更新(因為模型按 harness 被訓練)、記憶優化(agents 不能只是 append-only 日誌,需要高效更新機制,類似人類"睡眠"時整理記憶)。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


