KeyFrame內部研究專用

Improving Agents is a Data Mining Problem — Vivek Trivedy, LangChain

AI Engineer·8月12日週三·20 min英文

三句話摘要

通過追蹤數據挖掘與持續實驗,建立自動化迴圈來系統性改進 AI agents 的性能和成本效益。 啟用 tracing 並用另一個 agent 自動分析是最簡單的開始,通過 traces 挖掘出的信號可以驅動可測量的 agent 改進。 Traces 是理解 agents 的基礎 — Agent 在環境中每次運行都產生 traces(工具調用、API 請求、輸出等),比起傳統代碼閱讀無法預測 prompt 改變的影響,traces 提供了細粒度的實際行為信號。

重點整理

重點
  • 1

    Traces 是理解 agents 的基礎 — Agent 在環境中每次運行都產生 traces(工具調用、API 請求、輸出等),比起傳統代碼閱讀無法預測 prompt 改變的影響,traces 提供了細粒度的實際行為信號。

  • 2

    數據驅動的分層優化 — 先用 harness 工程快速迭代(2 分鐘反饋),達到天花板後轉向模型微調;再用 traces 中的真實例子做知識蒸餾,訓練小模型(9B~13B)來取代大模型。

  • 3

    經濟學的轉移 — 高推理負載下,從按 token 計費轉向獨立運行集群的硬體成本更便宜;開源模型搭配領域特定微調可匹配 Opus 級性能卻便宜 1~2 個數量級。

  • 4

    持續學習的三維度改進 — 必須同時更新訓練數據(觀察 traces)、harness/提示詞(因為模型按 harness 模式訓練)、記憶結構(高效更新而非 append-only)。

實用技巧與重點

乾貨
  • 產品與工具:
  • LangSmith Engine(自動化 trace 挖掘、評估生成、人類反饋準備)
  • Langchain 開源模型微調服務
  • 成本對比案例:
  • Harvey 法律基準測試:開源模型成本達 Opus 的 1/100 ~ 1/10
  • 推薦模型規模:9B、13B 模型
  • 改進策略三層次:
  • Harness 工程反饋時間:約 2 分鐘
  • 推薦流程:快速收集反饋 → Harness 工程 → 模型微調 → 再做 Harness 工程
  • 微調技術:知識蒸餾(Distillation SFT)、評估生成、人類審查內容
  • 模型選擇流程:
  • 驗證任務可行性:優先用 Opus、GPT-5.5
  • 探索替代方案:試驗開源模型並進行 harness 工程
  • 達到性能天花板後:進行領域特定微調

結論

結論

啟用 tracing 並用另一個 agent 自動分析是最簡單的開始,通過 traces 挖掘出的信號可以驅動可測量的 agent 改進。

完整解析

詳細

軟體工程的代碼閱讀方法在 agent 世界失效了。傳統代碼你可以看著函式調用、控制流大致理解邏輯,但 agents 由動態提示詞、工具、hooks、中介件、甚至互相調用的其他 agents 組成——prompt 的改變如何影響醫療與法律領域的 agent 表現完全不同,人腦無法預測。過去四年我們交換了確定性換取自主性,現在需要工具來理解這些自主運行的系統。

Langchain 的做法是中央化所有 agent 生成的數據到一個 tracing project,然後派遣 agents 去讀取其他 agents 的 traces。這樣可以找出用戶滿意與不滿的交互案例、檢測 agent 在長 context 下是否性能衰減、跨模型比較(GPT-5.5 vs GLM-5.2 同一任務表現如何)、觀察細粒度的實際行為。數據現在是最小的——未來 agents 將在月、週、日尺度上大規模運行,數據量會呈指數成長,所以需要開發高效的 agent-to-agent 挖掘系統,而不是直接把所有 traces 餵給另一個 agent 的 context。

在 Harvey 的法律基準測試合作中,Langchain 驗證了開源模型的驚人潛力。先用 Opus 和 GPT-5.5 驗證任務可行性,確認後開始探索開源模型。通過 harness 工程(改進 prompt、給模型更多指導)和領域特定微調,9B、13B 模型可以達到 Opus 級性能,成本只需 1/100 到 1/10。還有個經濟學轉變:高推理負載下,購買獨立集群並獲得無限推理 > 按 token 計費。

LangSmith Engine 自動化了這個循環的三個關鍵應用:第一,知識蒸餾——從大模型的好 traces 提取例子,微調小模型模擬其行為;第二,評估生成——agent 行為由其評估定義,自動從 traces 生成評估能覆蓋真實使用模式;第三,人類內容準備——法律、醫療等高信任領域需要人類審查,但無法手動讀取百萬級 traces,自動摘要很關鍵。

策略上遵循古典機器學習原則:找到好的擬合函數(fit function)和好數據。實踐上先做 harness 工程(2 分鐘反饋循環),直到天花板再嘗試微調。持續學習需要三維度同時推進:訓練數據(觀察 traces)、harness 更新(因為模型按 harness 被訓練)、記憶優化(agents 不能只是 append-only 日誌,需要高效更新機制,類似人類"睡眠"時整理記憶)。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。