KeyFrame內部研究專用

Stop Burning Tokens: Why self-improvement needs domain expertise first - Annabell Schäfer, Langfuse

AI Engineer·7月18日週六·17 min英文

三句話摘要

如何通過自動優化循環和高信號評估器改進 AI Agent,而不是盲目燒 tokens。 建立高信號、領域特定的評估器比盲目優化更重要,與專家協作定義「好」的含義是自動改進循環成功的基石。 目標函數的清晰度決定優化效率:代碼編譯 yes/no 這類清晰的二元判定非常容易優化,但醫療合規、客服聊天機器人等領域的目標往往模糊不清、不完整,導致 Agent 往往優化錯誤的方向,這正是為什麼許多應用無法穩定改進。

重點整理

重點
  • 1

    目標函數的清晰度決定優化效率:代碼編譯 yes/no 這類清晰的二元判定非常容易優化,但醫療合規、客服聊天機器人等領域的目標往往模糊不清、不完整,導致 Agent 往往優化錯誤的方向,這正是為什麼許多應用無法穩定改進。

  • 2

    高信號反饋遠優於低信號評分:普遍使用的「正確性」「有幫助程度」等 0-10 分評估因為定義不統一,導致同一評估器多次運行結果不同(LLM 作為評判者具有非決定性),相反要針對特定領域定義具體的 yes/no 型判定準則,如「答案是否基於知識庫」「是否正確使用品牌名稱」「是否屬於已知失敗模式類型」。

  • 3

    第一次迭代通常獲得 10% 以上的跳躍式改進:實驗中基礎 prompt 在 68% 準確度,第一次自動優化就跳到 78%,之後改進幅度逐漸減小。這是因為初次運行能捕捉到最明顯、最易修復的錯誤模式,後續優化面對的是邊界情況。

  • 4

    與領域專家協作是構建評估器的基礎:不能由工程師代替決策,需要與專家審視示例數據、討論為什麼某個分類是「對」的、識別隱性知識和失敗模式,進而定義什麼才是「好」的應用表現。

實用技巧與重點

乾貨
  • 實驗配置:
  • 數據集:200 條訓練、100 條驗證、300 條測試
  • 分類任務:根據論文標題+摘要選擇標籤(order/complaint/inquiry)
  • 基礎模型:GPT-5.4 Nano(便宜且小)
  • 優化器:Claude Opus 4.8
  • 參考資源:GPT-5.4 Prompting Guide + Task Markdown
  • 優化循環步驟:
  • 在訓練集上運行基礎 prompt 取得基線
  • 執行錯誤分析:找出最常見的錯誤類別、混淆的標籤對
  • 根據最大錯誤類別生成 prompt 更新
  • 在驗證集檢驗是否泛化
  • 停止條件:15 輪完成或達 92% 準確度
  • 最後在測試集評估
  • 實驗結果:
  • 基線準確度:68%
  • 第四次迭代達 83%
  • 第一次迭代獲得 10% 提升
  • 測試集泛化到 80.2%
  • Opus 優化策略(首次迭代):
  • 添加分類思路指導
  • 添加相似類別的區分規則
  • 添加常見混淆模式說明
  • 提供易混淆項目對的示例
  • 高信號評估器示例:
  • 答案是否含有檢索上下文中的代碼片段(yes/no)
  • 是否正確使用品牌名稱拼寫(yes/no)
  • 屬於五類已知失敗模式中的哪一類(分類型)

結論

結論

建立高信號、領域特定的評估器比盲目優化更重要,與專家協作定義「好」的含義是自動改進循環成功的基石。

完整解析

詳細

在 AI 應用開發中,人們普遍在談論「循環」(loops),即通過自動反饋與改進來提升 Agent 性能。但這個想法在代碼開發中運作良好,是因為程序編譯 yes/no 這類目標函數極其清晰。然而在醫療合規、客服聊天等領域,目標函數遠不如此明確——你可能認為優化方向是 A,實際上的最優設計卻在 B。LengFuse 的研究團隊決定尋找最清晰的案例來驗證理論,選擇了論文分類任務。

他們設置了一個最小化的自優化循環:使用 200 條標有正確標籤的論文訓練,100 條驗證,300 條測試。基礎 prompt 只是一份標籤列表,由 GPT-5.4 Nano 執行。每個循環中,Claude Opus 4.8 會分析訓練集上的錯誤、找出主要混淆模式、生成 hypothesis 並更新 prompt,再在驗證集檢驗改進是否泛化。結果從 68% 起跳,第一次迭代直接躍升至 78%,經過幾輪後穩定在 80% 左右。最驚人的是,首次運行 Opus 就識別出了 64 個主要錯誤模式,並針對最大的混淆對制定了精準的修復策略——這正是高信號反饋的威力。

然而,實驗也揭露了一個重要問題:即使是清晰的分類任務,最終準確度也會遇到天花板(80%),因為論文標籤本身存在主觀性——作者可能對同一篇論文有不同的分類偏好,這個歧義無法完全消除。這啟發了講者一個更廣泛的思考:如何將這套「yes/no 高信號反饋」的方法論推廣到模糊的領域?答案在於放棄通用的「正確性」「有幫助程度」等 0-10 分評估,轉而與領域專家深度合作,定義領域特定的 yes/no 型判定標準。例如,RAG 應用可以評估「答案是否基於已檢索的文檔」;品牌應用可以檢驗「是否正確拼寫品牌名稱」;複雜系統可以列舉「五種已知失敗模式」並進行分類。

構建這套評估系統的核心是與專家共同審視真實數據。講者強調需要不只用 AI Agent 評審,而要由人類專家親自檢視樣本,問出隱性知識(「為什麼這裡是對的而那裡不對」),從而明確應用的失敗模式和成功標準。同時,評估數據必須代表生產環境的真實分布。建立好評估器後,需要通過驗證集防止過擬合——這是傳統機器學習早已驗證的實踐,卻常被忽視。最後,優化循環需要逃生出口,避免系統無限迭代而空耗 tokens。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。