Stop Burning Tokens: Why self-improvement needs domain expertise first - Annabell Schäfer, Langfuse
三句話摘要
如何通過自動優化循環和高信號評估器改進 AI Agent,而不是盲目燒 tokens。 建立高信號、領域特定的評估器比盲目優化更重要,與專家協作定義「好」的含義是自動改進循環成功的基石。 目標函數的清晰度決定優化效率:代碼編譯 yes/no 這類清晰的二元判定非常容易優化,但醫療合規、客服聊天機器人等領域的目標往往模糊不清、不完整,導致 Agent 往往優化錯誤的方向,這正是為什麼許多應用無法穩定改進。
重點整理
重點- 1
目標函數的清晰度決定優化效率:代碼編譯 yes/no 這類清晰的二元判定非常容易優化,但醫療合規、客服聊天機器人等領域的目標往往模糊不清、不完整,導致 Agent 往往優化錯誤的方向,這正是為什麼許多應用無法穩定改進。
- 2
高信號反饋遠優於低信號評分:普遍使用的「正確性」「有幫助程度」等 0-10 分評估因為定義不統一,導致同一評估器多次運行結果不同(LLM 作為評判者具有非決定性),相反要針對特定領域定義具體的 yes/no 型判定準則,如「答案是否基於知識庫」「是否正確使用品牌名稱」「是否屬於已知失敗模式類型」。
- 3
第一次迭代通常獲得 10% 以上的跳躍式改進:實驗中基礎 prompt 在 68% 準確度,第一次自動優化就跳到 78%,之後改進幅度逐漸減小。這是因為初次運行能捕捉到最明顯、最易修復的錯誤模式,後續優化面對的是邊界情況。
- 4
與領域專家協作是構建評估器的基礎:不能由工程師代替決策,需要與專家審視示例數據、討論為什麼某個分類是「對」的、識別隱性知識和失敗模式,進而定義什麼才是「好」的應用表現。
實用技巧與重點
乾貨- 實驗配置:
- 數據集:200 條訓練、100 條驗證、300 條測試
- 分類任務:根據論文標題+摘要選擇標籤(order/complaint/inquiry)
- 基礎模型:GPT-5.4 Nano(便宜且小)
- 優化器:Claude Opus 4.8
- 參考資源:GPT-5.4 Prompting Guide + Task Markdown
- 優化循環步驟:
- 在訓練集上運行基礎 prompt 取得基線
- 執行錯誤分析:找出最常見的錯誤類別、混淆的標籤對
- 根據最大錯誤類別生成 prompt 更新
- 在驗證集檢驗是否泛化
- 停止條件:15 輪完成或達 92% 準確度
- 最後在測試集評估
- 實驗結果:
- 基線準確度:68%
- 第四次迭代達 83%
- 第一次迭代獲得 10% 提升
- 測試集泛化到 80.2%
- Opus 優化策略(首次迭代):
- 添加分類思路指導
- 添加相似類別的區分規則
- 添加常見混淆模式說明
- 提供易混淆項目對的示例
- 高信號評估器示例:
- 答案是否含有檢索上下文中的代碼片段(yes/no)
- 是否正確使用品牌名稱拼寫(yes/no)
- 屬於五類已知失敗模式中的哪一類(分類型)
結論
結論“建立高信號、領域特定的評估器比盲目優化更重要,與專家協作定義「好」的含義是自動改進循環成功的基石。”
完整解析
詳細在 AI 應用開發中,人們普遍在談論「循環」(loops),即通過自動反饋與改進來提升 Agent 性能。但這個想法在代碼開發中運作良好,是因為程序編譯 yes/no 這類目標函數極其清晰。然而在醫療合規、客服聊天等領域,目標函數遠不如此明確——你可能認為優化方向是 A,實際上的最優設計卻在 B。LengFuse 的研究團隊決定尋找最清晰的案例來驗證理論,選擇了論文分類任務。
他們設置了一個最小化的自優化循環:使用 200 條標有正確標籤的論文訓練,100 條驗證,300 條測試。基礎 prompt 只是一份標籤列表,由 GPT-5.4 Nano 執行。每個循環中,Claude Opus 4.8 會分析訓練集上的錯誤、找出主要混淆模式、生成 hypothesis 並更新 prompt,再在驗證集檢驗改進是否泛化。結果從 68% 起跳,第一次迭代直接躍升至 78%,經過幾輪後穩定在 80% 左右。最驚人的是,首次運行 Opus 就識別出了 64 個主要錯誤模式,並針對最大的混淆對制定了精準的修復策略——這正是高信號反饋的威力。
然而,實驗也揭露了一個重要問題:即使是清晰的分類任務,最終準確度也會遇到天花板(80%),因為論文標籤本身存在主觀性——作者可能對同一篇論文有不同的分類偏好,這個歧義無法完全消除。這啟發了講者一個更廣泛的思考:如何將這套「yes/no 高信號反饋」的方法論推廣到模糊的領域?答案在於放棄通用的「正確性」「有幫助程度」等 0-10 分評估,轉而與領域專家深度合作,定義領域特定的 yes/no 型判定標準。例如,RAG 應用可以評估「答案是否基於已檢索的文檔」;品牌應用可以檢驗「是否正確拼寫品牌名稱」;複雜系統可以列舉「五種已知失敗模式」並進行分類。
構建這套評估系統的核心是與專家共同審視真實數據。講者強調需要不只用 AI Agent 評審,而要由人類專家親自檢視樣本,問出隱性知識(「為什麼這裡是對的而那裡不對」),從而明確應用的失敗模式和成功標準。同時,評估數據必須代表生產環境的真實分布。建立好評估器後,需要通過驗證集防止過擬合——這是傳統機器學習早已驗證的實踐,卻常被忽視。最後,優化循環需要逃生出口,避免系統無限迭代而空耗 tokens。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


