KeyFrame內部研究專用

从零搭建Agent自动化评估体系

白白说大模型·7月10日週五·9 min中文

三句話摘要

從零開始搭建 Agent 自動化評估體系,解決不確定性下的質量保障問題。 前期投入時間建立完善的自動化評估體系雖似乎拖慢上線節奏,但能有效避免線上事故並大幅降低後續調試成本,從長期看是最划算的投資。 Agent 與傳統軟體本質不同。傳統軟體是確定性系統,輸入固定結果固定;Agent 則像一位思維活躍的員工,同樣問題每次回答可能不同,導致傳統測試方法完全失效,需要建立動態質量標準。

重點整理

重點
  • 1

    Agent 與傳統軟體本質不同。傳統軟體是確定性系統,輸入固定結果固定;Agent 則像一位思維活躍的員工,同樣問題每次回答可能不同,導致傳統測試方法完全失效,需要建立動態質量標準。

  • 2

    四層框架實現全流程自動化評估。輸入層需建立規範全面的測試樣本庫(覆蓋核心場景、邊界情況、常見問題);執行層要多輪重複運行並完整保存過程日誌;產出層將零散結果統一結構化;評卷層將評分規則轉化為代碼和模型判定。

  • 3

    區分客觀與主觀任務的評分方式。客觀任務(如計算、標準問答)用代碼直接判定,精準快速;主觀任務(如寫文案、方案設計)用精度更高的大模型評判,並要求詳細打分理由,實現可追溯可解釋。

  • 4

    多輪統計勝過單次結果。通過統計整體成功率來抵消模型的隨機波動,避免被偶然正確結果誤導,確保版本穩定性判定的可靠性。

實用技巧與重點

乾貨
  • 四層評估框架層級:輸入層 → 執行層 → 產出層 → 評卷層
  • 執行層的重複執行次數:至少 5 次
  • 客觀任務評分方式:代碼判定(正則匹配、關鍵詞命中、邏輯斷言)
  • 主觀任務評分維度:合規性、準確性、完整性、專業性、流暢度(共 5 個維度)
  • 必須保存的數據:最終回答、工具執行情況、運行耗時、報錯信息、超時記錄、思考過程、工具調用記錄、傳入參數、對話上下文
  • 客觀任務優勢:精準、零誤差、速度快(一秒判幾百條)

結論

結論

前期投入時間建立完善的自動化評估體系雖似乎拖慢上線節奏,但能有效避免線上事故並大幅降低後續調試成本,從長期看是最划算的投資。

完整解析

詳細

Agent 系統的核心挑戰在於其輸出的內在隨機性。與傳統軟體系統不同,Agent 的行為更像一位思維活躍的員工而非確定性機器——同一個問題可能產生十種不同的答案。這種不確定性帶來了實實在在的業務風險:輕則隨機出錯導致效果參差不齊,重則直接造成線上事故。因此,建立一套標準化的評估流程成為保障質量的必要手段。

傳統軟體測試的「一次成功即可發佈」的邏輯在 Agent 領域完全失效。我們需要將評估拆解成四個標準環節,逐步實現自動化。輸入層的第一步是建立規範全面的測試樣本庫,涵蓋核心業務場景、邊界情況、常見使用者提問等,樣本的豐富性與代表性直接決定了評估結果的可靠性。執行層是最關鍵的區別所在:不再相信單次結果,而是每條測試用力重複執行多次(如 5 次),統計整體成功率。同時必須完整保存所有過程日誌,包括思考鏈路、工具調用記錄、傳入參數、上下文等,這些都是後續排查問題的關鍵資料。

產出層將零散的測試日誌統一整理成結構化數據,包含最終回答、工具執行情況、運行耗時、報錯信息與超時記錄。這一步消除了人工整理的誤差,為後續自動評分提供完整可靠的數據支撐。評卷層則是完全摒棄人工打分,將所有評分規則轉化為自動化邏輯。對於有標準答案的客觀任務(計算、查詢),直接用正則匹配、關鍵詞命中、邏輯斷言等技術編寫評分代碼,實現精準零誤差、速度特別快的批量評估。對於沒有唯一正確答案的主觀任務(寫文案、方案設計),則用精度更高的大模型進行評判,同時要求給出詳細理由,確保評分的可追溯性與公正性。

實際運用中會遇到三個普遍的難題。結果波動源於模型內在的隨機性,導致昨天通過今天失敗,難以判斷是代碼變更還是模型隨機波動。解決方法是看概率不看單詞,用多輪測試的整體成功率代替單次結果判斷。標準缺失指生成式任務缺乏唯一答案,人工評估主觀偏差大。破局之道是分層打分、量化維度,所有主觀任務都從合規性、準確性、完整性、專業性、流暢度五個維度評分。故障難排查源於 Agent 推理鏈路複雜不透明。關鍵是完整追溯過程數據,回溯每一步的推理、調用與決策,精準定位根源問題。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。