30 minAgents Building Agents - Alfonso Graziano, Nearform
AI Engineer
- Golden Dataset 與評估基礎 — 與領域專家共同定義代理在各種輸入情況下的預期輸出,建立基線測試。評估不只是檢查數字正確,還包括代理應該調用哪些工具、工具的調用順序等複雜邏輯,形成非確定性環境下的測試套件。
- 自動化改進循環(Auto Agent) — 編碼代理可自主執行迭代優化:創建假設 → 修改代理代碼 → 執行評估 → 生成報告 → 判斷改進或回滾。實測從 18% 基線準確率改進到 83%(10 次迭代),甚至在已優化的生產代理上發現人類未發現的優化方式,達成 +10% 提升。
- 從實際用戶反饋改進 — 收集生產環境中真實用戶的使用 traces(包括輸入、工具調用、耗時、 token 消耗),搭配用戶反饋(讚/貶 + 註解)或領域專家的註解,聚類失敗模式,與專家驗證後生成修復提案並實施,將發現的失敗模式納入 golden dataset 防止回歸。




























