Simon Obstbaum & Rob Willoughby - Why evals are hard and how we're solving it - AI Native DevCon Jun
三句話摘要
如何從定性評估轉向定量測量來評估AI代理效能,以及代碼庫結構和Skills對代理表現的決定性影響。 --- 結構化工具(尤其是Skills)通過編碼組織特定規則來指導代理,使其不僅完成任務,還按組織標準完成任務,這是AI工程從「感覺評估」進化到「量化治理」的關鍵轉折點。 從定性到定量的測量轉變:傳統評估依賴「這個Demo看起來很酷」的感性判斷,但軟體工程學科成熟需要系統化測量。Stanford研究建立了以專家評審為基礎的框架,邀請專家評估實現時間、質量、可維護性等維度,觀察到專家間的一致性異常高(工程界罕見),隨後訓練機器學習模型規模化複製這套評估流程。
重點整理
重點- 1
從定性到定量的測量轉變:傳統評估依賴「這個Demo看起來很酷」的感性判斷,但軟體工程學科成熟需要系統化測量。Stanford研究建立了以專家評審為基礎的框架,邀請專家評估實現時間、質量、可維護性等維度,觀察到專家間的一致性異常高(工程界罕見),隨後訓練機器學習模型規模化複製這套評估流程。
- 2
三個層級的性能差異:團隊層差異達60%(2026年7月),但排名穩定性從0.70降至0.45,意味著過去的優秀表現者不再自動優秀——假設是代碼審查等任務被自動化,高級工程師重新投入編碼而翻身。個人層差異最大,懂編排代理的工程師成績顯著領先,這是迄今觀察到最大的性能差異。
- 3
代碼庫結構的決定性作用:L1級(無結構)採用AI反而增加複雜度、警告、重複度;L2級引入Skills、指令、工具鏈後,PR吞吐量增加、回退率和代碼重複度下降。這證明工具鏈和結構是AI有效運作的前提條件。
- 4
Skills作為企業知識編碼工具:Skills不是讓代理做新事情,而是用組織特定規則指導它做對。以Huggingface新舊CLI為例,新CLI在模型訓練截止後發布,代理無法自動知曉,需透過Skill編碼這一知識。即使任務完成度相同,通過Skill指導使用新版本最佳實踐,避免代碼停留在過去。
- 5
--
實用技巧與重點
乾貨- 研究規模與數據
- Stanford Sweeper Lab參與者:150,000名工程師,多家企業,為期一年研究周期
- 論文投稿:ASE (IEEE Automated Software Engineering Conference),2026年10月發表
- 性能指標
- AI採納產出差異:Q1-Q3 2023年為5%,2026年7月達60%
- 排名穩定性(Rank Stability):AI前0.70 → AI後0.45
- 目標完成度(Goal Completion):90-93%(有無Skill差異不大)
- 指令遵循率(Instruction Following):無Skill時55%,有Skill時顯著提升
- 成熟度等級改善
- L1→L2轉變:PR吞吐量↑、回退率↓、代碼重複度↓、認知複雜度↓
- 任務數據集規模
- 500個Skills、1,000個Tasks、19個Configs(模型+harness組合)
- Skills效能分佈(按改善幅度)
- 媒體/文件處理、內容/文檔、安全/合規:高改善
- 數據處理:中等改善(patterns較多標準化)
- 測試QA:模型已大量訓練TDD,改善空間有限
- 測量三層結構
- Skill激活率:在多個Skill競爭時確保目標Skill被觸發
- 工作流軌跡:驗證工作步驟是否按預期序列執行
- 最終結果:任務是否成功完成
- 系統層影響
- 改變模型的運行Harness可使分數移動100%
- 新指標
- Stanford AI Spend Index:每月發布AI支出/開發者統計
- --
結論
結論“結構化工具(尤其是Skills)通過編碼組織特定規則來指導代理,使其不僅完成任務,還按組織標準完成任務,這是AI工程從「感覺評估」進化到「量化治理」的關鍵轉折點。”
完整解析
詳細軟體工程作為一門學科經過數十年才從定性評估演進到定量測量。如今AI代理工程也面臨同樣的成熟挑戰。傳統上我們評估代理表現依賴「vibes」——演示效果、執行速度、代碼質感。但在150,000名工程師的大規模研究中,Stanford Sweeper Lab需要系統化地理解AI對整個產業生產力的真實影響。
研究團隊首先建立了以專家評審為基礎的測量框架。當工程師提交代碼時,邀請領域專家評估,問卷涵蓋實現時間預估、質量、可維護性等多個維度。令人驚訝的是,這些獨立專家間的一致性極高,這在工程領域是罕見的。基於這套高度一致的評估,研究人員訓練了機器學習模型來規模化複製專家判斷。經驗證,這個模型與公司時間記錄、任務追踪等實際數據相關性良好。
研究揭示了三層級的性能差異。在團隊層,使用AI的團隊相比未使用團隊,輸出差異從2023年的5%擴大到2026年7月的60%。更有趣的是排名穩定性(Rank Stability)從0.70大幅下降到0.45,說明過去的優秀表現者不再自動維持優秀。一個假設是,之前專注代碼審查和幫助團隊的員工(通常是高級工程師),在代碼審查、文檔等任務被自動化後,現在有更多時間投入直接編碼,反而成為新的頂級表現者。在個人層,差異達到迄今觀察的最高——懂得編排代理和使用AI的工程師取得顯著領先成績。
結構化工具的重要性體現在四個成熟度等級(L1-L4)中。L1級代碼庫完全缺乏AI配置和工具,使用AI反而導致認知複雜度增加、靜態分析警告增加、代碼重複度上升。這是因為代理沒有任何指導就野蠻地生成代碼。但當進入L2級,引入基本結構如Skills、指令、工具鏈後,PR吞吐量明顯增加,回退率反而下降,代碼重複度和認知複雜度都下降。這證實了一個關鍵洞察:工具和結構不是奢侈品,而是AI有效運作的前提。
Skills框架則是編碼企業特定知識的核心機制。代理需要指導的領域主要包括:庫和API選擇(組織允許的依賴項清單)、約定和必要步驟(環境配置、基礎設施即代碼等)、禁止或已棄用的模式(安全限制、法規要求)。以Huggingface CLI為例說明:舊版使用登錄令牌,新版(在模型訓練截止後發布)改為環境變量。當你讓代理實現Huggingface CLI調用時,它會使用舊方法——因為新方法在訓練數據中不存在。任務表面上完成了(向後兼容),但代碼停留在過去。通過Skill編碼「使用新CLI的環境變量模式」,可指導代理採用現代最佳實踐。研究發現,Skills對指令遵循率的最大提升來自於組織有明確意見和本地規範的領域:媒體處理慣例、文檔風格、安全策略、數據處理流程。而測試QA的改善幅度較小,因為模型已在TDD上訓練得很充分。
測量不應止於最終結果。Rob強調需要測量完整路徑:第一,Skill是否被激活(在眾多Skills競爭上下文窗口時,激活困難);第二,工作流軌跡(代理是否按預期步驟執行);第三,才是最終結果。一個驚人發現是,改變模型運行的Harness可使分數移動100%,說明測試必須評估完整系統而非單一模型。
展望未來,Stanford推出AI Spend Index,每月發布基於150,000工程師的AI支出統計。通過連接代理使用、成本、團隊結構和產出數據,未來可回答「組織應該花多少token」這一關鍵問題。
---
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


