KeyFrame內部研究專用

Computer Use at the Edge of the Statistical Precipice — Pierluca D'Oro, Programma Labs

AI Engineer·8月14日週五·17 min中文

三句話摘要

計算機使用代理(Computer Use Agents)的基準測試評估方法論與設計原則。 嚴格的基準測試設計不是可選的工程細節,而是避免自欺欺人的防線——唯有多維度的環境隨機化與準確的不確定性度量,才能確保評分反映真實世界性能。 Replay Agent 的悖論:將前沿模型在基準測試中的成功軌跡記錄成無腦重放腳本,結果這個不足 1MB 的腳本在標準基準上表現與原模型相同甚至更好,說明基準測試本身存在被套路的結構問題。

重點整理

重點
  • 1

    Replay Agent 的悖論:將前沿模型在基準測試中的成功軌跡記錄成無腦重放腳本,結果這個不足 1MB 的腳本在標準基準上表現與原模型相同甚至更好,說明基準測試本身存在被套路的結構問題。

  • 2

    Pass@K 指標的隱患:現有評估方法在確定性環境下本質上是在測試 replay agent 的性能,形式上的「多次嘗試」實際無法對抗環境的可預測性,使指標失效。

  • 3

    PRISMP 環境設計原則:透過多因子變化(改變數據、UI、初始狀態)、驗證系統、沙盒隔離、驗證者機制和現實度約束,構建難以被套路的基準環境。

  • 4

    不確定性的準確度量:實務中信心區間覆蓋率僅 17-20%(遠低於預期 95%),需要同時考量動作變異性和環境變異性,避免在關鍵部署決策上因測量誤差付出代價。

實用技巧與重點

乾貨
  • Replay agent 大小:少於 1MB(對應數百任務基準)
  • DigiWord 基準規模:15 個 Android 應用、387 個已驗證場景、320 萬個配置、潛在擴展至數十億組合
  • 信心區間覆蓋率實測:17-20%(期望 95%)
  • 設計原則縮寫:PRISMP(Principle-based 環境設計框架,包含多因子、驗證、沙盒、驗證者、現實度五個維度)
  • 驗證系統架構:參數化任務模板 → 編譯器式驗證 → 模擬數據 → 配置生成與檢查
  • 變異軸度:初始狀態、傳送數據量、聯絡人/郵件內容、UI 主題、起始畫面

結論

結論

嚴格的基準測試設計不是可選的工程細節,而是避免自欺欺人的防線——唯有多維度的環境隨機化與準確的不確定性度量,才能確保評分反映真實世界性能。

完整解析

詳細

Computer use agents 的評估面臨一個深刻的方法論危機。演講者首先引入了「replay agent」的概念——這是一種極簡的對照組:將前沿大模型在基準測試中的成功軌跡(點擊、輸入、滾動序列)原樣記錄下來,編譯成一份盲目重放的腳本。看似無用的重放代理,在 OS World 和 Mobile World 等標準基準上卻能達到與原始前沿模型相近或更高的成功率。這個悖論性的發現指向一個不舒服的真相:現有基準測試擁有可被套路的確定性結構。

更糟的是,廣泛使用的 Pass@K 指標(K 次嘗試中至少一次成功的概率)在確定性環境中本質上等於在測試 replay agent 本身,形同虛設。這暴露的並非個別缺陷,而是整個評估框架的兩大類系統性問題:環境設計與指標設計。

為此,演講者提出了一套 PRISMP 環境設計原則。核心思想是通過多因子變化破壞環境的確定性——每次任務執行時,系統隨機改變傳送的數據內容、UI 主題、起始畫面等維度。但隨機生成容易產生無效配置,解決方案是建立編譯器式的驗證系統:從參數化任務模板出發,針對每個變異組合檢驗其有效性,只保留通過驗證的配置。基於這套方法論,研究團隊開發了 DigiWord 基準——包含 15 個 Android 應用、387 個已驗證場景,通過組合多個變異軸可生成 320 萬個配置,未來可輕鬆擴展至數十億級別。在這個健全的環境上重新評估 replay agent,其性能會顯著下滑,驗證了設計方法的有效性。

評估中同樣關鍵的是對不確定性的準確度量。現實中存在兩個獨立的變異來源:模型的隨機動作決策與環境自身的多因子變化。傳統的信心區間計算往往低估這種聯合不確定性——實測覆蓋率僅 17-20%,遠低於預期的 95%。這意味著當決策者基於虛假的高信度進行模型部署選擇時,4% 的真實性能差異會被完全忽視,導致長期決策失誤。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。