KeyFrame內部研究專用

Computer-Use 2.0: Agents Just Got Multi-Cursor — Francesco Bonacci, Cua

AI Engineer·7月15日週三·16 min英文

三句話摘要

Quad Driver、QuaBench 與 QuaFly 三大系統如何推進 GUI 代理的發展:從背景操作到評估再到訓練基礎設施。 透過 Quad Driver(背景操作)、QuaBench(可信評估)和 QuaFly(成本優化基礎設施),Quad 正在系統地解決 GUI agent 從開發、評估到大規模訓練的全鏈路問題。 Computer Use 的演進:從 1.0 時代的傳統人工循環(screenshot → reasoning → clicking)到背景操作,Quad Driver 透過利用 Apple 框架中的未公開 API 和可訪問性樹,實現 agent 在背景執行操作而不佔用螢幕的技術突破。

重點整理

重點
  • 1

    Computer Use 的演進:從 1.0 時代的傳統人工循環(screenshot → reasoning → clicking)到背景操作,Quad Driver 透過利用 Apple 框架中的未公開 API 和可訪問性樹,實現 agent 在背景執行操作而不佔用螢幕的技術突破。

  • 2

    評估的多維度設計:QuaBench 不只測試 agent 能否完成任務,還透過「fork 機制」和預測探測(predict reward、internal state)來測量 agent 的世界模型,即理解操作環境的能力;每個任務都要先被內部團隊用 reward hacking 測試,確保評估本身可信。

  • 3

    實績差距的誠實披露:QuaBench ICAD 在電氣工程任務上的成功率只有 24%,且從零開始的任務成功率為 0%,說明即使最先進的 model 在複雜現實任務上的能力仍有巨大改進空間。

  • 4

    訓練成本的基礎設施優化:QuaFly 透過「沙盒池 + 需求型自動擴展」架構,讓 GPU 保持滿載狀態,將沙盒啟動的成本轉移到更便宜的基礎設施端,節省 2-4 倍成本。

實用技巧與重點

乾貨
  • Quad Driver:開源專案,支援 macOS/Windows/Linux;使用可訪問性樹(accessibility tree)+ 螢幕截圖雙層方案;8 個應用程序測試框架確保跨版本相容
  • 早期採用者:Kiki、Hermes、Quencodo、H company、Droid Factory
  • QuaBench 資料集:130+ 可驗證任務、42 個環境、5 個平台
  • QuaBench ICAD:與 Snorkel AI 合作開發;電氣工程任務;頂級 agent 通過率 6/25(24%);編輯現有原理圖 100% 成功、從零開始 0% 成功;所有 model 最高 30% reward
  • QuaBench Basic 4K 測試:Quad Driver 方案 pass rate 62% → 80%(提升 18%),token 消耗降低 34%
  • QuaFly:支援 Windows、Linux、Android;沙盒基礎設施成本為 GPU 的 1/2-1/4;需求型自動擴展,可在訓練過程中動態調整池大小

結論

結論

透過 Quad Driver(背景操作)、QuaBench(可信評估)和 QuaFly(成本優化基礎設施),Quad 正在系統地解決 GUI agent 從開發、評估到大規模訓練的全鏈路問題。

完整解析

詳細

計算機使用代理(computer use agent)在過去一年來快速演進。Francesco 回溯了團隊在微軟時代研究的早期 GUI agent 工作,當時採用的是「Computer Use 1.0」模式:agent 截取螢幕、進行推理規劃、再執行點擊或輸入等動作,本質上是一個同步的人工循環。

兩個月前,Quad Driver 在開源社區發佈,帶來了關鍵突破。Quad Driver 解決了一個核心痛點:agent 不再需要接管使用者的螢幕。這背後的技術巧妙地利用了 Apple 框架中未公開的 API 以及標準的可訪問性樹協議。系統的工作流程是先捕獲窗口狀態(同時取得可訪問性樹和螢幕截圖),嘗試用可訪問性樹進行背景執行,若不可行則降級到像素級點擊。這套設計不只在 macOS 上可行,也支援 Windows 和 Linux。為了確保穩定性,團隊維護了 8 個應用程序測試框架來驗證跨版本相容性。

評估 agent 能力的核心工具是 QuaBench。不同於簡單的任務測試,QuaBench 的設計更像一個完整的實驗框架:每個任務包含初始化函數(setup)、標準軌跡(oracle,即 GUI 操作序列)和評估函數(evaluator)。團隊已累積了 130 多個可驗證的任務,涵蓋 42 個環境和 5 個平台。特別值得一提的是與 Snorkel AI 合作開發的 QuaBench ICAD,這個資料集使用真實專業人士的電氣工程軟體,並用電路模擬器作為評估標準。測試結果出人意料地謙遜:頂級 agent 在 25 個任務中只通過了 6 個,且所有通過任務都涉及編輯現有原理圖,從零開始設計的成功率是 0%。進一步觀察發現,QuaBench Basic 上使用 Quad Driver 的 agent 表現從 62% 提升到 80% pass rate,同時減少了 34% 的 token 消耗。

在訓練基礎設施層面,Rob 指出了一個常被忽視的成本洞穴:在強化學習訓練中,GPU 經常在等待沙盒啟動或重置時處於閒置。尤其在電腦使用 agent 訓練中,環境可能高達 40GB,啟動時間長。QuaFly 的解決方案是採用「沙盒池 + 需求型自動擴展」模式:系統動態偵測有多少個 GPU 需要沙盒,自動調整池的大小,成本可降低 2-4 倍。這樣做的好處是 GPU 工作者始終保持滿載,沙盒啟動的延遲成本轉嫁給更便宜的基礎設施。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。