Computer-Use 2.0: Agents Just Got Multi-Cursor — Francesco Bonacci, Cua
三句話摘要
Quad Driver、QuaBench 與 QuaFly 三大系統如何推進 GUI 代理的發展:從背景操作到評估再到訓練基礎設施。 透過 Quad Driver(背景操作)、QuaBench(可信評估)和 QuaFly(成本優化基礎設施),Quad 正在系統地解決 GUI agent 從開發、評估到大規模訓練的全鏈路問題。 Computer Use 的演進:從 1.0 時代的傳統人工循環(screenshot → reasoning → clicking)到背景操作,Quad Driver 透過利用 Apple 框架中的未公開 API 和可訪問性樹,實現 agent 在背景執行操作而不佔用螢幕的技術突破。
重點整理
重點- 1
Computer Use 的演進:從 1.0 時代的傳統人工循環(screenshot → reasoning → clicking)到背景操作,Quad Driver 透過利用 Apple 框架中的未公開 API 和可訪問性樹,實現 agent 在背景執行操作而不佔用螢幕的技術突破。
- 2
評估的多維度設計:QuaBench 不只測試 agent 能否完成任務,還透過「fork 機制」和預測探測(predict reward、internal state)來測量 agent 的世界模型,即理解操作環境的能力;每個任務都要先被內部團隊用 reward hacking 測試,確保評估本身可信。
- 3
實績差距的誠實披露:QuaBench ICAD 在電氣工程任務上的成功率只有 24%,且從零開始的任務成功率為 0%,說明即使最先進的 model 在複雜現實任務上的能力仍有巨大改進空間。
- 4
訓練成本的基礎設施優化:QuaFly 透過「沙盒池 + 需求型自動擴展」架構,讓 GPU 保持滿載狀態,將沙盒啟動的成本轉移到更便宜的基礎設施端,節省 2-4 倍成本。
實用技巧與重點
乾貨- Quad Driver:開源專案,支援 macOS/Windows/Linux;使用可訪問性樹(accessibility tree)+ 螢幕截圖雙層方案;8 個應用程序測試框架確保跨版本相容
- 早期採用者:Kiki、Hermes、Quencodo、H company、Droid Factory
- QuaBench 資料集:130+ 可驗證任務、42 個環境、5 個平台
- QuaBench ICAD:與 Snorkel AI 合作開發;電氣工程任務;頂級 agent 通過率 6/25(24%);編輯現有原理圖 100% 成功、從零開始 0% 成功;所有 model 最高 30% reward
- QuaBench Basic 4K 測試:Quad Driver 方案 pass rate 62% → 80%(提升 18%),token 消耗降低 34%
- QuaFly:支援 Windows、Linux、Android;沙盒基礎設施成本為 GPU 的 1/2-1/4;需求型自動擴展,可在訓練過程中動態調整池大小
結論
結論“透過 Quad Driver(背景操作)、QuaBench(可信評估)和 QuaFly(成本優化基礎設施),Quad 正在系統地解決 GUI agent 從開發、評估到大規模訓練的全鏈路問題。”
完整解析
詳細計算機使用代理(computer use agent)在過去一年來快速演進。Francesco 回溯了團隊在微軟時代研究的早期 GUI agent 工作,當時採用的是「Computer Use 1.0」模式:agent 截取螢幕、進行推理規劃、再執行點擊或輸入等動作,本質上是一個同步的人工循環。
兩個月前,Quad Driver 在開源社區發佈,帶來了關鍵突破。Quad Driver 解決了一個核心痛點:agent 不再需要接管使用者的螢幕。這背後的技術巧妙地利用了 Apple 框架中未公開的 API 以及標準的可訪問性樹協議。系統的工作流程是先捕獲窗口狀態(同時取得可訪問性樹和螢幕截圖),嘗試用可訪問性樹進行背景執行,若不可行則降級到像素級點擊。這套設計不只在 macOS 上可行,也支援 Windows 和 Linux。為了確保穩定性,團隊維護了 8 個應用程序測試框架來驗證跨版本相容性。
評估 agent 能力的核心工具是 QuaBench。不同於簡單的任務測試,QuaBench 的設計更像一個完整的實驗框架:每個任務包含初始化函數(setup)、標準軌跡(oracle,即 GUI 操作序列)和評估函數(evaluator)。團隊已累積了 130 多個可驗證的任務,涵蓋 42 個環境和 5 個平台。特別值得一提的是與 Snorkel AI 合作開發的 QuaBench ICAD,這個資料集使用真實專業人士的電氣工程軟體,並用電路模擬器作為評估標準。測試結果出人意料地謙遜:頂級 agent 在 25 個任務中只通過了 6 個,且所有通過任務都涉及編輯現有原理圖,從零開始設計的成功率是 0%。進一步觀察發現,QuaBench Basic 上使用 Quad Driver 的 agent 表現從 62% 提升到 80% pass rate,同時減少了 34% 的 token 消耗。
在訓練基礎設施層面,Rob 指出了一個常被忽視的成本洞穴:在強化學習訓練中,GPU 經常在等待沙盒啟動或重置時處於閒置。尤其在電腦使用 agent 訓練中,環境可能高達 40GB,啟動時間長。QuaFly 的解決方案是採用「沙盒池 + 需求型自動擴展」模式:系統動態偵測有多少個 GPU 需要沙盒,自動調整池的大小,成本可降低 2-4 倍。這樣做的好處是 GPU 工作者始終保持滿載,沙盒啟動的延遲成本轉嫁給更便宜的基礎設施。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


