Bringing agents onto the world wide web — Paul Klein IV, Browserbase
三句話摘要
瀏覽器自動化的瓶頸不在 AI 模型,而在系統工程——如何設計 Harness、基礎設施和信任框架,讓 Agent 真正在生產環境運作。 網頁自動化的瓶頸不是 AI 模型能力,而是工程系統設計——只要投入 Harness 工程、基礎設施和信任框架,就能释放 AI 早已具備但未被利用的潛力。 模型的能力過剩(Capabilities Overhang):講者認為 AI 模型已具備執行網頁自動化所需的能力,但因為缺乏適當的 Harness 和工程配套,導致這些能力沒有被充分發揮。這不是模型升級的問題,而是工程設計的問題。
重點整理
重點- 1
模型的能力過剩(Capabilities Overhang):講者認為 AI 模型已具備執行網頁自動化所需的能力,但因為缺乏適當的 Harness 和工程配套,導致這些能力沒有被充分發揮。這不是模型升級的問題,而是工程設計的問題。
- 2
Harness 工程的決定性作用:就像編碼領域的 IDE 和工具能大幅提升模型效能一樣,為 Browser Agent 設計專門的 Harness(記憶、技能、Token 優化、工作流程)能讓同一個模型產生遠超基線的結果。每個公司都可以針對自己的場景設計 Harness,不必等待模型廠商改進。
- 3
多管齐下的可靠性:可靠的 Browser Agent 需要多模態(混合模型、代碼、網路層自動化)、優化的 Harness(技能復用、記憶系統),以及基礎設施一致性(確保 Agent 每次看到相同的頁面布局,避免隨機故障)。
- 4
網站改造和信任問題:網頁本身需要進化支持 Agent 訪問——透過無障礙樹(Accessibility Tree)、MCP 伺服器、Agent 身份認證;同時業界需要建立「Agent 信任簽署」機制(如 SSL 証書之於瀏覽器)來區分善意 Agent 與惡意爬蟲。
實用技巧與重點
乾貨- 三個必要條件:多模態(不同複雜度頁面用不同模型)、Harness 工程(記憶、技能、Token 優化)、基礎設施一致性
- 工具與標準:
- browse.sh(發布網站技能)
- Web MCP(網頁 MCP 伺服器)
- 無障礙樹(Accessibility Tree)
- Chrome 最新功能:網站內發布 MCP 伺服器,Agent 無需預先安裝
- WorkOS AuthMD(Agent 自動註冊登入流程)
- AutoBrows(Agent 自我優化框架)
- Browserbase Agent 產品:整合 Harness、Runtime、Sandbox、代碼執行、Fetch、Search、模型,提供電池全裝(Battery-included)解決方案
- 企業級挑戰:
- 服務帳戶權限管理
- Agent 認證與授權
- 人工審批迴圈(Human Loop)
- 千台 Agent 規模基礎設施(vs. 個人用 Mac Mini)
- Agent 身份信任(VeriSign for Web Agents)
結論
結論“網頁自動化的瓶頸不是 AI 模型能力,而是工程系統設計——只要投入 Harness 工程、基礎設施和信任框架,就能释放 AI 早已具備但未被利用的潛力。”
完整解析
詳細講者 Paul Klein 指出,過去一年 AI 社群在 Browser Agent 和網頁自動化上的投入未能帶來期望的突破,許多開發者因此感到沮喪。他提出一個新的觀點:問題不在 AI 模型,而在配套的工程系統。
模型確實在進步。去年同期,模型還難以處理長上下文和複雜任務,但這個瓶頸已被解決。現在的 AI 模型已足夠能幹,差的是如何有效地整合它們。講者引用過去的觀察——編碼領域之所以 Agent 表現卓越,是因為開發者為 Agent 構建了完整的 Harness 生態(IDE、編譯器、測試框架、除錯工具等)。同樣的邏輯套用到網頁自動化時,問題就變得明確:我們需要為 Browser Agent 設計等量的工程架構。
可靠的 Browser Agent 依賴三個要素。首先是多模態策略——不是只用一個模型盲目交互,而是依據頁面複雜度選用不同的模型,甚至混合代碼執行和網路層自動化。實務上,許多最可靠的生產 Agent 會在某些步驟寫程式碼而非點擊,因為那樣更高效。其次是 Harness 工程,包括記憶庫、技能集和 Token 優化。不是把整個頁面丟給模型讀,而是精心篩選關鍵信息,讓 Agent 透過先前學到的技能快速做決定。Browserbase 發布的 browse.sh 就是一例——提前告訴 Agent 某網站能做什麼,Agent 就能跳過探索階段。第三是基礎設施一致性——確保 Agent 每次看到相同的頁面、相同的布局、相同的大小。若基礎設施有時展示手機版、有時展示桌機版,Agent 就會產生不穩定的結果。
網頁本身也需進化。現代 Agent 已不只讀取 DOM,而是利用無障礙樹等標記化資訊。Chrome 最近的進展是允許網站直接在頁面內發布 MCP 伺服器,讓 Agent 得以調用高階工具(如「提交表單」)而非逐一點擊。但這引發企業級的挑戰:如何安全地授予 Agent 權限?Service Account 模式有限制,每次都要新增權限。講者認為,認證和授權是解鎖企業 Agent 的下一個大關卡。WorkOS 的 AuthMD 是個有趣的嘗試——讓 Agent 自動發現並填寫網站的註冊流程。構建軟體的人現在應該考慮:我的 Agent 優先簽入流程長什麼樣?
另一個未解的難題是信任。網路長期對抗惡意爬蟲,但現在我們有善意 Agent 和惡意 Bot 混在一起。CAPTCHA 不再有效。講者提出一個願景——業界需要一個「Agent 的 VeriSign」時刻,由某個權威機構頒發信任憑證,說明這是一個可信的 Agent、來自可信的廠商。目前還沒有人做到。
Browserbase 的新產品 Browserbase Agent 就是為了降低這些難度。用戶不必自行組裝工具和模型,只需輸入 Prompt,平台會自動搭建 Harness、Runtime、Sandbox、代碼執行環境和模型,並在過程中記住 Agent 學到的東西,下次遇到類似任務時自我改進。講者相信,一年後這個領域會迎來爆發,因為模型在改進、技術在進步、工具也在成熟——剩下的就是我們去做好工程。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


