KeyFrame內部研究專用

Bringing agents onto the world wide web — Paul Klein IV, Browserbase

AI Engineer·8月14日週五·18 min中文

三句話摘要

瀏覽器自動化的瓶頸不在 AI 模型,而在系統工程——如何設計 Harness、基礎設施和信任框架,讓 Agent 真正在生產環境運作。 網頁自動化的瓶頸不是 AI 模型能力,而是工程系統設計——只要投入 Harness 工程、基礎設施和信任框架,就能释放 AI 早已具備但未被利用的潛力。 模型的能力過剩(Capabilities Overhang):講者認為 AI 模型已具備執行網頁自動化所需的能力,但因為缺乏適當的 Harness 和工程配套,導致這些能力沒有被充分發揮。這不是模型升級的問題,而是工程設計的問題。

重點整理

重點
  • 1

    模型的能力過剩(Capabilities Overhang):講者認為 AI 模型已具備執行網頁自動化所需的能力,但因為缺乏適當的 Harness 和工程配套,導致這些能力沒有被充分發揮。這不是模型升級的問題,而是工程設計的問題。

  • 2

    Harness 工程的決定性作用:就像編碼領域的 IDE 和工具能大幅提升模型效能一樣,為 Browser Agent 設計專門的 Harness(記憶、技能、Token 優化、工作流程)能讓同一個模型產生遠超基線的結果。每個公司都可以針對自己的場景設計 Harness,不必等待模型廠商改進。

  • 3

    多管齐下的可靠性:可靠的 Browser Agent 需要多模態(混合模型、代碼、網路層自動化)、優化的 Harness(技能復用、記憶系統),以及基礎設施一致性(確保 Agent 每次看到相同的頁面布局,避免隨機故障)。

  • 4

    網站改造和信任問題:網頁本身需要進化支持 Agent 訪問——透過無障礙樹(Accessibility Tree)、MCP 伺服器、Agent 身份認證;同時業界需要建立「Agent 信任簽署」機制(如 SSL 証書之於瀏覽器)來區分善意 Agent 與惡意爬蟲。

實用技巧與重點

乾貨
  • 三個必要條件:多模態(不同複雜度頁面用不同模型)、Harness 工程(記憶、技能、Token 優化)、基礎設施一致性
  • 工具與標準
  • browse.sh(發布網站技能)
  • Web MCP(網頁 MCP 伺服器)
  • 無障礙樹(Accessibility Tree)
  • Chrome 最新功能:網站內發布 MCP 伺服器,Agent 無需預先安裝
  • WorkOS AuthMD(Agent 自動註冊登入流程)
  • AutoBrows(Agent 自我優化框架)
  • Browserbase Agent 產品:整合 Harness、Runtime、Sandbox、代碼執行、Fetch、Search、模型,提供電池全裝(Battery-included)解決方案
  • 企業級挑戰
  • 服務帳戶權限管理
  • Agent 認證與授權
  • 人工審批迴圈(Human Loop)
  • 千台 Agent 規模基礎設施(vs. 個人用 Mac Mini)
  • Agent 身份信任(VeriSign for Web Agents)

結論

結論

網頁自動化的瓶頸不是 AI 模型能力,而是工程系統設計——只要投入 Harness 工程、基礎設施和信任框架,就能释放 AI 早已具備但未被利用的潛力。

完整解析

詳細

講者 Paul Klein 指出,過去一年 AI 社群在 Browser Agent 和網頁自動化上的投入未能帶來期望的突破,許多開發者因此感到沮喪。他提出一個新的觀點:問題不在 AI 模型,而在配套的工程系統。

模型確實在進步。去年同期,模型還難以處理長上下文和複雜任務,但這個瓶頸已被解決。現在的 AI 模型已足夠能幹,差的是如何有效地整合它們。講者引用過去的觀察——編碼領域之所以 Agent 表現卓越,是因為開發者為 Agent 構建了完整的 Harness 生態(IDE、編譯器、測試框架、除錯工具等)。同樣的邏輯套用到網頁自動化時,問題就變得明確:我們需要為 Browser Agent 設計等量的工程架構。

可靠的 Browser Agent 依賴三個要素。首先是多模態策略——不是只用一個模型盲目交互,而是依據頁面複雜度選用不同的模型,甚至混合代碼執行和網路層自動化。實務上,許多最可靠的生產 Agent 會在某些步驟寫程式碼而非點擊,因為那樣更高效。其次是 Harness 工程,包括記憶庫、技能集和 Token 優化。不是把整個頁面丟給模型讀,而是精心篩選關鍵信息,讓 Agent 透過先前學到的技能快速做決定。Browserbase 發布的 browse.sh 就是一例——提前告訴 Agent 某網站能做什麼,Agent 就能跳過探索階段。第三是基礎設施一致性——確保 Agent 每次看到相同的頁面、相同的布局、相同的大小。若基礎設施有時展示手機版、有時展示桌機版,Agent 就會產生不穩定的結果。

網頁本身也需進化。現代 Agent 已不只讀取 DOM,而是利用無障礙樹等標記化資訊。Chrome 最近的進展是允許網站直接在頁面內發布 MCP 伺服器,讓 Agent 得以調用高階工具(如「提交表單」)而非逐一點擊。但這引發企業級的挑戰:如何安全地授予 Agent 權限?Service Account 模式有限制,每次都要新增權限。講者認為,認證和授權是解鎖企業 Agent 的下一個大關卡。WorkOS 的 AuthMD 是個有趣的嘗試——讓 Agent 自動發現並填寫網站的註冊流程。構建軟體的人現在應該考慮:我的 Agent 優先簽入流程長什麼樣?

另一個未解的難題是信任。網路長期對抗惡意爬蟲,但現在我們有善意 Agent 和惡意 Bot 混在一起。CAPTCHA 不再有效。講者提出一個願景——業界需要一個「Agent 的 VeriSign」時刻,由某個權威機構頒發信任憑證,說明這是一個可信的 Agent、來自可信的廠商。目前還沒有人做到。

Browserbase 的新產品 Browserbase Agent 就是為了降低這些難度。用戶不必自行組裝工具和模型,只需輸入 Prompt,平台會自動搭建 Harness、Runtime、Sandbox、代碼執行環境和模型,並在過程中記住 Agent 學到的東西,下次遇到類似任務時自我改進。講者相信,一年後這個領域會迎來爆發,因為模型在改進、技術在進步、工具也在成熟——剩下的就是我們去做好工程。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。