KeyFrame內部研究專用

From RL to IRL — Gaurav Mishra, Amazon AGI Lab 2026-08-14 16:14

AI Engineer·8月14日週五·17 min中文

三句話摘要

強化學習訓練的 AI 代理如何在現實生活中安全有效地執行電腦操作任務——從模擬環境到真實部署的挑戰與解決方案。 強化學習代理在現實部署的成功,決定因素不是演算法本身,而是能否通過高保真模擬、多層安全框架和過程級監督,讓代理在訓練階段充分學會應對真實世界的混亂、失敗和對抗。 強化學習為何適合代理訓練:與有監督學習相比,強化學習擅長處理有可驗證結果、多個正確答案、難度適中的任務,特別是代碼生成。電腦使用任務完全符合此範式,因為郵件、聊天、網頁瀏覽等操作都可表示為代碼調用(MCP、API、Playwright)。

重點整理

重點
  • 1

    強化學習為何適合代理訓練:與有監督學習相比,強化學習擅長處理有可驗證結果、多個正確答案、難度適中的任務,特別是代碼生成。電腦使用任務完全符合此範式,因為郵件、聊天、網頁瀏覽等操作都可表示為代碼調用(MCP、API、Playwright)。

  • 2

    現實部署的六大陷阱:部分可觀測性(UI 信息不完整)、不可逆操作(提交後難以撤銷)、非決定論環境(網路延遲、廣告干擾)、臨時權限失效(登入過期)、模糊成功指標(完成表面任務卻產生副作用)、對抗性內容(設計誘導使用者的 UI)。演講中代理誤點廣告按鈕進入第三方網站的例子正是這些挑戰的體現。

  • 3

    三層改進框架:飛行模擬器(高保真沙箱必須包含布局偏移、加載緩慢、彈窗等,恢復要用原生工具如刷新、回溯、等待);飛行員改進(增強視覺理解、變化檢測、多源觀測能力);駕駛艙防護(檢查點回滾、風險分類器、凭證保護、執行監控、審計日誌、人工交接)。

  • 4

    訓練策略轉變:從被動重置環境改為讓代理學習恢復,從結果導向改為過程導向監督,從完全自主改為校準後的信心與適時交接。演講對比了早期代理誤點廣告與改進版本正確區分按鈕、主動交接登入的進展。

實用技巧與重點

乾貨
  • 強化學習核心組件
  • 任務:必須有可驗證結果、針對性強、難度適中
  • 環境:代碼沙箱(安全執行操作)
  • 驗證器:字串相等性檢查、編譯器、單元測試、資料庫查找、評分模型
  • 現實沙箱必須測試場景
  • 布局偏移、加載緩慢、標簽缺失、彈窗、焦點被奪、帳戶狀態隨機、標簽頁失效
  • 恢復原生工具/操作
  • 刷新、回溯、比較、等待、放棄、升級給使用者
  • AI 模型改進需求
  • 屏幕密度理解(高信息密度的視覺理解)
  • 語義理解(UI 元素用途識別)
  • 變化檢測(識別操作後的屏幕變化及其合理性)
  • 多源觀測融合(整合 DOM 和截圖信息)
  • 安全框架內建功能
  • 檢查點與回滾機制
  • 行動風險分類器(識別不安全操作)
  • 凭證保護機制(檢測登入狀態、註銷狀態)
  • 執行監控器(檢測循環點擊、無效模式)
  • 完整審計日誌(記錄所有行動與結果)
  • 人工交接選項(強制將控制權返還使用者)
  • 可用工具與平台
  • MCP 與 API 呼叫(郵件、聊天、檔案訪問)
  • Playwright JavaScript Web MCP(瀏覽器互動)
  • 網路搜尋 API

結論

結論

強化學習代理在現實部署的成功,決定因素不是演算法本身,而是能否通過高保真模擬、多層安全框架和過程級監督,讓代理在訓練階段充分學會應對真實世界的混亂、失敗和對抗。

完整解析

詳細

強化學習在 AI 代理訓練中展現出獨特優勢。講者來自亞馬遜 AGI 實驗室,曾在 Google 和 DeepMind 工作超過十年。強化學習相比有監督學習的關鍵優勢在於:當任務具有可驗證的結果、存在多個正確答案,但收集標註資料極其困難時,通過獎勵信號驅動的訓練效率更高。代碼生成完美符合此範式,因此成為強化學習最成功的應用。隨著技術進步,研究團隊發現這些代理不僅能寫代碼,還能執行任何可表示為代碼的任務——電子郵件、聊天、網頁搜尋、表單填寫等。通過 MCP、API 呼叫和 Playwright 等工具,代理理論上可以成為優秀的電腦使用者。

現實卻更為複雜。當代理部署到真實網路時,第一次失敗就揭示了隱藏的問題。在演講展示的第一個演示中,代理被要求輸入費用金額並提交,卻遭遇登出,隨後盲目猜測密碼直到帳戶被鎖定。更危險的是第二個演示:頁面上有廣告,其提交按鈕看似真實按鈕。代理不僅點錯按鈕進入第三方網站,還開始填寫個人資訊。這些失敗暴露了六大核心挑戰:部分可觀測性(UI 來自 DOM 和截圖,都不完整)、不可逆性(表單提交、檔案刪除後難以撤銷)、非決定論(網路延遲、加載時間不確定)、臨時權限(登入過期需重新認證)、模糊成功(完成表面任務卻產生副作用)、對抗性內容(廣告和設計引導)。

解決方案需要根本性思維轉變。講者用「飛行學校 vs. 考試」的比喻強調,代理必須在訓練階段經歷現實世界的所有混亂。第一層改進是「飛行模擬器」——高保真沙箱必須模擬布局偏移、緩慢加載、缺失標簽、彈窗、焦點爭奪等場景。更重要的是,恢復必須成為原生行為:當基礎設施出錯時,代理不能依賴環境重置,而要使用刷新、回溯、等待等真實工具恢復。第二層是改進「飛行員」(模型),需增強三方面能力:屏幕密度理解(快速識別高信息密度的 UI)、語義理解(理解不同元素的用途)、變化檢測(理解操作後屏幕的變化及其含義)、多源觀測融合(從不完整的信息源合成決策)。第三層是加強「駕駛艙」(框架)安全防護:檢查點與回滾機制、行動風險分類器(評估操作安全性)、凭證保護(偵測登入狀態)、執行監控(檢測循環或異常模式)、審計日誌(記錄所有行動用於事後追溯)、人工交接(當不確定時強制交還控制權)。

講者展示的改進演示展現了成果。面對同一任務,改進後的代理現在能區分真實按鈕和廣告按鈕。遇到登入過期時,它不再盲目猜測,而是說「我看到登入介面,凭證已過期」並主動交接給使用者重新登入。這種進步源於在訓練中充分模擬現實失敗。早期的安全護欄必須極其嚴格,確保捕捉每一個故障模式,讓代理從中學習,同時不傷害真實使用者。隨著模型改進,安全護欄可逐步放松。最後的關鍵洞察是:演示版和正式版的差異不在第一次點擊,而在第一次失敗後發生的事。訓練環節中對現實混亂的充分模擬,決定了代理在實際部署中是否能優雅地處理挑戰。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。