KeyFrame內部研究專用

Perception Agents — Antje Barth, Amazon AGI Lab

AI Engineer·7月23日週四·21 min英文

三句話摘要

從計算機控制到認知理解:感知型代理如何填補自動化的最後一哩路。 感知型代理通過共享上下文、多模態感知和驗證機制,將代理從「能做單步」升級為「能做完整工作」,從根本上解決知識工作中的可靠性困境。 端到端工作的「接縫問題」:代理能用好每一個工具,卻難以協調多個系統間的工作流。真正的工作不在於單個操作的能力,而在於如何無縫銜接不同應用之間的步驟——這是現有代理最大的失敗點。

重點整理

重點
  • 1

    端到端工作的「接縫問題」:代理能用好每一個工具,卻難以協調多個系統間的工作流。真正的工作不在於單個操作的能力,而在於如何無縫銜接不同應用之間的步驟——這是現有代理最大的失敗點。

  • 2

    可靠性決定信任:代碼領域之所以率先突破是因為代碼可驗證——可以執行、測試、檢查。但大多數知識工作(報告是否有效果、設計是否符合品牌)無法用單元測試驗證,這導致代理無法達到「九個九」級別的可靠性,使用者自然無法信任。

  • 3

    共享感知是關鍵:人類在同事協作時能快速解決問題,是因為雙方看著同一個屏幕。感知型代理需要看到渲染後的視覺狀態而非代碼,才能與使用者建立共同理解,減少解釋成本和歧義。

  • 4

    多模態感知擴展應用邊界:代理不只需要視覺感知,還可透過語音轉錄聽到討論內容,將會議對話直接轉化為設計指令,證明「感知」遠超單純視覺層面。

實用技巧與重點

乾貨
  • 主講者單位:Amazon AGI Lab
  • 核心概念:Perception Agents(感知型代理)
  • 開源工具
  • 標註工具:Chrome extension,支援標記頁面元素、描述變更(顏色、字型大小等)
  • 驗證工具:設計規則文件(Design MD),自動檢查視覺一致性和用戶流程
  • 驗證類型
  • 視覺檢查(品牌一致性、佈局正確性)
  • 用戶流程測試(如編輯任務、刪除任務等實際操作)
  • 應用場景示例:新員工入職流程(涉及5個不同系統)、網站設計迭代
  • 合作工具:B devices(提供會議錄音轉錄功能)
  • 發布方式:GitHub開源
  • 相關資源
  • 播客:Danielle Persig(認知科學家,Amazon AGI Lab ACI團隊負責人)
  • 其他會議演講:Gaurav Mishra在電腦使用軌道的「From RL to IRL」演講

結論

結論

感知型代理通過共享上下文、多模態感知和驗證機制,將代理從「能做單步」升級為「能做完整工作」,從根本上解決知識工作中的可靠性困境。

完整解析

詳細

代理的自動化技術已突破「會點擊」的初級階段,但使用者卻發現一個矛盾:代理能執行瀏覽器操作、桌面應用控制,甚至單個系統內的復雜工作流,但當涉及跨系統的真實業務流程時,失敗率奇高。以新員工入職為例,涉及Slack、笆籍系統、日誌系統、採購等五個不同應用,代理雖然能各自完成「添加到Slack」「預訂同事介紹」「訂購筆記本」等步驟,卻無法有機地把這些步驟串聯成完整的端到端工作。問題不在於單步能力,而在於系統間的「接縫」——代理執行後就移開了,既不觀察結果,也不知道何時該切換到下一個應用。

這一瓶頸的根本原因在於可靠性與信任。觀察代碼領域的成功模式就能明白:自動完成、函數生成、甚至代理自主開啟拉取請求,為什麼使用者願意信任?因為代碼可驗證——你能執行它、測試它、確認它如預期運行。但知識工作不同。「報告成功著陸了嗎?」「設計符合品牌規範嗎?」「這是我想要的嗎?」沒有單元測試能回答這些問題。知識工作本質上是「亂」的——它生活在各種應用的邊界縫隙中,沒人已經完全解決過。

講者提出的解決方案來自觀察人類協作方式。當同事跳進Zoom會議討論問題時,雙方看著同一個屏幕,能迅速達成共識。這個共享感知才是關鍵。因此,感知型代理應該是這樣的系統:它不但能看到屏幕、能點擊、能輸入(既有能力),更重要的是,它應該像人一樣感知——看到渲染後的視覺狀態而非HTML代碼,理解佈局和實時變化,甚至能在使用者工作時實時反應,而不是「發送提示→等待→代理回來→可能需要多輪溝通」的低效循環。

Amazon AGI Lab開源了感知型代理工具鏈的前兩個核心部分。第一是標註工具——一個Chrome擴展,使用者可直接在屏幕上標記要修改的元素。比如圈出標題說「改成紅色」、選中按鈕說「字體加倍」,工具自動捕捉該元素的位置和風格屬性,生成結構化摘要給代理——不需要冗長描述,訊號更清晰、損失更小。第二是驗證工具,定義設計規則(顏色、排版、組件等)放入設計MD文件,代理執行變更後自動檢查:一是視覺檢查(是否符合品牌、佈局正確),二是用戶流程測試(如代理自動模擬編輯任務、刪除任務等操作),最後生成驗證報告——使用者無需深夜逐一點擊測試。

超越屏幕的應用也在進行。講者在會議展示了與同事使用B設備進行設計會議的實驗:兩人邊討論邊戴著具備轉錄功能的設備,系統自動轉錄對話,並將設計建議(如「背景改黃色、標題改紅色」)直接轉化為代理指令並應用——證明「感知」不只是視覺,還包括語境理解和多模態輸入。這些工具仍在開發初期,講者呼籲社區試用、反饋,因為只有更多人使用、測試和改進,這些模式才能真正成熟。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。