KeyFrame內部研究專用

Qwen-AgentWorld: One AI Model That Simulates 7 Different Environments

Fahd Mirza·6月25日週四·9 min英文

三句話摘要

Quen推出Agent World Model——一個能在7種環境中預測系統反應的通用模型,使AI測試無需真實執行。 Agent World Model透過統一的開源模型預測跨域環境變化,使AI測試從真實執行轉向模擬預測,樹立了代理訓練與評估的新基準。 環境即訓練目標:不同於後來加入的模擬功能,團隊從訓練初期就以7個域的真實交互記錄作為基礎,讓模型優先學習環境本身,再學習推理,確保環保理解的完整性與準確性。

重點整理

重點
  • 1

    環境即訓練目標:不同於後來加入的模擬功能,團隊從訓練初期就以7個域的真實交互記錄作為基礎,讓模型優先學習環境本身,再學習推理,確保環保理解的完整性與準確性。

  • 2

    三階段訓練管道:預訓練灌入原始環境知識、監督微調激發逐步推理能力、強化學習锐化預測準確性,層層遞進確保輸出既忠實又一致。

  • 3

    跨域統一架構:同一模型能適配文本端(命令行、搜尋引擎、API、程式編輯)與GUI端(網頁、Android、桌面),且對每個環境的動作變化都能準確預測,打破了傳統特化模型的邊界。

  • 4

    測試效率革新:徹底替代真實環境執行,消除脆性與延遲,降低測試成本,使Agent評估成為可擴展的標準化過程。

實用技巧與重點

乾貨
  • 模型規格:Qwen 2.5 35B Mixture of Experts
  • 硬體需求:NVIDIA H100,VRAM 76GB,VLLM伺服
  • 模型大小:磁碟約70GB(含權重)
  • 支持的7個域:終端、搜尋引擎、API伺服器、程式編輯、網頁、Android螢幕、桌面OS
  • 評估基準:Agent12 Bench(跨7域的真實交互記錄,測預測狀態的格式正確性與邏輯一致性)
  • 訓練管道:連續預訓練 → 監督微調 → 強化學習
  • 推理能力示例:從兩次echo命令推斷檔案內容、欄位填充、API工具呼叫評估、跨轉記憶保留

結論

結論

Agent World Model透過統一的開源模型預測跨域環境變化,使AI測試從真實執行轉向模擬預測,樹立了代理訓練與評估的新基準。

完整解析

詳細

現實中每當要測試一個AI代理,工程師通常會提供真實環境——真實終端、真實API、真實瀏覽器、真實手機——來觀察代理的行為。這種方法雖然直觀,但潛藏著三個核心問題:速度慢(每次交互都要真實執行),易碎裂(環境變化立刻破壞測試),且成本高(基礎設施複雜)。Quen團隊由此提出一個根本性的反思:AI代理是否真的需要這些真實環境?如果一個模型能夠「想像」環境,預測終端會打印什麼、API會返回什麼、螢幕點擊後會變成什麼樣,問題是否就迎刃而解?

基於這個洞察,他們打造了Agent World Model——本質上是一個「環境模擬器」,而非傳統的聊天機器人或代理。這個模型的訓練邏輯也不同尋常。團隊並未是訓練一個通用模型後再硬生生接上「環境模擬」功能,而是從一開始就用七個域(終端、搜尋、API、程式編輯、網頁、Android、桌面OS)的大量真實交互記錄作為訓練基石。模型首先學會「世界」本身,再在此基礎上進行推理。在三階段管道中,連續預訓練負責灌入這些環境的原始知識,監督微調教導模型逐步推理下一個狀態(而非直接猜測),最後強化學習則確保預測既忠實於邏輯又保持一致性。

在實際演示中,講者透過VLLM在NVIDIA H100上本地部署了這個模型(佔用76GB VRAM)。一個簡單的測試是:給定一個虛擬終端中已執行的兩條echo命令(生成了兩個檔案),模型只需預測執行`cat requirements.txt`會輸出什麼——它完美地從先前的命令推斷出檔案內容,不需要真正調用shell。進一步的演示展示了模型在所有七個域上的能力:填充網頁表單時只改變對應欄位、在API協議中正確評估工具呼叫、甚至跨多次交互記住儲存的搜尋結果。這些預測都透過Agent12 Benchmark進行驗證——測試方式是檢查預測狀態的格式正確性、語義合理性和邏輯一致性。值得注意的是,這個開源模型在競爭中已能與閉源前沿模型持平,標誌著這不再是一個實驗性想法,而是一個真正可用的通用構建塊。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。