KeyFrame內部研究專用

This NEW Chinese AI Agent is INSANE! (FREE + Open Source)

Julian Goldie SEO·6月25日週四·8 min英文

三句話摘要

Alibaba開源推出QenAgent World,通過在AI內部構建虛擬世界進行代理訓練與模擬,性能超越GPT 5.4。 Alibaba通過虛擬世界訓練方法推出的開源QenAgent World首次在代理性能上超越最強閉源模型,預示著AI自動化系統即將從試驗性應用進入大規模生產階段。 虛擬世界模擬架構:QenAgent World改變傳統代理學習方式,不直接操作真實瀏覽器和文件,而是在AI內建立虛擬環境進行模擬練習,就像飛行模擬器之於飛行員,大幅降低成本、提升速度、便於擴展。

重點整理

重點
  • 1

    虛擬世界模擬架構:QenAgent World改變傳統代理學習方式,不直接操作真實瀏覽器和文件,而是在AI內建立虛擬環境進行模擬練習,就像飛行模擬器之於飛行員,大幅降低成本、提升速度、便於擴展。

  • 2

    性能超越業界領先:在Agent World Bench基準測試中,QenAgent World-397b得分58.71超越GPT 5.4的58.25,同時領先Claude Opus 4.8和Gemini 3.1 Pro,證明開源中文模型的競爭力。

  • 3

    真實數據驅動訓練:Alibaba基於搭建的真實物理環境記錄1000萬次真實交互數據進行訓練,而非合成虛假數據,確保模型對真實環境行為的模擬精度。

  • 4

    統一多環境模型:單一模型同時覆蓋MCP、搜尋、終端、軟體工程、網頁瀏覽、作業系統、Android七個環境,為業務自動化提供前所未有的可能性。

實用技巧與重點

乾貨
  • 模型與性能:
  • QenAgent World-397b(完整版)、QenAgent World-35b-A3b(開源版)
  • 得分:58.71(QenAgent World-397b)> 58.25(GPT 5.4)
  • 35B版本相比基礎模型提升:8.66點
  • 事實準確度改進:11.3%(但仍是最薄弱維度)
  • 訓練數據與方式:
  • 真實交互數據:1000萬+次
  • 訓練環境:真實物理服務器、虛擬機、真實瀏覽器、Ubuntu、macOS、Android
  • 三階段訓練:CPT(持續預訓練)→ SFT(監督微調)→ 強化學習
  • 覆蓋環境(7個):
  • MCP(模型上下文協議)
  • 搜尋模擬
  • 終端命令行
  • 軟體工程(代碼運行、測試、錯誤檢測)
  • 網頁瀏覽
  • 作業系統(桌面自動化、文件操作)
  • Android應用
  • 可用性:
  • 發布日期:2026年6月24日
  • 開源版本:已上傳Huggingface
  • 授權:完全免費、開源

結論

結論

Alibaba通過虛擬世界訓練方法推出的開源QenAgent World首次在代理性能上超越最強閉源模型,預示著AI自動化系統即將從試驗性應用進入大規模生產階段。

完整解析

詳細

Alibaba於2026年6月24日推出的QenAgent World代表了AI代理系統的一個根本性突破。傳統AI代理的學習方式是直接操作真實環境——打開實際瀏覽器、執行真實Google搜尋、操作實際文件——但這種方法存在明顯缺陷:成本高、速度慢、難以大規模複製。QenAgent World採用全新思路,在AI模型內部構建虛擬世界,讓代理先在模擬環境中練習和測試。這如同飛行模擬器之於飛行員的關係:飛行員不會直接駕駛真實飛機學習,而是在模擬器中多次失敗、觀察結果、學習規律,最後才駕駛真機。QenAgent World對AI代理採用同樣邏輯。

性能表現已經超越業界領先模型。QenAgent World-397b在Agent World Bench基準測試中獲得58.71分,超越目前最強的GPT 5.4(58.25分),同時領先Claude Opus 4.8和Gemini 3.1 Pro。更引人注目的是開源版QenAgent World-35b-A3b,相比其基礎模型改進了8.66點——這個幅度非常罕見,因為業界模型改進通常僅以小數百分比計。這些數字表明虛擬世界訓練方式的有效性。

Alibaba的訓練方式完全基於真實數據。他們並未使用合成虛假數據,而是搭建真實物理服務器和虛擬機環境,運行實際的Ubuntu、macOS和Android系統,配置真實瀏覽器,在這些真實環境上連續運行AI代理,記錄了超過1000萬次真實交互數據。模型訓練分三個階段:持續預訓練(CPT)讓模型學習環境如何運作、終端命令行的表現、網頁結構等;監督微調(SFT)教會模型預測序列中的下一步;強化學習則獎勵那些準確模擬環境的預測。值得注意的是,Alibaba公開了研究的局限性:事實準確度是最大挑戰,儘管相比之前改進了11.3%,但在各個評估維度中仍然是最薄弱的環節。

QenAgent World覆蓋七個環境且在單一模型內同時運作。MCP是AI工具間的通訊協議,搜尋模擬讓代理預測搜尋結果而無需實際查詢;終端模擬讓代理規劃命令序列並預測每一步的執行結果;軟體工程模擬可預測代碼運行結果、代碼審查反饋;網頁瀏覽模擬讓代理預測點擊效果和頁面內容,開啟了競爭分析自動化的可能;作業系統模擬可自動化桌面操作和文件管理;Android模擬則首次為行動應用自動化提供支撐。對業務應用而言,這意味著複雜工作流可以被預先規劃和驗證,大幅提升代理的可靠性和成功率。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。