This NEW Chinese AI Agent is INSANE! (FREE + Open Source)
三句話摘要
Alibaba開源推出QenAgent World,通過在AI內部構建虛擬世界進行代理訓練與模擬,性能超越GPT 5.4。 Alibaba通過虛擬世界訓練方法推出的開源QenAgent World首次在代理性能上超越最強閉源模型,預示著AI自動化系統即將從試驗性應用進入大規模生產階段。 虛擬世界模擬架構:QenAgent World改變傳統代理學習方式,不直接操作真實瀏覽器和文件,而是在AI內建立虛擬環境進行模擬練習,就像飛行模擬器之於飛行員,大幅降低成本、提升速度、便於擴展。
重點整理
重點- 1
虛擬世界模擬架構:QenAgent World改變傳統代理學習方式,不直接操作真實瀏覽器和文件,而是在AI內建立虛擬環境進行模擬練習,就像飛行模擬器之於飛行員,大幅降低成本、提升速度、便於擴展。
- 2
性能超越業界領先:在Agent World Bench基準測試中,QenAgent World-397b得分58.71超越GPT 5.4的58.25,同時領先Claude Opus 4.8和Gemini 3.1 Pro,證明開源中文模型的競爭力。
- 3
真實數據驅動訓練:Alibaba基於搭建的真實物理環境記錄1000萬次真實交互數據進行訓練,而非合成虛假數據,確保模型對真實環境行為的模擬精度。
- 4
統一多環境模型:單一模型同時覆蓋MCP、搜尋、終端、軟體工程、網頁瀏覽、作業系統、Android七個環境,為業務自動化提供前所未有的可能性。
實用技巧與重點
乾貨- 模型與性能:
- QenAgent World-397b(完整版)、QenAgent World-35b-A3b(開源版)
- 得分:58.71(QenAgent World-397b)> 58.25(GPT 5.4)
- 35B版本相比基礎模型提升:8.66點
- 事實準確度改進:11.3%(但仍是最薄弱維度)
- 訓練數據與方式:
- 真實交互數據:1000萬+次
- 訓練環境:真實物理服務器、虛擬機、真實瀏覽器、Ubuntu、macOS、Android
- 三階段訓練:CPT(持續預訓練)→ SFT(監督微調)→ 強化學習
- 覆蓋環境(7個):
- MCP(模型上下文協議)
- 搜尋模擬
- 終端命令行
- 軟體工程(代碼運行、測試、錯誤檢測)
- 網頁瀏覽
- 作業系統(桌面自動化、文件操作)
- Android應用
- 可用性:
- 發布日期:2026年6月24日
- 開源版本:已上傳Huggingface
- 授權:完全免費、開源
結論
結論“Alibaba通過虛擬世界訓練方法推出的開源QenAgent World首次在代理性能上超越最強閉源模型,預示著AI自動化系統即將從試驗性應用進入大規模生產階段。”
完整解析
詳細Alibaba於2026年6月24日推出的QenAgent World代表了AI代理系統的一個根本性突破。傳統AI代理的學習方式是直接操作真實環境——打開實際瀏覽器、執行真實Google搜尋、操作實際文件——但這種方法存在明顯缺陷:成本高、速度慢、難以大規模複製。QenAgent World採用全新思路,在AI模型內部構建虛擬世界,讓代理先在模擬環境中練習和測試。這如同飛行模擬器之於飛行員的關係:飛行員不會直接駕駛真實飛機學習,而是在模擬器中多次失敗、觀察結果、學習規律,最後才駕駛真機。QenAgent World對AI代理採用同樣邏輯。
性能表現已經超越業界領先模型。QenAgent World-397b在Agent World Bench基準測試中獲得58.71分,超越目前最強的GPT 5.4(58.25分),同時領先Claude Opus 4.8和Gemini 3.1 Pro。更引人注目的是開源版QenAgent World-35b-A3b,相比其基礎模型改進了8.66點——這個幅度非常罕見,因為業界模型改進通常僅以小數百分比計。這些數字表明虛擬世界訓練方式的有效性。
Alibaba的訓練方式完全基於真實數據。他們並未使用合成虛假數據,而是搭建真實物理服務器和虛擬機環境,運行實際的Ubuntu、macOS和Android系統,配置真實瀏覽器,在這些真實環境上連續運行AI代理,記錄了超過1000萬次真實交互數據。模型訓練分三個階段:持續預訓練(CPT)讓模型學習環境如何運作、終端命令行的表現、網頁結構等;監督微調(SFT)教會模型預測序列中的下一步;強化學習則獎勵那些準確模擬環境的預測。值得注意的是,Alibaba公開了研究的局限性:事實準確度是最大挑戰,儘管相比之前改進了11.3%,但在各個評估維度中仍然是最薄弱的環節。
QenAgent World覆蓋七個環境且在單一模型內同時運作。MCP是AI工具間的通訊協議,搜尋模擬讓代理預測搜尋結果而無需實際查詢;終端模擬讓代理規劃命令序列並預測每一步的執行結果;軟體工程模擬可預測代碼運行結果、代碼審查反饋;網頁瀏覽模擬讓代理預測點擊效果和頁面內容,開啟了競爭分析自動化的可能;作業系統模擬可自動化桌面操作和文件管理;Android模擬則首次為行動應用自動化提供支撐。對業務應用而言,這意味著複雜工作流可以被預先規劃和驗證,大幅提升代理的可靠性和成功率。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


