Nex-N2 Pro IS GREAT! New Opensource Model Beats GPT 5.5, Opus 4,7, & Gemini 3.5? (Fully Tested)
三句話摘要
Next AGI團隊推出開源智能體模型Next N2,將推理、編碼、搜尋、工具調用等能力整合於統一的推理循環中。 Next N2 是一個性能實用的開源智能體模型,統一推理架構是其創新所在,但官方基準與實測存在落差,使用前應基於實際需求評估其速度與能力的權衡。 統一推理架構是 N2 的核心創新,打破傳統 AI 模型各司其職的設計,改為對編碼、規劃、工具調用等所有技能採用相同的推理框架,在分解目標、追蹤狀態、調整策略、驗證結果的循環中不斷迭代。這對現實世界的混合工作流程特別重要,因為真實任務往往涉及研究、編碼、工具調用、除錯與計畫修訂的交錯。
重點整理
重點- 1
統一推理架構是 N2 的核心創新,打破傳統 AI 模型各司其職的設計,改為對編碼、規劃、工具調用等所有技能採用相同的推理框架,在分解目標、追蹤狀態、調整策略、驗證結果的循環中不斷迭代。這對現實世界的混合工作流程特別重要,因為真實任務往往涉及研究、編碼、工具調用、除錯與計畫修訂的交錯。
- 2
性能表現存在官方基準與實測的落差。Next N2 Pro 在官方基準中聲稱排名前五,但講者用自研基準測試工具測得排名第 12,在多個測試中確實表現不俗(如 Terminal Bench 75.3 分、Sweep Bench Pro 58.8 分),但與官方宣稱的效能有明顯差異。講者認為模型輸出風格過度模仿 GPT,這可能造成視覺上的優越感但掩蓋了實際性能的限制。
- 3
速度與實用性的權衡。N2 採用自適應思維模式進行多層次推理、規劃、自我檢查與迭代,這對智能體工作流程很有價值,但會顯著拖慢輸出速度。使用者在需要快速回應的場景中可能遭遇瓶頸,這是選擇 N2 時必須權衡的考量。
實用技巧與重點
乾貨- 模型規格
- Next N2 Mini:350 億 MoE、30 億活躍參數
- Next N2 Pro:397 億 MoE、170 億活躍參數、基於 Qwen 3.5 架構
- 上下文窗口:262k tokens
- 支援:文字輸入、圖像輸入、推理能力、函數調用、結構化輸出
- 基準測試結果(講者實測)
- Terminal Bench:75.3 分
- Sweep Bench Pro:58.8 分
- 超過 Kimi K 2.6(深度掃描模式下)
- GDP evil 得分:1500(接近瀏覽器競賽的 1600)
- 講者基準排名:第 12 位(官方聲稱前五)
- 訪問方式
- World of AI 基準測試平台(完全免費)
- OpenRouter
- 開源權重下載(支援不同量化等級)
- 本地運行配置
- 8 位量化
- 使用 MLX 工具
- 根據硬體使用 World of AI 提供的模型選擇工具判斷可行性
- 測試案例成果
- Mac OS 克隆系統:成功生成,SVG 圖標表現良好,部分組件未完全生成
- Windows 95 克隆:成功實現開始菜單、計算機瀏覽、多個應用程式(畫圖、掃雷、Internet Explorer 等)
- 塔防遊戲:完整功能實現
- SVG 熔岩燈模擬:物理動畫正確實現,發光效果完整
- 卡片互動動畫:流暢執行
結論
結論“Next N2 是一個性能實用的開源智能體模型,統一推理架構是其創新所在,但官方基準與實測存在落差,使用前應基於實際需求評估其速度與能力的權衡。”
完整解析
詳細Next AGI 團隊的新模型系列 Next N2 代表了開源 AI 智能體的一個重要進展。與傳統 AI 模型將編碼、搜尋、規劃等視為獨立技能不同,N2 將這些能力統一在一個連貫的推理循環中。模型在每個任務中都採用相同的思維結構:分解目標、追蹤當前狀態、調整策略、驗證結果,然後不斷迭代。這種設計特別適合現實世界的混合工作流程,因為實際開發任務往往不是單純編碼或單純搜尋,而是多種因素交錯的過程。
Next N2 提供兩個版本。Mini 版本是 350 億參數的 MoE 模型,擁有約 30 億活躍參數,適合本地運行。Pro 版本則是 397 億參數的旗艦機型,170 億活躍參數,基於 Qwen 3.5 架構,支援文字與圖像輸入,具有 262k tokens 的上下文窗口。最引人注目的是 Next AGI 團隊提供 Pro 版本兩週的完全免費訪問權限,讓使用者可以無限制地測試這款能力強大的模型。
講者對 N2 的性能評價複雜。官方基準測試宣稱 N2 Pro 排名前五,與 Opus、Gemini 等專有模型並駕齊驅。但講者用自研工具進行更廣泛、更嚴格的評估,發現排名實際落在第 12。不過在講者的實測中,N2 確實表現出色:Terminal Bench 獲得 75.3 分、Sweep Bench Pro 達 58.8 分,甚至在深度掃描模式下超越 Kimi K 2.6。講者測試了多個實際應用——從 Mac OS 和 Windows 95 克隆系統,到塔防遊戲和 SVG 熔岩燈動畫——N2 都能生成功能完整的程式碼。講者發現 N2 的輸出風格明顯模仿 GPT,無論是介面設計、字體、色調都與 OpenAI 模型相似,這雖然帶來視覺上的熟悉感,但也暗示模型可能過度依賴官方數據的訓練。
速度是 N2 的主要權衡點。由於自適應思維模式需要進行多層次推理、自我檢查與迭代,模型在生成複雜輸出時會明顯變慢,這對需要快速回應的場景並不理想。儘管如此,講者認為 N2 是一個性能出色且被低估的模型,尤其對智能體工作流程和需要深度推理的任務非常有用。使用者可以通過 World of AI 基準測試平台(完全免費)、OpenRouter 或下載開源權重來訪問 N2。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


