KeyFrame內部研究專用

Nex-N2 Pro IS GREAT! New Opensource Model Beats GPT 5.5, Opus 4,7, & Gemini 3.5? (Fully Tested)

World of AI·6月11日週四·12 min英文

三句話摘要

Next AGI團隊推出開源智能體模型Next N2,將推理、編碼、搜尋、工具調用等能力整合於統一的推理循環中。 Next N2 是一個性能實用的開源智能體模型,統一推理架構是其創新所在,但官方基準與實測存在落差,使用前應基於實際需求評估其速度與能力的權衡。 統一推理架構是 N2 的核心創新,打破傳統 AI 模型各司其職的設計,改為對編碼、規劃、工具調用等所有技能採用相同的推理框架,在分解目標、追蹤狀態、調整策略、驗證結果的循環中不斷迭代。這對現實世界的混合工作流程特別重要,因為真實任務往往涉及研究、編碼、工具調用、除錯與計畫修訂的交錯。

重點整理

重點
  • 1

    統一推理架構是 N2 的核心創新,打破傳統 AI 模型各司其職的設計,改為對編碼、規劃、工具調用等所有技能採用相同的推理框架,在分解目標、追蹤狀態、調整策略、驗證結果的循環中不斷迭代。這對現實世界的混合工作流程特別重要,因為真實任務往往涉及研究、編碼、工具調用、除錯與計畫修訂的交錯。

  • 2

    性能表現存在官方基準與實測的落差。Next N2 Pro 在官方基準中聲稱排名前五,但講者用自研基準測試工具測得排名第 12,在多個測試中確實表現不俗(如 Terminal Bench 75.3 分、Sweep Bench Pro 58.8 分),但與官方宣稱的效能有明顯差異。講者認為模型輸出風格過度模仿 GPT,這可能造成視覺上的優越感但掩蓋了實際性能的限制。

  • 3

    速度與實用性的權衡。N2 採用自適應思維模式進行多層次推理、規劃、自我檢查與迭代,這對智能體工作流程很有價值,但會顯著拖慢輸出速度。使用者在需要快速回應的場景中可能遭遇瓶頸,這是選擇 N2 時必須權衡的考量。

實用技巧與重點

乾貨
  • 模型規格
  • Next N2 Mini:350 億 MoE、30 億活躍參數
  • Next N2 Pro:397 億 MoE、170 億活躍參數、基於 Qwen 3.5 架構
  • 上下文窗口:262k tokens
  • 支援:文字輸入、圖像輸入、推理能力、函數調用、結構化輸出
  • 基準測試結果(講者實測)
  • Terminal Bench:75.3 分
  • Sweep Bench Pro:58.8 分
  • 超過 Kimi K 2.6(深度掃描模式下)
  • GDP evil 得分:1500(接近瀏覽器競賽的 1600)
  • 講者基準排名:第 12 位(官方聲稱前五)
  • 訪問方式
  • World of AI 基準測試平台(完全免費)
  • OpenRouter
  • 開源權重下載(支援不同量化等級)
  • 本地運行配置
  • 8 位量化
  • 使用 MLX 工具
  • 根據硬體使用 World of AI 提供的模型選擇工具判斷可行性
  • 測試案例成果
  • Mac OS 克隆系統:成功生成,SVG 圖標表現良好,部分組件未完全生成
  • Windows 95 克隆:成功實現開始菜單、計算機瀏覽、多個應用程式(畫圖、掃雷、Internet Explorer 等)
  • 塔防遊戲:完整功能實現
  • SVG 熔岩燈模擬:物理動畫正確實現,發光效果完整
  • 卡片互動動畫:流暢執行

結論

結論

Next N2 是一個性能實用的開源智能體模型,統一推理架構是其創新所在,但官方基準與實測存在落差,使用前應基於實際需求評估其速度與能力的權衡。

完整解析

詳細

Next AGI 團隊的新模型系列 Next N2 代表了開源 AI 智能體的一個重要進展。與傳統 AI 模型將編碼、搜尋、規劃等視為獨立技能不同,N2 將這些能力統一在一個連貫的推理循環中。模型在每個任務中都採用相同的思維結構:分解目標、追蹤當前狀態、調整策略、驗證結果,然後不斷迭代。這種設計特別適合現實世界的混合工作流程,因為實際開發任務往往不是單純編碼或單純搜尋,而是多種因素交錯的過程。

Next N2 提供兩個版本。Mini 版本是 350 億參數的 MoE 模型,擁有約 30 億活躍參數,適合本地運行。Pro 版本則是 397 億參數的旗艦機型,170 億活躍參數,基於 Qwen 3.5 架構,支援文字與圖像輸入,具有 262k tokens 的上下文窗口。最引人注目的是 Next AGI 團隊提供 Pro 版本兩週的完全免費訪問權限,讓使用者可以無限制地測試這款能力強大的模型。

講者對 N2 的性能評價複雜。官方基準測試宣稱 N2 Pro 排名前五,與 Opus、Gemini 等專有模型並駕齊驅。但講者用自研工具進行更廣泛、更嚴格的評估,發現排名實際落在第 12。不過在講者的實測中,N2 確實表現出色:Terminal Bench 獲得 75.3 分、Sweep Bench Pro 達 58.8 分,甚至在深度掃描模式下超越 Kimi K 2.6。講者測試了多個實際應用——從 Mac OS 和 Windows 95 克隆系統,到塔防遊戲和 SVG 熔岩燈動畫——N2 都能生成功能完整的程式碼。講者發現 N2 的輸出風格明顯模仿 GPT,無論是介面設計、字體、色調都與 OpenAI 模型相似,這雖然帶來視覺上的熟悉感,但也暗示模型可能過度依賴官方數據的訓練。

速度是 N2 的主要權衡點。由於自適應思維模式需要進行多層次推理、自我檢查與迭代,模型在生成複雜輸出時會明顯變慢,這對需要快速回應的場景並不理想。儘管如此,講者認為 N2 是一個性能出色且被低估的模型,尤其對智能體工作流程和需要深度推理的任務非常有用。使用者可以通過 World of AI 基準測試平台(完全免費)、OpenRouter 或下載開源權重來訪問 N2。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。