KeyFrame內部研究專用

Qwen 3.8 is LIVE NOW! Can It Survive 3 Brutal Tests? (Qwen 3.8 Max Benchmarks)

Ray Codes·8月3日週一·7 min英文

三句話摘要

Alibaba Q1 3.8 Max 模型發布,具有 2.4 兆參數和多項基準測試領先性能,即將開源 27B 版本。 Q1 3.8 Max 透過混合專家架構、隱式快取和卓越的多模態能力,重新定義了開源大模型的成本與性能平衡,即將發布的 27B 開源版本將進一步民主化 AI 開發。 架構創新降低成本與延遲:雖然模型參數龐大(2.4T),但透過混合專家(Mixture of Experts)架構,只路由提示到相關專家系統,避免喚醒全部參數,既保持速度又節省計算力。加上隱式快取會自動在雲端伺服器記憶體中保存系統指令和程式碼倉庫,大幅降低輸入成本。

重點整理

重點
  • 1

    架構創新降低成本與延遲:雖然模型參數龐大(2.4T),但透過混合專家(Mixture of Experts)架構,只路由提示到相關專家系統,避免喚醒全部參數,既保持速度又節省計算力。加上隱式快取會自動在雲端伺服器記憶體中保存系統指令和程式碼倉庫,大幅降低輸入成本。

  • 2

    長上下文與自主規劃能力:模型可跨 500 次 AI turns 記憶目標,支援長期系統規劃(如 365 天行銷策略)。實驗證明它能在 10 天自主迴圈中從空目錄建構完整生產系統,無需人工干預。

  • 3

    多模態原生整合與自我修正:內建視覺迴圈能動態追蹤自己的渲染 UI 輸出並自我修正程式碼,使其特別適合多模態應用開發。在視覺推理基準(Blava)達 91.3%,在 OS World 電腦使用測試達 86.1%。

  • 4

    消費級與企業級的雙軌部署:27B 開源版本可在單張 RTX 4090 執行,降低開發者門檻;2.5T 主模型需多節點 GPU 集群但適合生產環境,不同規模團隊都有適合的選擇。

實用技巧與重點

乾貨
  • 模型規格
  • 參數量:2.4 兆參數(主模型)、27B 參數(開源版,下週發布)
  • 架構:混合專家(MoE)
  • 支援:長上下文 500 turns 記憶
  • 性能基準
  • SWE Pro(複雜編碼任務):67.7%(vs Q1 3.7:-7%,vs Opus 4.8:相當)
  • 終端代理基準:86.6%(勝 Opus 4.8、Fabel 5,低於 GPT 5.6 Sol)
  • 論文基準(學術應用):93.0%
  • Q1 React Bench(React 前端開發):17.24(勝競爭對手,略低於 Fabel 5)
  • Blava 視覺基準:91.3%
  • OS World(電腦使用代理):86.1%
  • 定價(API 模式)
  • 標準輸入:$2/百萬 tokens
  • 輸出生成:$6/百萬 tokens
  • 隱式快取輸入:$0.25/百萬 tokens(最高 87% 折扣)
  • 運行環境
  • 27B 版本:單張 RTX 4090 或 Apple Mac Studio
  • 主模型:多節點 GPU 伺服器集群
  • 線上訪問:chat.q1.ai
  • 實測能力
  • 生成互動式神經網路訓練視覺化(含實時 epoch、loss、accuracy、權重矩陣)
  • 生成 3D 星系與重力體模擬視覺化(含黑洞互動、物理模擬)
  • 生成威脅情報儀表板(含全球地圖渲染、攻擊弧動畫、IP 檢視、多層級日誌追蹤)
  • 全部輸出為單一 HTML 檔案(含 HTML、CSS、JavaScript)

結論

結論

Q1 3.8 Max 透過混合專家架構、隱式快取和卓越的多模態能力,重新定義了開源大模型的成本與性能平衡,即將發布的 27B 開源版本將進一步民主化 AI 開發。

完整解析

詳細

Alibaba 正式發布旗艦模型 Q1 3.8 Max,標誌著開源 AI 技術的重大突破。這款模型擁有 2.4 兆個參數,提供了驚人的數學編碼和上下文記憶容量,足以處理複雜的系統規劃任務。但為了避免龐大參數帶來的速度瓶頸,Q1 3.8 Max 採用了混合專家架構—只將提示路由到相關的專家系統,保持了處理速度的同時大幅節省運算資源。這種設計哲學讓企業既能享受大模型的能力,又不必擔心硬體成本。

成本方面的創新同樣亮眼。Q1 透過隱式快取技術,自動在雲端伺服器的 RAM 中記憶系統指令和程式碼倉庫,使得重複使用長上下文時的輸入成本從標準的 $2/百萬 tokens 劇降至 $0.25/百萬 tokens,相當於折扣 87%。這對需要長時間推理或反覆上下文窗口的應用場景(如自主代理、365 天策略規劃)幾乎是革命性的改變。實驗證明,Q1 3.8 Max 能在 10 天的自主迴圈中從零開始構建完整的生產系統,無需人工介入,展現了超強的長期規劃與執行能力。

技術層面上,模型內建原生視覺迴圈,能動態追蹤自己生成的 UI,並根據視覺反饋自我修正程式碼,使其特別適合多模態應用開發。基準測試結果印證了這一點:在 Blava 視覺推理上達 91.3%、OS World 電腦使用代理測試達 86.1%,在多個關鍵任務上都超越 Opus 4.8 和 Fabel 5。特別值得注意的是終端代理測試達 86.6%,顯示它在系統級命令執行上的熟練度。

實測演示進一步驗證了這些能力。模型成功生成了互動式神經網路訓練視覺化,實時顯示訓練的 epoch 次數、損失值、準確度,還動態呈現網路權重的視覺化;製作了 3D 星系與重力體模擬,使用者可以添加黑洞觀察系統響應;最後生成了企業級的全球威脅情報儀表板,包含地圖渲染、攻擊弧動畫、IP 節點檢視和分級日誌追蹤。所有輸出都是單一 HTML 檔案,開箱即用,無需複雜的部署。

值得注意的是,Q1 3.8 Max 使用長步驟推理過程,因此輸出生成速度可能較慢,導致延遲較高,這是其主要限制。但 Alibaba 即將發布 27B 開源權重版本,可直接在 RTX 4090 或 Mac Studio 運行,大幅降低開發者的使用門檻。這意味著開發社群很快就能從龐大的主模型轉移到經過充分測試的輕量版本,完全掌控部署和推理。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。