KeyFrame內部研究專用

Qwen 3.8 And GLM 5.3 Just Embarrassed The Closed Labs!

World of AI·8月15日週六·9 min英文

三句話摘要

2026年AI開源與商用模型三大突破:Qwen本地高性能、GLM後訓練提升、ChatGPT性能優化。 開源本地高效模型與後訓練工程成為2026年AI競爭的新焦點,誰能同時實現性能、成本和速度的平衡,誰就贏得市場。 開源本地化是競爭新方向:Qwen 3.8在獲得Opus 4.8級推理能力的同時實現本地部署,打破了高性能必須靠雲端的假設,6個月內超30億下載量已超越Meta和Google,迫使頭部廠商正視本地模型這條產品線。

重點整理

重點
  • 1

    開源本地化是競爭新方向:Qwen 3.8在獲得Opus 4.8級推理能力的同時實現本地部署,打破了高性能必須靠雲端的假設,6個月內超30億下載量已超越Meta和Google,迫使頭部廠商正視本地模型這條產品線。

  • 2

    後訓練工程價值被低估:GLM 5.3無需新基礎架構,單靠優質後訓練就將Terminal Bench從4.6躍升到28.3,證明基礎模型已不是瓶頸,訓練工程與資料策略才是差異化因素。

  • 3

    性能基準與實際體驗存在鴻溝:GLM 5.3在基準測試表現亮眼,但同一任務比Gemini 3.7 Flash慢10倍(1小時vs 10分鐘),說明高分不代表好用,系統優化才是使用者最關心的。

  • 4

    中國開源團隊成為創新引擎:Qwen與DeepSeek是目前唯一專注本地高效模型的實驗室,與此同時OpenAI和Google仍主推雲端大模型,形成產品策略差異。

實用技巧與重點

乾貨
  • Qwen 3.8 規格與性能:
  • 參數量:27億
  • 推理編程基準:73(Opus 4.6 Max 78.2)
  • 智能體編程、深度軟體工程測試:優於Opus 4.6
  • 軟體工程基準:79
  • 運算需求:4位量化13.5GB、舒適運行48GB、可裝入16GB MacBook Air
  • 下載量:6個月超30億次(全球第一,超Meta、Google)
  • GLM 5.3 基準數據:
  • 改進方式:Post-training改進GLM 5.2(無新基礎模型)
  • 網絡安全基準:84.5分(優於Grok 3,逼近Fable 5、GPT 5.60)
  • Terminal Bench:28.3(GLM 5.2為4.6)
  • 弱點:UI/設計能力不如Anthropic模型、編碼速度慢
  • ChatGPT/Codex 即將優化(下週發布):
  • 長對話處理速度提升94%
  • 對話渲染減少87.8%
  • 應用內存增長減少41.2%
  • API請求減少98.2%
  • 轉錄項目加載減少99.6%
  • 實際性能對比:
  • 同一任務 Gemini 3.7 Flash(10分鐘)vs GLM 5.3(1小時)

結論

結論

開源本地高效模型與後訓練工程成為2026年AI競爭的新焦點,誰能同時實現性能、成本和速度的平衡,誰就贏得市場。

完整解析

詳細

今年AI產業出現了三股值得關注的動向。首先是Alibaba的Qwen團隊昨日發布了3.8版本的開源權重,這個27億參數的模型實現了Opus 4.8級別的推理性能,但關鍵突破在於它可以運行在個人電腦和MacBook上。從基準測試來看,Qwen 3.8在推理編程達73分(Opus 4.6 Max為78.2),在智能體編程和深度軟體工程測試中甚至優於Opus 4.6。具體運算需求方面,4位量化版本只需13.5GB顯存,舒適運行需48GB記憶體,有人測試發現甚至可以塞進16GB的MacBook Air。這意味著使用者不必付費調用API,可以在本地免費運行Opus級別的模型,降低了AI應用的門檻。

這個成功也反映在下載數據上——Qwen模型在過去6個月超過30億次全球下載,已經超越Meta和Google成為世界第一的開源模型。這對頭部廠商造成了壓力,因為它證明了本地高效模型是一條可行且具有市場需求的產品線。當前專注於此方向的實驗室只有Qwen和DeepSeek,而Meta和Google似乎仍在押注更大的雲端模型。

與此同時,智譜清言(Z.AI)昨日發布了GLM 5.3,作為他們最新的編碼和智能體模型。值得注意的是,這次改進完全來自後訓練——他們沒有換新基礎模型,只是在GLM 5.2基礎上進行優質後訓練,就讓Terminal Bench從4.6躍升到28.3,這次改進特別強化了網絡安全領域,基準分達到84.5,優於Grok 3且逼近Fable 5和GPT 5.60。GLM 5.3的這個案例説明後訓練的價值被長期低估了——在基礎模型已經足夠強大的今天,訓練工程和資料策略往往決定了模型的最終表現。

然而,GLM 5.3也暴露了一個問題:高基準分不等於好體驗。有人用相同提示分別調用Gemini 3.7 Flash和GLM 5.3,前者10分鐘完成,後者耗時1小時,儘管結果質量接近,但這個速度差異讓GLM 5.3在實際應用中大打折扣。值得慶幸的是,OpenAI也意識到了性能優化的重要性——Andrew Emerson確認ChatGPT和Codex下週將獲得重大性能更新,針對長文本對話的處理速度提升94%,同時應用記憶體負擔降低41.2%,API請求減少98.2%。這些優化説明在模型能力趨同的時代,使用者體驗和系統效率才是真正的競爭力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。