Qwen 3.8 And GLM 5.3 Just Embarrassed The Closed Labs!
三句話摘要
2026年AI開源與商用模型三大突破:Qwen本地高性能、GLM後訓練提升、ChatGPT性能優化。 開源本地高效模型與後訓練工程成為2026年AI競爭的新焦點,誰能同時實現性能、成本和速度的平衡,誰就贏得市場。 開源本地化是競爭新方向:Qwen 3.8在獲得Opus 4.8級推理能力的同時實現本地部署,打破了高性能必須靠雲端的假設,6個月內超30億下載量已超越Meta和Google,迫使頭部廠商正視本地模型這條產品線。
重點整理
重點- 1
開源本地化是競爭新方向:Qwen 3.8在獲得Opus 4.8級推理能力的同時實現本地部署,打破了高性能必須靠雲端的假設,6個月內超30億下載量已超越Meta和Google,迫使頭部廠商正視本地模型這條產品線。
- 2
後訓練工程價值被低估:GLM 5.3無需新基礎架構,單靠優質後訓練就將Terminal Bench從4.6躍升到28.3,證明基礎模型已不是瓶頸,訓練工程與資料策略才是差異化因素。
- 3
性能基準與實際體驗存在鴻溝:GLM 5.3在基準測試表現亮眼,但同一任務比Gemini 3.7 Flash慢10倍(1小時vs 10分鐘),說明高分不代表好用,系統優化才是使用者最關心的。
- 4
中國開源團隊成為創新引擎:Qwen與DeepSeek是目前唯一專注本地高效模型的實驗室,與此同時OpenAI和Google仍主推雲端大模型,形成產品策略差異。
實用技巧與重點
乾貨- Qwen 3.8 規格與性能:
- 參數量:27億
- 推理編程基準:73(Opus 4.6 Max 78.2)
- 智能體編程、深度軟體工程測試:優於Opus 4.6
- 軟體工程基準:79
- 運算需求:4位量化13.5GB、舒適運行48GB、可裝入16GB MacBook Air
- 下載量:6個月超30億次(全球第一,超Meta、Google)
- GLM 5.3 基準數據:
- 改進方式:Post-training改進GLM 5.2(無新基礎模型)
- 網絡安全基準:84.5分(優於Grok 3,逼近Fable 5、GPT 5.60)
- Terminal Bench:28.3(GLM 5.2為4.6)
- 弱點:UI/設計能力不如Anthropic模型、編碼速度慢
- ChatGPT/Codex 即將優化(下週發布):
- 長對話處理速度提升94%
- 對話渲染減少87.8%
- 應用內存增長減少41.2%
- API請求減少98.2%
- 轉錄項目加載減少99.6%
- 實際性能對比:
- 同一任務 Gemini 3.7 Flash(10分鐘)vs GLM 5.3(1小時)
結論
結論“開源本地高效模型與後訓練工程成為2026年AI競爭的新焦點,誰能同時實現性能、成本和速度的平衡,誰就贏得市場。”
完整解析
詳細今年AI產業出現了三股值得關注的動向。首先是Alibaba的Qwen團隊昨日發布了3.8版本的開源權重,這個27億參數的模型實現了Opus 4.8級別的推理性能,但關鍵突破在於它可以運行在個人電腦和MacBook上。從基準測試來看,Qwen 3.8在推理編程達73分(Opus 4.6 Max為78.2),在智能體編程和深度軟體工程測試中甚至優於Opus 4.6。具體運算需求方面,4位量化版本只需13.5GB顯存,舒適運行需48GB記憶體,有人測試發現甚至可以塞進16GB的MacBook Air。這意味著使用者不必付費調用API,可以在本地免費運行Opus級別的模型,降低了AI應用的門檻。
這個成功也反映在下載數據上——Qwen模型在過去6個月超過30億次全球下載,已經超越Meta和Google成為世界第一的開源模型。這對頭部廠商造成了壓力,因為它證明了本地高效模型是一條可行且具有市場需求的產品線。當前專注於此方向的實驗室只有Qwen和DeepSeek,而Meta和Google似乎仍在押注更大的雲端模型。
與此同時,智譜清言(Z.AI)昨日發布了GLM 5.3,作為他們最新的編碼和智能體模型。值得注意的是,這次改進完全來自後訓練——他們沒有換新基礎模型,只是在GLM 5.2基礎上進行優質後訓練,就讓Terminal Bench從4.6躍升到28.3,這次改進特別強化了網絡安全領域,基準分達到84.5,優於Grok 3且逼近Fable 5和GPT 5.60。GLM 5.3的這個案例説明後訓練的價值被長期低估了——在基礎模型已經足夠強大的今天,訓練工程和資料策略往往決定了模型的最終表現。
然而,GLM 5.3也暴露了一個問題:高基準分不等於好體驗。有人用相同提示分別調用Gemini 3.7 Flash和GLM 5.3,前者10分鐘完成,後者耗時1小時,儘管結果質量接近,但這個速度差異讓GLM 5.3在實際應用中大打折扣。值得慶幸的是,OpenAI也意識到了性能優化的重要性——Andrew Emerson確認ChatGPT和Codex下週將獲得重大性能更新,針對長文本對話的處理速度提升94%,同時應用記憶體負擔降低41.2%,API請求減少98.2%。這些優化説明在模型能力趨同的時代,使用者體驗和系統效率才是真正的競爭力。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


