KeyFrame內部研究專用

GLM 5.2: NEW Opensource KING IS BEATING GPT-5.5 & Opus 4.8! (Fully Tested)

WorldofAI·6月19日週五·13 min英文

三句話摘要

ZAI 推出開源模型 GLM 5.2,以極低成本在前端設計與程式碼生成上媲美甚至超越 Claude Opus 4.8 等頂級閉源模型。 GLM 5.2 是目前最具性價比的開源模型,以不到 Opus 4.8 六分之一的成本在前端生成上超越它,是開源 AI 應用落地的重要里程碑。 GLM 5.2 是目前最強的開源前端生成模型,在 Web Design 基準上排名第一,超過 Fable 5,且 Elo 達 1300,這是此前開源模型從未達到的水位。

重點整理

重點
  • 1

    GLM 5.2 是目前最強的開源前端生成模型,在 Web Design 基準上排名第一,超過 Fable 5,且 Elo 達 1300,這是此前開源模型從未達到的水位。

  • 2

    成本優勢是其核心競爭力,相同任務下 GLM 5.2 只需 $6,而 Claude Opus 4.8 需 $50,成本差距超過六倍,且速度更快,使其在商業應用場景具備明確優勢。

  • 3

    能力提升幅度顯著,相比前代 GLM 5.1,在深度推理提升 46.2%,並在 Frontier Suite 綜合評測中達到 Opus 4.8 的 74.4%,在 Terminal Bench 與 SWE-bench Pro 上也接近或超越多個閉源模型。

  • 4

    實際測試顯示前端生成品質突出,能完成 Airbnb 頁面仿製、Spotify UI、Minecraft 複製品、dungeon crawler 遊戲、macOS 桌面模擬、FPS 射擊遊戲及 3D 太陽系等複雜任務,且細節層次超過 Claude Opus。

實用技巧與重點

乾貨
  • 模型名稱:GLM 5.2(Max / High 兩版本),由 ZAI(智谱 AI)發布
  • 授權:MIT 開源授權,支援開放權重下載
  • Context Window:1 億 Token
  • API 定價:輸入 $1.20 / 百萬 Token;輸出 $4.10 / 百萬 Token
  • 對比成本:GLM 5.2 約 $6,Claude Opus 4.8 約 $50,差距超過 6 倍
  • Web Design Elo:1300,排名第一,超越 Fable 5
  • AI Coding Benchmark 排名:第五名
  • 深度推理提升幅度:相比 GLM 5.1 提升 46.2%
  • Frontier Suite 評測:達 Opus 4.8 的 74.4%
  • 弱點:微調(fine-tuning)、純邏輯推理、GENZI 相關功能
  • 推薦使用方式:AI Coding Benchmark 平台 / ZAI Chatbot / API / 開放權重本地部署
  • 測試展示任務:Airbnb 頁面仿製、Spotify UI、macOS 桌面模擬、dungeon crawler 遊戲、Minecraft 複製品、FPS 遊戲、3D 太陽系、程式生成樹木成長動畫

結論

結論

GLM 5.2 是目前最具性價比的開源模型,以不到 Opus 4.8 六分之一的成本在前端生成上超越它,是開源 AI 應用落地的重要里程碑。

完整解析

詳細

GLM 5.2 是 ZAI(智谱 AI)最新推出的旗艦開源大型語言模型,分為 Max 與 High 兩個版本,採 MIT 授權並提供開放權重下載。該模型主打超長上下文(1 億 Token)與強化的程式碼與前端生成能力,定位是在開源生態中挑戰 Gemini 2.5 Pro、Claude Opus 4.8 等頂級閉源模型。

在基準測試表現上,GLM 5.2 在 Web Design 排行榜拿下第一,Elo 達 1300,超越 Fable 5;在 AI Coding Benchmark 位居第五;在涵蓋推理、知識、語言理解的 Frontier Suite 綜合評測中,達到 Claude Opus 4.8 的 74.4%;與前代 GLM 5.1 相比,深度推理能力提升 46.2%。商業方面,GLM 5.2 在幾乎所有子任務上都超越 Gemini 2.5 Pro,且 Terminal Bench 與 SWE-bench Pro 的成績也接近 GPT-4.5 水準,被視為首個在多維度實際逼近閉源頂尖模型的開源選項。

成本方面,GLM 5.2 的 API 定價為輸入 $1.20、輸出 $4.10(每百萬 Token),實際任務成本約 $6,相比 Claude Opus 4.8 的 $50 便宜六倍以上,且生成速度更快。影片中的實測展示了多項複雜前端任務:模型能生成帶有完整互動邏輯的音效設定頁面、仿 Airbnb 的多頁瀏覽介面(含圖片渲染)、macOS 桌面環境模擬(含 Finder、Safari、深色模式切換)、Spotify 播放介面(含實際音樂播放)、dungeon crawler 遊戲(含鑰匙、門、怪物互動邏輯),以及 Minecraft 複製品與 FPS 射擊遊戲。3D 任務方面,模型也生成了可調速的太陽系模擬與具有細節動畫的樹木生長模型,部分結果被評為超越 Claude Opus 的同等測試輸出。

值得注意的是,GLM 5.2 並非全面無敵。影片中指出其在微調支援、純邏輯推理,以及特定 GENZI 功能上仍有明顯短板;macOS 模擬中部分 SVG 圖示未能正確生成。整體而言,講者給予 macOS 模擬 8/10 分,並強調 GLM 5.2 的最佳使用場景是需要高品質前端、3D 視覺化與遊戲原型的開發工作,建議透過 ZAI Chatbot、API 或本地開放權重部署來試用。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。