KeyFrame內部研究專用

How to Use GLM 5.2 For Free (Z.ai Open Source AI)

Jigs Dev·6月19日週五·3 min英文

三句話摘要

ZAI 推出開源免費的 GLM 5.2 模型,並示範如何在 VS Code 中透過 HuggingFace API 完整串接使用。 GLM 5.2 是目前性能最接近閉源旗艦的開源模型之一,透過 HuggingFace Router 五分鐘內即可免費接入 VS Code,API 成本更遠低於競品。 GLM 5.2 以開源模型挑戰閉源旗艦:在 SWE-Bench PRO 上得分 62.1,超過 GPT-4.5 與 Gemini 2.5 Pro,顯示開源模型在程式碼能力上已具備頂級競爭力,且無需付費訂閱。

重點整理

重點
  • 1

    GLM 5.2 以開源模型挑戰閉源旗艦:在 SWE-Bench PRO 上得分 62.1,超過 GPT-4.5 與 Gemini 2.5 Pro,顯示開源模型在程式碼能力上已具備頂級競爭力,且無需付費訂閱。

  • 2

    低成本 API 是核心優勢:相較於閉源模型,GLM 5.2 的 API 定價極低,適合開發者在不超支的情況下於產品中整合前沿推理能力。

  • 3

    HuggingFace Router 提供統一接入點:透過 `https://router.huggingface.co/v1` 作為 base URL,搭配 HuggingFace token,可將任何支援 Chat Completion 的開源模型直接接入 VS Code AI Chat,無需額外部署。

  • 4

    免費層有速率限制須留意:HuggingFace 免費額度在高頻使用時會觸發 rate limit,正式開發建議改用 ZAI 官方 Developer API。

實用技巧與重點

乾貨
  • 模型名稱:GLM 5.2(ZAI / 智譜 AI 發布)
  • 授權:MIT
  • SWE-Bench PRO 得分:62.1(超過 GPT-4.5、Gemini 2.5 Pro)
  • 組合推理基準得分:81.0(接近 Claude Opus)
  • API 定價:輸入 $1.40 / 百萬 token,輸出 $4.40 / 百萬 token
  • 免費試用入口:`ZAI.ai`、HuggingFace Model Page、HuggingChat
  • VS Code 串接步驟:
  • HuggingFace → Settings → Access Tokens → New Token(類型選 read)
  • VS Code → AI Chat → Model Picker → Settings → Add Model → Custom Endpoint
  • 名稱填 `GLM-5.2`,貼上 HuggingFace Token,類型選 Chat Completion
  • 開啟 `chatLanguageModels.json`,設定:
  • `id`: `Zai-Org/glm-5.2-novita`(或對應名稱)
  • `name`: `GLM-5.2`
  • `url`: `https://router.huggingface.co/v1`
  • 儲存後回到 AI Chat,從 Model Picker 選擇 GLM-5.2 即可使用
  • 取得正確 API URL 方法:至 HuggingFace 的 GLM 5.2 頁面 → Use this model → Curl,即可看到可用的 endpoint URL

結論

結論

GLM 5.2 是目前性能最接近閉源旗艦的開源模型之一,透過 HuggingFace Router 五分鐘內即可免費接入 VS Code,API 成本更遠低於競品。

完整解析

詳細

近期 AI 模型競賽不再只是閉源廠商的主場。ZAI(智譜 AI)推出的 GLM 5.2 以 MIT 授權發布,任何人都可以免費下載並檢視模型權重,這在性能逼近旗艦閉源模型的開源陣營中屬於值得關注的進展。從官方公布的基準數據來看,GLM 5.2 在 SWE-Bench Verified(軟體工程能力評測)上得分 62.1,不僅超越 GPT-4.5,也領先 Gemini 2.5 Pro;在組合推理基準上更達到 81.0,已非常接近 Claude Opus 的水準。這些數字代表,開發者在面對程式碼生成、系統設計等工程任務時,GLM 5.2 已成為一個具備實際競爭力的選項。

對於想直接體驗而不設置任何環境的使用者,最簡單的方式是前往 `ZAI.ai` 官網或 HuggingFace 上的 HuggingChat,皆可免費測試模型的對話與推理能力。若要在開發流程中整合,ZAI 提供的 Developer API 定價相當低廉:輸入端 $1.40 / 百萬 token,輸出端 $4.40 / 百萬 token,遠低於多數閉源模型,讓預算有限的開發者或獨立開發者也能負擔得起前沿推理能力。

影片的核心教學展示了如何在 VS Code 中透過 HuggingFace Inference Router 接入 GLM 5.2。整個流程分為兩段:首先在 HuggingFace 帳號的 Settings 中建立一個 read 類型的 Access Token;接著在 VS Code 的 AI Chat 擴充功能中,選擇 Custom Endpoint,將 Token 和模型資訊填入後,修改 `chatLanguageModels.json` 設定檔,將 base URL 指向 `https://router.huggingface.co/v1`,儲存即可完成串接。若不確定正確的模型 ID 或 URL 格式,可直接到 HuggingFace 上 GLM 5.2 的模型頁面,點擊「Use this model」並切換到 Curl 範例,即可取得可直接複製貼上的完整 endpoint 設定。

需要特別注意的是,透過 HuggingFace 免費層使用時,高頻請求會觸發速率限制(rate limit),不適合正式產品場景;若要穩定呼叫,建議改用 ZAI 官方的 Developer API,同時享有更低延遲與更穩定的服務品質。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。