KeyFrame內部研究專用

Gemma 4 还是 Qwen?本地跑模型,我直接告诉你选谁

Kai on AI·4月21日週二·8 min中文

三句話摘要

在 Mac 本地端跑開源 AI 模型,依三種使用場景給出最優模型選擇,說明為何跑分更高的 Gemma 4 當前不適合取代 Qwen。 跑分第一不代表當下最適用——本地 AI 選型應以場景穩定性為優先,Qwen 系列目前在 Agent 與編碼場景的生態成熟度仍優於剛開源的 Gemma 4。 MoE 與 Dense 模型速度差距是決定性的:MoE 模型每秒可生成 70–125 token、首次回應不到一秒;Dense 模型每秒僅 13–17 token、首次回應需 5–6 秒,上下文一長甚至拖到 20 秒以上,導致 Dense 模型在 Agent 與編碼場景根本無法使用。

重點整理

重點
  • 1

    MoE 與 Dense 模型速度差距是決定性的:MoE 模型每秒可生成 70–125 token、首次回應不到一秒;Dense 模型每秒僅 13–17 token、首次回應需 5–6 秒,上下文一長甚至拖到 20 秒以上,導致 Dense 模型在 Agent 與編碼場景根本無法使用。

  • 2

    跑分高不等於生態成熟:Gemma 4 在編碼基準上領先 Qwen 7–10 個百分點,但剛開源時工具調用格式與 Ollama、LM Studio、oMLX 全部不相容;即使框架陸續修補,邊界情況(如路徑含特殊字元)仍會出錯,而 Qwen 社群踩坑更久、框架適配更穩定。

  • 3

    量化版本的取捨邏輯清晰:4bit 量化比 8bit 快約 40%、記憶體減半,智力損失僅 2–3%,日常感受不到差異;32G 記憶體用 4bit,64G 以上才有必要上 8bit。

  • 4

    選模型的核心原則是場景優先:不應以跑分排名決定選型,而應以自己的使用場景判斷模型在該情境下能否穩定運行,這是避免踩坑的根本思路。

實用技巧與重點

乾貨
  • 測試環境:Mac Studio M4 Max,推理框架 oMLX,測試包含 4bit 與 8bit 兩種量化
  • Qwen 3.6:35B MoE,每次推理激活 3B 參數,支援多模態(圖片識別),工具調用兼容 Ollama、LM Studio;32G RAM 用 4bit,64G 用 8bit
  • Qwen 3 Coder Next:80B MoE,每次激活 3B 參數,4bit 版記憶體佔用約 43G,需 64G 機器;8bit 版佔 80G 不推薦;不支援圖像輸入
  • Gemma 4 31B Dense:每秒生成 13 token,首次回應 5 秒以上,複雜編碼測試得分 76%,遙遙領先所有測試模型
  • MoE 速度:每秒 70–125 token,首次回應 < 1 秒
  • Dense 速度:每秒 13–17 token,首次回應 5–6 秒
  • 4bit vs 8bit:速度快 40%,記憶體減半,智力損失 2–3%
  • Gemma 4 編碼優勢:領先 Qwen 7–10 個百分點,越難的測試差距越大
  • 知識能力:Gemma 4 與 Qwen 幾乎打平,無顯著差距
  • 完整評測數據:放於影片說明欄;選型框架:fankaishuo.ai

結論

結論

跑分第一不代表當下最適用——本地 AI 選型應以場景穩定性為優先,Qwen 系列目前在 Agent 與編碼場景的生態成熟度仍優於剛開源的 Gemma 4。

完整解析

詳細

本影片的出發點是回應社群對「Gemma 4 開源後是否該換掉 Qwen」的大量討論。作者在 Mac Studio M4 Max 上使用 oMLX 推理框架,對多個主流本地開源模型進行 4bit 與 8bit 兩種量化的系統性測試,從速度與智力兩個維度取得實測數據,並依三種最常見的使用場景直接給出選型建議,試圖終結這場爭論。

在速度面,MoE(混合專家)架構與 Dense(完整參數)架構之間存在一個數量級的差距。MoE 模型因為每次推理只激活一小部分參數(Qwen 3.6 的 35B 模型每次僅激活 3B),每秒可輸出 70 到 125 個 token,首次回應不到一秒;而 Dense 模型所有參數全部參與運算,每秒只能輸出 13 到 17 個 token,首次回應動輒超過 5 秒,若上下文視窗擴大甚至拖到二十幾秒。這個速度差距直接決定了 Dense 模型在 Agent 編排與程式生成這類需要快速多輪交互的場景中根本無法使用,只適合偶爾問幾個複雜問題的純問答需求。

在智力面,Gemma 4 的知識能力與 Qwen 幾乎打平,但編碼能力有實質性優勢,領先 7 到 10 個百分點,Gemma 4 31B Dense 在最難的編碼測試中拿下 76% 的高分。然而恰恰是這個「編碼能力碾壓」的模型,在 Agent 場景中卻連工具調用都跑不穩——Gemma 4 剛開源時,其工具調用格式與 Ollama、LM Studio、oMLX 等主流框架全部不相容,直接報錯;儘管各框架陸續更新了兼容性修補,邊界情況(如路徑含特殊字元)仍會觸發錯誤。相比之下,Qwen 在社群中已運行更久,踩過的坑更多,框架適配更成熟,穩定性更有保障。

作者因此得出一個反直覺的結論:跑分高不等於當下能用。選型的核心邏輯應是「場景優先」——先確定自己的使用場景,再問哪個模型在這個場景下跑得最穩,而非盲目追求基準測試第一名。Gemma 4 的基礎能力上限是真實的,生態成熟只是時間問題,值得持續關注;但在當下,跑 Agent 就用 Qwen 3.6,跑程式生成就用 Qwen 3 Coder Next,追求極致準確度的純問答才考慮 Gemma 4 31B Dense,這是目前最務實的選擇。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。