KeyFrame內部研究專用

Gemma-4模型移除安全审查,效果测试

AI打工人·4月14日週二·10 min中文

三句話摘要

Google Gemma 4 開源模型遭破解版本移除安全審查機制,本影片演示如何用 OLLAMA 部署並測試其效果。 移除安全審查的 Gemma 4 破解版只需一條提示詞即可繞過殘餘防護,部署門檻極低,說明開源模型的安全機制在技術層面本質上是可被剝離的。 破解版以犧牲安全性換取「服從性」:原版 Gemma 4 安全審查極為嚴格,幾乎所有有害問題均拒絕回答;破解版透過移除審查機制,使模型在 HarmBench 的 300 題中有 281 題不再拒絕,代價是 MMLU 知識理解分數下降約 5%。

重點整理

重點
  • 1

    破解版以犧牲安全性換取「服從性」:原版 Gemma 4 安全審查極為嚴格,幾乎所有有害問題均拒絕回答;破解版透過移除審查機制,使模型在 HarmBench 的 300 題中有 281 題不再拒絕,代價是 MMLU 知識理解分數下降約 5%。

  • 2

    GGUF 格式使跨平台部署成為可能,但犧牲多模態能力:原始破解版僅支援 Mac,轉換為 GGUF 格式後可在 Windows/Linux 上透過 OLLAMA 或 llama.cpp 使用,但 GGUF 版本不支援多模態輸入,僅能處理純文字。

  • 3

    單一提示詞注入即可繞過殘餘防護:即便是破解版,直接輸入有害問題時仍有部分會被拒絕;但只需在問題前加入特定提示詞(類似角色扮演或小說框架的越獄指令),模型便會正常輸出,顯示攻擊門檻極低。

實用技巧與重點

乾貨
  • 模型名稱:Gemma 4(Google)、破解版 Gemma4 Crack(Hugging Face 搜尋關鍵字)
  • 參數規模:31B,聲稱擊敗 20 倍體量競品
  • HarmBench 結果:300 題中 281 題不拒絕(有害內容生成率 93.7%)
  • MMLU 基準:破解版 CRACK-V2 相較原版下降 5 個百分點
  • 量化版本三種:Q3KM(較好)、Q4KM(好)、Q8R(最好,顯存需求最高)
  • Q8R 合併後模型大小:341 GB
  • 工具鏈:llama.cpp(合併切片模型)、OLLAMA(推理服務)、VLLM(載入原版模型對比測試)
  • 使用流程:下載 GGUF → llama.cpp 合併切片 → 啟動 OLLAMA 服務 → 建立 Modelfile → `ollama create` 匯入 → `ollama list` 確認 → 推理測試

結論

結論

移除安全審查的 Gemma 4 破解版只需一條提示詞即可繞過殘餘防護,部署門檻極低,說明開源模型的安全機制在技術層面本質上是可被剝離的。

完整解析

詳細

Google 近期發布的 Gemma 4 模型被官方定位為迄今最智能的開源模型家族,其 31B 版本在多項基準上擊敗了體量高達 20 倍的競品,同時支援視頻、音頻、圖片等多模態輸入,引發廣泛關注。然而就在模型發布不久後,Hugging Face 上便出現了名為「Gemma4 Crack」的破解版本,核心改動是移除了原版的安全審查機制。影片作者針對此版本進行了詳細的部署演示與效果測試。

破解版提供兩種格式:原始格式僅支援 Mac,而轉換後的 GGUF 格式則可在 Windows 和 Linux 上搭配 OLLAMA 或 llama.cpp 使用,唯代價是喪失多模態能力,只剩純文字輸入。量化程度分為 Q3KM、Q4KM 和 Q8R 三檔,畫質依序提升但顯存佔用同步增加。作者選用效果最好的 Q8R 版本進行演示,但此版本採用切片儲存,OLLAMA 無法直接讀取,需先以 llama.cpp 的合併工具將多個切片檔合併為單一模型(合併後約 341 GB),再透過建立 Modelfile 的方式匯入 OLLAMA 服務。

效果測試方面,作者從 HarmBench(包含 300 條有害提示詞的標準評測集)中隨機抽取題目進行測試,涵蓋網路安全攻擊、版權侵害(哈利波特原文復現)、違禁品資訊等多種類型。測試結果顯示,破解版在直接輸入問題時部分情況仍會拒絕,但只需加入特定越獄提示詞,模型便能流暢輸出相關內容,包括典型的 SQL 注入攻擊手法及如何清除行為痕迹等敏感資訊。整體而言 300 題中有 281 題不拒絕回答。相比之下,作者以 VLLM 載入原版 Gemma 4 並加入同樣的越獄提示詞進行對比測試,原版模型對所有有害問題均明確拒絕,安全審查機制有效運作。知識理解能力方面,破解版的 MMLU 得分相較原版下降了約 5 個百分點,顯示安全機制的移除在一定程度上也影響了模型的整體知識推理品質。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。