KeyFrame內部研究專用

I Jailbroke Gemini 3.1... And It Actually Worked

AIwolfie·5月29日週五·5 min英文

三句話摘要

演示 Gemini 3.5 Flash 模型的安全漏洞與繞過方法,以 jailbreak 提示詞改變模型的內容生成行為。 特定的提示詞注入技術可以有效繞過 Gemini 3.5 Flash 的內容生成限制,這提醒開發者需要持續強化大型語言模型的安全防護機制。 基線測試很關鍵:在測試漏洞前先驗證模型在正常狀態下會拒絕危險請求,這樣才能清楚區分 jailbreak 前後的行為差異,確認真實發生了安全繞過。

重點整理

重點
  • 1

    基線測試很關鍵:在測試漏洞前先驗證模型在正常狀態下會拒絕危險請求,這樣才能清楚區分 jailbreak 前後的行為差異,確認真實發生了安全繞過。

  • 2

    jailbreak 的執行步驟:需要清空聊天紀錄開啟新對話、複製提示詞、確認選用 Gemini 3.5 Flash 模型、將提示詞貼入聊天框。操作順序與模型選擇直接影響成功率。

  • 3

    行為改變的驗證:jailbreak 成功後,模型不再根據安全政策拒絕,而是直接生成原本禁止的內容(如代碼)。測試多個不同提示詞能進一步確認繞過的有效性。

  • 4

    責任研究態度:演示者強調這是安全研究目的,承認非原創作者身份,並計畫後續製作醫療設備滲透測試系列內容。

實用技巧與重點

乾貨
  • 模型:Gemini 3.5 Flash(flashlight)
  • 方法:使用特定 jailbreak 提示詞(鏈接在影片描述中)
  • 執行步驟
  • 建立基線測試(確認模型拒絕不當請求)
  • 刪除當前聊天紀錄
  • 開啟新對話
  • 確認 Gemini 3.5 Flash 模型已選
  • 複製並貼上 jailbreak 提示詞
  • 用測試提示詞驗證行為改變

結論

結論

特定的提示詞注入技術可以有效繞過 Gemini 3.5 Flash 的內容生成限制,這提醒開發者需要持續強化大型語言模型的安全防護機制。

完整解析

詳細

這支影片展示了一個針對 Gemini 3.5 Flash 模型的安全繞過漏洞。演示者採用科學的對比測試方法,先建立「基線」來驗證模型在未經修改狀態下的正常行為——即根據安全政策拒絕有問題的請求。這個步驟至關重要,因為它提供了明確的對照組,使後續的 jailbreak 效果可被清晰驗證。

進行 jailbreak 測試時,需要遵循精確的步驟:刪除當前聊天紀錄以確保沒有前文干擾,開啟全新的對話視窗,確認正在使用 Gemini 3.5 Flash 版本,然後將特定的 jailbreak 提示詞貼入聊天框。演示者強調了這些細節的重要性,因為即使有輕微偏差也可能影響結果的可重現性。

一旦 jailbreak 提示詞被系統接受,模型的行為就會明顯改變。原本在基線測試中拒絕生成的內容,現在模型開始直接輸出。演示中,被要求生成的代碼現在能夠正常產出,這清楚地表明安全防護層已被繞過。演示者並進一步詢問生成的代碼具體用途,展示 jailbreak 的持續效果。

整個演示體現了負責任的安全研究態度。演示者明確說明這是教育和安全研究用途、承認不是 jailbreak 的原創發明者、提供了原始來源的歸屬,並預告將製作醫療設備滲透測試系列內容,表明其關注的是增進整體安全認知。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。