I Jailbroke Gemini 3.1... And It Actually Worked
三句話摘要
演示 Gemini 3.5 Flash 模型的安全漏洞與繞過方法,以 jailbreak 提示詞改變模型的內容生成行為。 特定的提示詞注入技術可以有效繞過 Gemini 3.5 Flash 的內容生成限制,這提醒開發者需要持續強化大型語言模型的安全防護機制。 基線測試很關鍵:在測試漏洞前先驗證模型在正常狀態下會拒絕危險請求,這樣才能清楚區分 jailbreak 前後的行為差異,確認真實發生了安全繞過。
重點整理
重點- 1
基線測試很關鍵:在測試漏洞前先驗證模型在正常狀態下會拒絕危險請求,這樣才能清楚區分 jailbreak 前後的行為差異,確認真實發生了安全繞過。
- 2
jailbreak 的執行步驟:需要清空聊天紀錄開啟新對話、複製提示詞、確認選用 Gemini 3.5 Flash 模型、將提示詞貼入聊天框。操作順序與模型選擇直接影響成功率。
- 3
行為改變的驗證:jailbreak 成功後,模型不再根據安全政策拒絕,而是直接生成原本禁止的內容(如代碼)。測試多個不同提示詞能進一步確認繞過的有效性。
- 4
責任研究態度:演示者強調這是安全研究目的,承認非原創作者身份,並計畫後續製作醫療設備滲透測試系列內容。
實用技巧與重點
乾貨- 模型:Gemini 3.5 Flash(flashlight)
- 方法:使用特定 jailbreak 提示詞(鏈接在影片描述中)
- 執行步驟:
- 建立基線測試(確認模型拒絕不當請求)
- 刪除當前聊天紀錄
- 開啟新對話
- 確認 Gemini 3.5 Flash 模型已選
- 複製並貼上 jailbreak 提示詞
- 用測試提示詞驗證行為改變
結論
結論“特定的提示詞注入技術可以有效繞過 Gemini 3.5 Flash 的內容生成限制,這提醒開發者需要持續強化大型語言模型的安全防護機制。”
完整解析
詳細這支影片展示了一個針對 Gemini 3.5 Flash 模型的安全繞過漏洞。演示者採用科學的對比測試方法,先建立「基線」來驗證模型在未經修改狀態下的正常行為——即根據安全政策拒絕有問題的請求。這個步驟至關重要,因為它提供了明確的對照組,使後續的 jailbreak 效果可被清晰驗證。
進行 jailbreak 測試時,需要遵循精確的步驟:刪除當前聊天紀錄以確保沒有前文干擾,開啟全新的對話視窗,確認正在使用 Gemini 3.5 Flash 版本,然後將特定的 jailbreak 提示詞貼入聊天框。演示者強調了這些細節的重要性,因為即使有輕微偏差也可能影響結果的可重現性。
一旦 jailbreak 提示詞被系統接受,模型的行為就會明顯改變。原本在基線測試中拒絕生成的內容,現在模型開始直接輸出。演示中,被要求生成的代碼現在能夠正常產出,這清楚地表明安全防護層已被繞過。演示者並進一步詢問生成的代碼具體用途,展示 jailbreak 的持續效果。
整個演示體現了負責任的安全研究態度。演示者明確說明這是教育和安全研究用途、承認不是 jailbreak 的原創發明者、提供了原始來源的歸屬,並預告將製作醫療設備滲透測試系列內容,表明其關注的是增進整體安全認知。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

