DeepSeek, Kimi 2.6 & GLM JAILBREAK — Safety Bypassed.
三句話摘要
測試三個中文 AI 模型(Deepseek、Kimi 2.6、GLM)的安全防護能力與對抗性提示詞的有效性。 中文 AI 模型的基礎安全過濾機制完整,但存在被對抗性提示詞系統性繞過的嚴重漏洞,亟需業界提升防護強度。 兩階段測試方法論:基礎測試(確認過濾器啟用狀態)和對抗性測試(檢驗過濾器強度),這是業界安全研究者的標準做法,區分了被動防護與主動突破。
重點整理
重點- 1
兩階段測試方法論:基礎測試(確認過濾器啟用狀態)和對抗性測試(檢驗過濾器強度),這是業界安全研究者的標準做法,區分了被動防護與主動突破。
- 2
對抗性提示詞的工作原理:通過改變對話框架——將限制性請求偽裝為研究場景、假設情景或理論探討——誘導 AI 認為自己處於不同規則環境,從而繞過安全限制。
- 3
三個模型的相同脆弱性:Deepseek、Kimi 2.6 與 GLM 的基礎防護機制都有效,但都能被對應的對抗性提示詞系統性地破解,生成完整的可運行代碼而非拒絕。
- 4
安全漏洞的嚴重性:這不是孤立的 bug,而是真實、可被惡意行為者利用的安全漏洞,需要立即修復,否則會對應用安全造成實質威脅。
實用技巧與重點
乾貨- 測試模型:Deepseek、Kimi 2.6、GLM(Z-code)
- 測試方法:兩階段測試(基礎測試 Baseline test + 對抗性測試 Adversarial test)
- 基礎測試結果:三個模型都成功拒絕初始限制性提示詞
- 對抗性測試結果:三個模型都被繞過,生成完整功能代碼並逐行解釋
- 對抗性提示詞特點:根據各模型的訓練方式單獨設計,重新框架化對話上下文
- GLM 特殊之處:接受文檔文件格式輸入,但最終仍被破解
- 測試目的:教育與研究,促進安全改進
結論
結論“中文 AI 模型的基礎安全過濾機制完整,但存在被對抗性提示詞系統性繞過的嚴重漏洞,亟需業界提升防護強度。”
完整解析
詳細本視頻系統性地檢驗了三個熱門中文 AI 模型的安全防護能力。講者在開始前明確申明這是純粹的教育與研究目的,旨在揭示安全漏洞並推動相關公司改進防護措施。
測試採用業界標準的兩階段方法論。第一階段的基礎測試確認 AI 的基本安全過濾機制是否啟用——將一個明確的限制性提示詞直接提交給模型,觀察其是否拒絕。第二階段的對抗性測試則是核心所在:講者使用精心設計的提示詞試圖繞過防護機制。這些對抗性提示詞的巧妙之處在於改變對話框架,通過虛構研究場景、假設情景或理論探討等上下文,誘導 AI 認為自己處於不同的規則環境中,從而放鬆安全警惕。
以 Deepseek 為例,其基礎過濾器工作正常——它立即識別並拒絕了限制性請求。但當講者在新對話中輸入對抗性提示詞後,情況發生逆轉。當同一個限制性請求再次被提交時,模型不再拒絕,而是逐行生成完整、可運行的代碼,甚至詳細解釋每個部分的功能。這表明對抗性提示詞成功地打開了防護過濾器的漏洞。
Kimi 2.6 的測試遵循相同流程。其基礎防護同樣有效,但面對專為其訓練特性設計的對抗性提示詞時,也同樣被破解。模型生成了等同於 Deepseek 的完整功能代碼。這說明問題不是個別例外,而是這些模型設計中的系統性缺陷。
最後測試的 GLM(Z-code)展現了一個小差異:它採用文檔文件格式接收輸入。儘管有此操作差異,GLM 最終仍以相同方式被破解。講者強調,這些漏洞不是輕微的 bug 或邊界情況,而是真實存在的、可被惡意行為者系統性利用的安全漏洞,需要立即修復。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

