KeyFrame內部研究專用

DeepSeek, Kimi 2.6 & GLM JAILBREAK - Safety Bypassed. #promptinjection #deepseek

The AI Future·8月2日週日·4 min英文

三句話摘要

AI安全研究:對比測試中國主流大模型(DeepSeek、Kimi 2.6、GLM)對提示注入攻擊的抵抗力。 AI安全防護的一致性檢測對推進整個行業的安全標準至關重要,透過系統化的對比研究能識別現有模型的真實風險點。 測試方法要求嚴謹可復現:每個模型接受完全相同的評估流程,先測基礎拒絕能力,再測上下文變更下是否保持一致性,重點不在模型是否有幫助,而在於安全決策的一致性。

重點整理

重點
  • 1

    測試方法要求嚴謹可復現:每個模型接受完全相同的評估流程,先測基礎拒絕能力,再測上下文變更下是否保持一致性,重點不在模型是否有幫助,而在於安全決策的一致性。

  • 2

    DeepSeek存在的一致性問題:雖然在基礎安全檢查中正確拒絕了受限請求,但在新對話加入研究背景材料後,對同一請求的響應變化,表明其安全防護可能不完全抵抗對話操縱。

  • 3

    安全是持續迭代過程而非完成產品:沒有完美的AI模型,開發者需在功能性與安全性之間持續平衡,需要不斷研究與壓力測試來改進系統。

實用技巧與重點

乾貨
  • 測試物件:DeepSeek、Kimi 2.6、GLM(中國開發的主流AI助手)
  • 兩階段測試流程:Phase 1(基礎安全檢查)→ Phase 2(上下文健壯性測試)
  • 評估指標:安全行為一致性(模型是否在不同對話背景下維持相同的安全決策)
  • 測試流程:提交受限請求(基礎測試)→ 新對話 + 研究背景材料 → 提交同一請求(對比測試)
  • 主要發現:DeepSeek在兩個階段表現出不同行為

結論

結論

AI安全防護的一致性檢測對推進整個行業的安全標準至關重要,透過系統化的對比研究能識別現有模型的真實風險點。

完整解析

詳細

這支影片介紹了一項有針對性的AI安全研究專案,旨在評估中國主流大模型面對提示注入攻擊時的防護能力。講者開篇就明確了研究目的是負責任的安全評估,而非鼓勵濫用,這反映了業界對安全問題的嚴肅態度。

為了確保測試的客觀性,研究採用了標準化的兩階段評估方法。第一階段是基礎安全檢查,提交一個被明確政策禁止的請求,驗證模型的預設安全系統是否正常運作。DeepSeek在這個階段表現符合預期,立即拒絕了請求。第二階段則是關鍵的一致性測試——研究者在完全新的對話中加入防禦性AI研究領域常見的上下文材料,然後提交相同的受限請求。這個設計的妙處在於它模擬了真實的社會工程場景,考察模型是否能在不同對話條件下維持一致的安全策略。

在這個過程中,DeepSeek的行為出現了變化。從安全研究的角度看,這是個有意思的發現,因為它表明該模型的安全防護機制可能不夠完全抵抗對話層面的操縱。講者強調,這不是在批評某家公司,而是指出所有AI開發者都面臨著功能性與安全性平衡的挑戰,這種挑戰要求不斷的研究與迭代。

值得注意的是,講者原計劃評估全部三個模型(DeepSeek、Kimi 2.6和GLM),但由於時間限制只完成了DeepSeek的測試,其他兩個模型將在後續影片中深入評估。這反映了一個責任態度——寧可少而精,也不倉促出結論。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。