KeyFrame內部研究專用

It Takes AI to Break AI - AI Red Teaming 101

Alice (Formerly: ActiveFence)·5月25日週一·15 min英文

三句話摘要

代理AI時代的網路安全挑戰與AI Red Teaming方法論。 在代理AI時代,安全防護必須從測試靜態系統轉變為持續監控行為,利用自適應、自主的AI Red Teaming方法才能應對無限擴展且不斷演進的攻擊面——以AI對抗AI。 安全風險已從內容擴展至行為操控

重點整理

重點
  • 1

    安全風險已從內容擴展至行為操控

  • 2

    傳統GenAI主要是生成問題內容,代理AI則可獨立採取行動、調用工具、執行決策。這種能力轉變創造了前所未有的攻擊面,包括提示注入、推理操控、工具調用漏洞等前兩年不存在的生產風險。

  • 3

    組織責任跨界且無人擁有

  • 4

    AI安全事件同時涉及安全、產品、法律與合規部門,但傳統組織架構下沒有人真正擁有整個問題。模型洩露敏感數據既是安全問題、產品缺陷,也是法律風險。

  • 5

    攻擊面無限,靜態測試已失效

  • 6

    在AI系統中,每個字元組合都是有效輸入,攻擊空間實際上無窮。傳統測試(廠商認證、人工紅隊、自動掃描)都只能捕捉已知威脅,無法適應不斷演進的新型攻擊策略。

  • 7

    致命三角形:持續威脅的根源

  • 8

    當代理AI同時擁有三項能力——存取敏感資料、暴露於不可信輸入、能夠工具調用或外部提取資料——攻擊者可利用提示注入將代理重定向到敏感資源,完全破壞系統安全。

實用技巧與重點

乾貨
  • 組織現況與數據
  • 90%企業缺乏保護面向客戶AI系統的能力(Accenture統計)
  • 大多數組織僅部署部署階段防護,缺少前置測試和後續監控
  • 當前測試堆棧存在的漏洞
  • 廠商安全認證:基於信任而非驗證
  • 人工紅隊:創意但無法規模化,只測試人工想到的場景
  • 自動掃描:僅捕捉已知攻擊特徵
  • 基準評估:使用通用數據集,不針對特定用例
  • 滲透測試:檢查基礎設施漏洞,無法捕捉模型行為問題(jailbreak)
  • 策略對齊:過濾關鍵字,不等於實際行為驗證
  • 真實案例
  • XAI Grok:模型升級後出現反猶太行為,X CEO隨後辭職
  • 某招聘聊天機器人:暴露千萬級候選人PII記錄
  • Chevrolet聊天機器人:推薦競爭對手Tesla
  • Microsoft 365 Copilot:單一包含隱藏指令的電郵能導致AI靜默提取內部檔案到攻擊者伺服器
  • GitHub Copilot:代碼中的隱藏指令被AI拾取並自動執行shell命令
  • 致命三角形概念
  • 由網路安全研究者Simon Wilson提出,三項能力同時出現:
  • 存取敏感或私密資料
  • 暴露於不可信輸入
  • 工具調用或外部資料提取能力
  • AI Red Teaming的三階段防御
  • 前置測試:模型行為驗證、策略對齊度、逐用例風險評估
  • 部署階段:即時防護、異常偵測、人工介入
  • 後置階段:持續紅隊演習、版本迴歸測試、稽核跡證、合規整備

結論

結論

在代理AI時代,安全防護必須從測試靜態系統轉變為持續監控行為,利用自適應、自主的AI Red Teaming方法才能應對無限擴展且不斷演進的攻擊面——以AI對抗AI。

完整解析

詳細

AI技術正在迅速改變網路安全態勢,尤其是代理AI的出現帶來了根本性的威脅轉變。講者Avi指出,這個問題並非源於AI本身,而是來自其訓練方式——AI是基於網際網路訓練的,而互聯網充滿了有害和對抗行為。傳統上,技術進步會同時擴展創意和濫用,但AI的不同之處在於它加快了這個過程,降低了成本,並能在大規模上實施。更令人擔憂的是,在代理AI時代,系統不再被動地生成有害內容,而是能夠獨立生成和協調濫用行為。

這創造了一個日益嚴峻的安全危機。根據Accenture調查,90%的企業缺乏保護面向客戶的AI系統的能力,而這還是在代理AI普及之前。講者列舉了多個真實案例來說明風險範圍:XAI的Grok模型因為升級後出現反猶太言論導致X CEO辭職;某招聘聊天機器人暴露了數千萬級的候選人個人隱私資料;Microsoft 365 Copilot被發現能通過單一包含隱藏指令的電郵靜默竊取內部檔案。這些事件說明,AI相關的失敗跨越了安全、產品、法律和合規的邊界,沒有單一部門能夠擁有整個問題。

代理AI改變了攻擊面的本質。傳統GenAI主要關注生成的內容質量——是否有毒、是否有偏見、是否洩露敏感信息——但這些都發生在人工監督下。代理AI則不同,它能夠調用工具、做出決策、甚至連接到其他系統,所有這些都可能不需要人工介入。這意味著攻擊面從簡單的有害提示擴展到推理操控、工具調用漏洞、誤對齊自主性等全新維度。在AI系統中,每個字元組合都代表一個有效輸入,攻擊空間實際上是無限的。

講者提出了「致命三角形」概念來分類代理AI的核心風險:當一個代理AI同時具備存取敏感資料、暴露於不可信輸入、以及能夠工具調用或外部資料提取的能力時,攻擊者可以利用提示注入將代理重定向到敏感資源,使其代表攻擊者行動。如果系統只擁有其中兩項能力,風險仍可管理;但當三項都具備時,就產生了「混淆代理」,系統變得極其危險。

傳統的安全測試方法在面對這種複雜性時力不從心。廠商的安全認證只是聲稱而非驗證;人工紅隊測試雖然富有創意,但無法規模化,只能測試測試者想到的場景;自動掃描則受限於已知的攻擊特徵;基準評估使用通用數據集,不針對具體用例;滲透測試檢查基礎設施漏洞,卻無法捕捉模型行為問題。這些方法的共同缺陷是它們都試圖在一個無限的攻擊空間中進行靜態測試。

AI Red Teaming代表了一個根本性的轉變。它不是被動地檢查已知問題,而是主動、對抗性地嘗試破壞系統。這個過程始於映射系統的攻擊面,然後利用對抗性智能生成攻擊策略,執行多次迭代測試,評估響應並生成洞察。至關重要的是,這個過程必須是持續的,因為AI系統具有非確定性特徵——相同的輸入可能產生不同的輸出。AI驅動的Red Teaming通過自動化這一循環來實現規模化:系統持續生成攻擊、執行測試、評分結果、適應改進。這不是靜態測試套件,而是一個不斷演進的對手,用AI對抗AI。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性