KeyFrame內部研究專用

SecTor 2025 | Security and Safety Testing for Agentic AI

Black Hat·4月27日週一·39 min英文

三句話摘要

ServiceNow AI 研究主管講解如何對 AI 智能體進行系統性安全測試,從威脅建模到自動化紅隊演練的完整框架。 不要用公開基準測試你的智能體;要從自己的威脅模型出發,同步衡量攻擊成功率與任務成功率,並在推廣探索性發現時透過模式抽象與資料分離防止過度擬合,否則你的評估套件只會越來越脆,越來越無法反映智能體在真實世界中面對的實際風險。 1. 智能體複雜度使測試全面落後

重點整理

重點
  • 1

    1. 智能體複雜度使測試全面落後

  • 2

    現代 AI 系統已從簡單的輸入輸出演進為多工具、多記憶、多回合的複雜軌跡,但測試方法多數仍鎖定初始輸入(前門),忽略環境污染、工具注入、記憶累積等側門威脅,導致測試結果與真實部署風險嚴重脫鉤。

  • 3

    2. 有狀態測試是絕對必要條件

  • 4

    智能體是有狀態的行動者,早期的弱攻擊可在多回合後產生巨大影響。若測試凍結狀態只看單步輸入輸出,等同於假設第一步的事件對第五步毫無影響,這在現實中根本不成立。

  • 5

    3. 安全性與實用性必須並排衡量

  • 6

    加護欄能大幅降低攻擊成功率(ASR),但往往同步傷害任務成功率(TSR)。若只測安全不看效用,決策者無法判斷這個安全改進是否值得;無用的工具終究不會被部署,安全性因此毫無意義。

  • 7

    4. 推廣探索性發現時必須防止過度擬合

  • 8

    將紅隊演練的個別成功案例直接提升為評估套件,會把攻擊設備本身的偏差放大進測試體系,形成脆弱的封閉學習迴圈。正確做法是先抽象為「漏洞家族模式卡」,再用獨立生成器產生評估樣本。

實用技巧與重點

乾貨
  • 具體數字與比例:
  • ChatGPT 每週活躍用戶超 2 億(演講者認為已低估)
  • 超過 50% 的專業開發者每天使用 AI 編碼輔助工具
  • 超過 80% 的大型組織在核心職能中使用 AI
  • Gartner 預測未來幾年約 1/3 企業軟體將具備智能體功能
  • 測試案例:GPT-4o 零售智能體,無護欄 ASR ≈ 35%、TSR ≈ 40%;加護欄後 ASR ≈ 2%、TSR < 10%
  • 工具與框架名稱:
  • Domina(Doomina):ServiceNow Research 開源框架,約 9 個月前發布,專門用於智能體安全與可靠性測試
  • Rainbow Teaming:論文中提出的自動化紅隊方法,以攻擊風格(x 軸)× 威脅模型(y 軸)矩陣搜索,強制在格子間移動避免局部最優
  • 核心指標:
  • ASR(Attack Success Rate):攻擊成功率
  • TSR(Task Success Rate):任務成功率
  • 報告應包含:ASR/TSR 組合、嚴重性分布(高/中/低)、第 50 及 90 百分位利用所需回合數、可檢測性
  • 流程與方法:
  • 三階段:Map(繪製威脅模型)→ Test(情境化基準 + 探索性搜索)→ Generalize(推廣至回歸套件)
  • 威脅建模五要素:結果(Outcomes)、架構(Architecture)、用戶與角色(Users & Roles)、攻擊面(Surface Area)、不變量(Invariants)
  • 每條攻擊路徑設定嘗試次數上限(例:200 次),記錄發現曲線,曲線趨平即停止
  • 資料分離:種子資料 / 開發資料 / 保密測試集(secret holdout set),保密集每週最多測試一次
  • Domina 元件:
  • Task(任務):黃金標籤 + 不變量 + 工具 + 前置條件
  • Attack(攻擊):可攻擊元件 + 攻擊選擇 + 成功過濾器 + 攻擊實作(生成器/變異器)
  • Gateway(閘道):連接 Domina 與真實智能體環境的薄包裝層

結論

結論

不要用公開基準測試你的智能體;要從自己的威脅模型出發,同步衡量攻擊成功率與任務成功率,並在推廣探索性發現時透過模式抽象與資料分離防止過度擬合,否則你的評估套件只會越來越脆,越來越無法反映智能體在真實世界中面對的實際風險。

完整解析

詳細

AI 應用正以曲棍球曲線速度滲透企業,從 ChatGPT 的 2 億週活躍用戶到 Gartner 預測 1/3 企業軟體將智能體化,部署規模的急速擴張帶來了同等急速擴張的攻擊面。問題不在於攻擊者是否存在,而在於我們對自己所部署系統的測試方法,嚴重落後於系統本身的複雜度。早期 GenAI 是簡單的提示輸入與回應輸出,測試方法因此聚焦在「前門」。然而現代智能體系統掛載了記憶、背景工程、工具調用、知識庫連接與開放網路存取,已演變成沿多回合複雜軌跡運動的有狀態行動者。攻擊可以從記憶污染、工具本身、環境資料乃至側門使用者等任何接縫滲入,而現行測試套件幾乎視而不見。

演講者提出三階段解法。第一階段是繪製威脅模型:釐清系統的預期結果與不可接受的結果(不變量),盤點架構元件、用戶角色與觸手所及的資料面,再結合業界最新攻擊類型研究,建構出一份具體可執行的測試計畫,包含攻擊路徑、嘗試次數預算與停止規則,以及 ASR 與 TSR 並排的報告模板。第二階段是真正執行測試,分為兩軌:「情境化基準測試」用於衡量已知問題並維持跨時間的可比性;「探索性搜索」則是自動化紅隊演練,從種子攻擊出發,透過變異器產生成百上千的變體,以 AI 驅動的判斷器評估成功與否,再以聚類方式辨識漏洞家族,並用發現曲線決定何時離開某一搜索區域轉往下一塊黑暗地帶。

ServiceNow 以 Domina 框架對航空公司與零售業兩類真實智能體進行測試,結果顯示威脅模型的選擇主導了最終發現:只測試惡意使用者與同時測試複合型威脅模型,得出的安全結論截然不同。護欄確實有效,但代價顯著:GPT-4o 在零售場景中加上護欄後,ASR 從 35% 壓至 2%,但 TSR 也同步從約 40% 跌至 10% 以下。這組並排數字迫使決策者面對一個現實問題:這個安全改善究竟值不值得?沒有 TSR 對照,這個問題根本無法回答。

第三階段的推廣是最容易出錯的環節。將探索性搜索的個別發現直接加入評估套件,等同於把攻擊設備的內在偏差放大固化,形成封閉的自我強化迴圈,讓評估套件擅長對付自己製造的攻擊,卻對現實世界的泛化能力極差。正確做法是先將發現抽象為「模式卡」,以自然語言描述漏洞家族的本質,再用獨立的生成器產生 50 至 100 個多樣樣本進入評估套件,並維持嚴格的資料分離,尤其是保密測試集只有極少數人可接觸,每週測試次數也應嚴格限制。對於資源有限的團隊,演講者建議採用「手風琴原則」——從縮小版開始(半天建威脅模型、用簡單變異器跑攻擊),確保整個流程的骨架完整,再視資源逐步擴展自動化深度。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性