SecTor 2025 | Security and Safety Testing for Agentic AI
三句話摘要
ServiceNow AI 研究主管講解如何對 AI 智能體進行系統性安全測試,從威脅建模到自動化紅隊演練的完整框架。 不要用公開基準測試你的智能體;要從自己的威脅模型出發,同步衡量攻擊成功率與任務成功率,並在推廣探索性發現時透過模式抽象與資料分離防止過度擬合,否則你的評估套件只會越來越脆,越來越無法反映智能體在真實世界中面對的實際風險。 1. 智能體複雜度使測試全面落後
重點整理
重點- 1
1. 智能體複雜度使測試全面落後
- 2
現代 AI 系統已從簡單的輸入輸出演進為多工具、多記憶、多回合的複雜軌跡,但測試方法多數仍鎖定初始輸入(前門),忽略環境污染、工具注入、記憶累積等側門威脅,導致測試結果與真實部署風險嚴重脫鉤。
- 3
2. 有狀態測試是絕對必要條件
- 4
智能體是有狀態的行動者,早期的弱攻擊可在多回合後產生巨大影響。若測試凍結狀態只看單步輸入輸出,等同於假設第一步的事件對第五步毫無影響,這在現實中根本不成立。
- 5
3. 安全性與實用性必須並排衡量
- 6
加護欄能大幅降低攻擊成功率(ASR),但往往同步傷害任務成功率(TSR)。若只測安全不看效用,決策者無法判斷這個安全改進是否值得;無用的工具終究不會被部署,安全性因此毫無意義。
- 7
4. 推廣探索性發現時必須防止過度擬合
- 8
將紅隊演練的個別成功案例直接提升為評估套件,會把攻擊設備本身的偏差放大進測試體系,形成脆弱的封閉學習迴圈。正確做法是先抽象為「漏洞家族模式卡」,再用獨立生成器產生評估樣本。
實用技巧與重點
乾貨- 具體數字與比例:
- ChatGPT 每週活躍用戶超 2 億(演講者認為已低估)
- 超過 50% 的專業開發者每天使用 AI 編碼輔助工具
- 超過 80% 的大型組織在核心職能中使用 AI
- Gartner 預測未來幾年約 1/3 企業軟體將具備智能體功能
- 測試案例:GPT-4o 零售智能體,無護欄 ASR ≈ 35%、TSR ≈ 40%;加護欄後 ASR ≈ 2%、TSR < 10%
- 工具與框架名稱:
- Domina(Doomina):ServiceNow Research 開源框架,約 9 個月前發布,專門用於智能體安全與可靠性測試
- Rainbow Teaming:論文中提出的自動化紅隊方法,以攻擊風格(x 軸)× 威脅模型(y 軸)矩陣搜索,強制在格子間移動避免局部最優
- 核心指標:
- ASR(Attack Success Rate):攻擊成功率
- TSR(Task Success Rate):任務成功率
- 報告應包含:ASR/TSR 組合、嚴重性分布(高/中/低)、第 50 及 90 百分位利用所需回合數、可檢測性
- 流程與方法:
- 三階段:Map(繪製威脅模型)→ Test(情境化基準 + 探索性搜索)→ Generalize(推廣至回歸套件)
- 威脅建模五要素:結果(Outcomes)、架構(Architecture)、用戶與角色(Users & Roles)、攻擊面(Surface Area)、不變量(Invariants)
- 每條攻擊路徑設定嘗試次數上限(例:200 次),記錄發現曲線,曲線趨平即停止
- 資料分離:種子資料 / 開發資料 / 保密測試集(secret holdout set),保密集每週最多測試一次
- Domina 元件:
- Task(任務):黃金標籤 + 不變量 + 工具 + 前置條件
- Attack(攻擊):可攻擊元件 + 攻擊選擇 + 成功過濾器 + 攻擊實作(生成器/變異器)
- Gateway(閘道):連接 Domina 與真實智能體環境的薄包裝層
結論
結論“不要用公開基準測試你的智能體;要從自己的威脅模型出發,同步衡量攻擊成功率與任務成功率,並在推廣探索性發現時透過模式抽象與資料分離防止過度擬合,否則你的評估套件只會越來越脆,越來越無法反映智能體在真實世界中面對的實際風險。”
完整解析
詳細AI 應用正以曲棍球曲線速度滲透企業,從 ChatGPT 的 2 億週活躍用戶到 Gartner 預測 1/3 企業軟體將智能體化,部署規模的急速擴張帶來了同等急速擴張的攻擊面。問題不在於攻擊者是否存在,而在於我們對自己所部署系統的測試方法,嚴重落後於系統本身的複雜度。早期 GenAI 是簡單的提示輸入與回應輸出,測試方法因此聚焦在「前門」。然而現代智能體系統掛載了記憶、背景工程、工具調用、知識庫連接與開放網路存取,已演變成沿多回合複雜軌跡運動的有狀態行動者。攻擊可以從記憶污染、工具本身、環境資料乃至側門使用者等任何接縫滲入,而現行測試套件幾乎視而不見。
演講者提出三階段解法。第一階段是繪製威脅模型:釐清系統的預期結果與不可接受的結果(不變量),盤點架構元件、用戶角色與觸手所及的資料面,再結合業界最新攻擊類型研究,建構出一份具體可執行的測試計畫,包含攻擊路徑、嘗試次數預算與停止規則,以及 ASR 與 TSR 並排的報告模板。第二階段是真正執行測試,分為兩軌:「情境化基準測試」用於衡量已知問題並維持跨時間的可比性;「探索性搜索」則是自動化紅隊演練,從種子攻擊出發,透過變異器產生成百上千的變體,以 AI 驅動的判斷器評估成功與否,再以聚類方式辨識漏洞家族,並用發現曲線決定何時離開某一搜索區域轉往下一塊黑暗地帶。
ServiceNow 以 Domina 框架對航空公司與零售業兩類真實智能體進行測試,結果顯示威脅模型的選擇主導了最終發現:只測試惡意使用者與同時測試複合型威脅模型,得出的安全結論截然不同。護欄確實有效,但代價顯著:GPT-4o 在零售場景中加上護欄後,ASR 從 35% 壓至 2%,但 TSR 也同步從約 40% 跌至 10% 以下。這組並排數字迫使決策者面對一個現實問題:這個安全改善究竟值不值得?沒有 TSR 對照,這個問題根本無法回答。
第三階段的推廣是最容易出錯的環節。將探索性搜索的個別發現直接加入評估套件,等同於把攻擊設備的內在偏差放大固化,形成封閉的自我強化迴圈,讓評估套件擅長對付自己製造的攻擊,卻對現實世界的泛化能力極差。正確做法是先將發現抽象為「模式卡」,以自然語言描述漏洞家族的本質,再用獨立的生成器產生 50 至 100 個多樣樣本進入評估套件,並維持嚴格的資料分離,尤其是保密測試集只有極少數人可接觸,每週測試次數也應嚴格限制。對於資源有限的團隊,演講者建議採用「手風琴原則」——從縮小版開始(半天建威脅模型、用簡單變異器跑攻擊),確保整個流程的骨架完整,再視資源逐步擴展自動化深度。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


