May 12, 2026 - Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents
三句話摘要
如何透過威脅快照方法評估大語言模型在代理應用中對攻擊的抗性。 針對代理應用的AI安全評估需採用分層方法——威脅快照用於單點診斷,端到端測試用於全域性風險評估,兩者結合才能構築真正堅實的防禦。
重點整理
重點- 1
- 2
AI安全與AI安全的區分 — AI安全關注系統本身是否被破壞(如被竊取、被操縱),而AI安全關注使用者是否遭受傷害。安全漏洞可能導致安全故障,因此兩者緊密相連,但在工業應用中需要用不同的防禦策略。
- 3
威脅快照方法的優勢 — 不同於耗資昂貴且難以診斷的端到端代理測試,威脅快照聚焦代理工作流的特定步驟,打包完整的代理狀態、上下文和攻擊描述,使評估成本大幅下降且能精準定位薄弱環節。
- 4
更大模型未必更安全 — 測試結果顛覆預期,模型大小與安全性無直接關係;但啟用推理能力(如Chain-of-Thought)在大多數模型上顯著提升抵禦能力。
- 5
需針對具體風險評估 — 不同模型在不同攻擊向量上表現差異大,開發者必須針對自身應用的特定威脅進行評估,而非依賴通用排名。
- 6
實用技巧與重點
乾貨- 基準測試規模:Gandalf Agent Breaker 執行2個月,收集近200,000次攻擊,精選最高質量與最可推廣的案例
- 測試涵蓋的LLM:19個不同大語言模型(包括Anthropic Claude、Google Grock、OpenAI、開源模型等)
- 攻擊型別:不限於有害內容生成,而是針對指令遵循的特定目標(如讓代理在程式碼中插入特定包、在財務分析中製造虛假資訊)
- 評估指標:包括系統提示提取難度、指令遵循優先順序轉換、各類代理任務的脆弱性
- 端到端評估 vs 威脅快照:前者類似軟體工程的整合測試,後者類似單元測試;建議部署關鍵系統時兩者並行
- 推理能力影響:除了GPT-4o nano和Gemini 2.5 Flash等最小模型外,啟用推理普遍提升安全性
- 模型安全排名:Claude系列表現最佳,Google Grock模型意外強勢;開源模型表現落後(但背景是缺乏額外的生產端防禦層)
結論
結論“ 針對代理應用的AI安全評估需採用分層方法——威脅快照用於單點診斷,端到端測試用於全域性風險評估,兩者結合才能構築真正堅實的防禦。”
完整解析
詳細Lakeira 是一家專注AI安全防禦的公司,去年被網路安全巨頭Checkpoint收購。講者Julia詳細介紹了該公司與英國AI安全研究所的合作成果——一套評估LLM在代理應用中抗攻擊能力的新方法論。
傳統的端到端代理測試存在三大困境:成本高昂(執行代理仍然昂貴)、難以沙箱化(必須隔離生產環境並模擬所有資料來源)、缺乏精細化診斷(只能得到整體結果,無法判斷哪個環節最脆弱)。Lakeira提出的「威脅快照」方法打破了這個困局。其核心思想是將代理工作流分解為多個關鍵步驟,在每個步驟打一個「快照」,捕捉該時刻的完整代理狀態(上下文、記憶、可用工具等),然後在這個隔離的狀態下注入特定攻擊,評估該環節的脆弱性。這樣做的好處顯而易見:執行成本大幅降低(只需模擬區域性資料,不必執行實際工具)、更容易診斷(能精確指出需要加固的位置)、規模易於擴充套件。
該團隊透過Gandalf Agent Breaker遊戲眾包了近20萬次真實攻擊資料,參與者的任務不是生成有害內容,而是以極具針對性的方式攻擊代理的指令遵循能力——例如讓代理在生成的程式碼中偷偷加入惡意包,或在財務報告分析中故意注入虛假資訊。這些真實的對抗性嘗試為基準測試提供了堅實的基礎。
測試結果令人意外。首先,更大的模型並不一定更安全,與直覺相反。但一個重要發現是:啟用推理能力(如extended thinking或Chain-of-Thought)能在大多數模型上顯著提升抵禦能力,少數超小型模型除外。其次,不同模型在不同攻擊向量上的表現差異極大——某個模型在抵禦系統提示提取上表現強勢,但在優先順序轉換攻擊(讓模型遵循使用者指令而非系統指令)上卻相對脆弱。這意味著開發者不能迷信排名,必須針對自己應用的具體威脅場景進行評估。最後,安全性與模型能力確實存在正相關性,但相關性遠非絕對。
展望未來,這套方法還有很大的擴充套件空間——理想狀態是擁有數千個代理工作流而非當前的十個,以及完全自動化的黑盒攻擊能力。此外,AI安全評估還需納入靜態分析(檢查代理可呼叫的工具、可訪問的服務)與端到端模擬的結合,形成立體的防禦框架。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


