KeyFrame內部研究專用

May 12, 2026 - Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

BlueDot AI Safety Evals Reading Group·5月12日週二·21 min英文

三句話摘要

如何透過威脅快照方法評估大語言模型在代理應用中對攻擊的抗性。 針對代理應用的AI安全評估需採用分層方法——威脅快照用於單點診斷,端到端測試用於全域性風險評估,兩者結合才能構築真正堅實的防禦。

重點整理

重點
  • 1

  • 2

    AI安全與AI安全的區分 — AI安全關注系統本身是否被破壞(如被竊取、被操縱),而AI安全關注使用者是否遭受傷害。安全漏洞可能導致安全故障,因此兩者緊密相連,但在工業應用中需要用不同的防禦策略。

  • 3

    威脅快照方法的優勢 — 不同於耗資昂貴且難以診斷的端到端代理測試,威脅快照聚焦代理工作流的特定步驟,打包完整的代理狀態、上下文和攻擊描述,使評估成本大幅下降且能精準定位薄弱環節。

  • 4

    更大模型未必更安全 — 測試結果顛覆預期,模型大小與安全性無直接關係;但啟用推理能力(如Chain-of-Thought)在大多數模型上顯著提升抵禦能力。

  • 5

    需針對具體風險評估 — 不同模型在不同攻擊向量上表現差異大,開發者必須針對自身應用的特定威脅進行評估,而非依賴通用排名。

  • 6

實用技巧與重點

乾貨
  • 基準測試規模:Gandalf Agent Breaker 執行2個月,收集近200,000次攻擊,精選最高質量與最可推廣的案例
  • 測試涵蓋的LLM:19個不同大語言模型(包括Anthropic Claude、Google Grock、OpenAI、開源模型等)
  • 攻擊型別:不限於有害內容生成,而是針對指令遵循的特定目標(如讓代理在程式碼中插入特定包、在財務分析中製造虛假資訊)
  • 評估指標:包括系統提示提取難度、指令遵循優先順序轉換、各類代理任務的脆弱性
  • 端到端評估 vs 威脅快照:前者類似軟體工程的整合測試,後者類似單元測試;建議部署關鍵系統時兩者並行
  • 推理能力影響:除了GPT-4o nano和Gemini 2.5 Flash等最小模型外,啟用推理普遍提升安全性
  • 模型安全排名:Claude系列表現最佳,Google Grock模型意外強勢;開源模型表現落後(但背景是缺乏額外的生產端防禦層)

結論

結論

針對代理應用的AI安全評估需採用分層方法——威脅快照用於單點診斷,端到端測試用於全域性風險評估,兩者結合才能構築真正堅實的防禦。

完整解析

詳細

Lakeira 是一家專注AI安全防禦的公司,去年被網路安全巨頭Checkpoint收購。講者Julia詳細介紹了該公司與英國AI安全研究所的合作成果——一套評估LLM在代理應用中抗攻擊能力的新方法論。

傳統的端到端代理測試存在三大困境:成本高昂(執行代理仍然昂貴)、難以沙箱化(必須隔離生產環境並模擬所有資料來源)、缺乏精細化診斷(只能得到整體結果,無法判斷哪個環節最脆弱)。Lakeira提出的「威脅快照」方法打破了這個困局。其核心思想是將代理工作流分解為多個關鍵步驟,在每個步驟打一個「快照」,捕捉該時刻的完整代理狀態(上下文、記憶、可用工具等),然後在這個隔離的狀態下注入特定攻擊,評估該環節的脆弱性。這樣做的好處顯而易見:執行成本大幅降低(只需模擬區域性資料,不必執行實際工具)、更容易診斷(能精確指出需要加固的位置)、規模易於擴充套件。

該團隊透過Gandalf Agent Breaker遊戲眾包了近20萬次真實攻擊資料,參與者的任務不是生成有害內容,而是以極具針對性的方式攻擊代理的指令遵循能力——例如讓代理在生成的程式碼中偷偷加入惡意包,或在財務報告分析中故意注入虛假資訊。這些真實的對抗性嘗試為基準測試提供了堅實的基礎。

測試結果令人意外。首先,更大的模型並不一定更安全,與直覺相反。但一個重要發現是:啟用推理能力(如extended thinking或Chain-of-Thought)能在大多數模型上顯著提升抵禦能力,少數超小型模型除外。其次,不同模型在不同攻擊向量上的表現差異極大——某個模型在抵禦系統提示提取上表現強勢,但在優先順序轉換攻擊(讓模型遵循使用者指令而非系統指令)上卻相對脆弱。這意味著開發者不能迷信排名,必須針對自己應用的具體威脅場景進行評估。最後,安全性與模型能力確實存在正相關性,但相關性遠非絕對。

展望未來,這套方法還有很大的擴充套件空間——理想狀態是擁有數千個代理工作流而非當前的十個,以及完全自動化的黑盒攻擊能力。此外,AI安全評估還需納入靜態分析(檢查代理可呼叫的工具、可訪問的服務)與端到端模擬的結合,形成立體的防禦框架。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性