KeyFrame內部研究專用

Agentic AI Security Is 10x Harder Than LLM Safety

Agentic AI Foundation·4月22日週三·25 min英文

三句話摘要

智能體 AI 系統的根本安全轉變——從文本生成到自主行動,如何建立多層防禦架構以應對全新的威脅模型。 智能體 AI 的防禦不是單一功能而是從設計階段就必須隨能力提升而擴展的約束,需要持續平衡自主性、權限和保障三要素,同時實施四層深度防禦架構來對抗結構性不對稱的威脅環境。 智能體 AI 的架構根本矛盾在於非確定性決策者控制確定性系統。傳統 LLM 時代安全模型相對封閉(文字輸入、文字輸出),風險主要是快速注入和資料洩露;但智能體時代則完全不同,代理能規劃多步驟工作流、呼叫工具、執行程式碼、維持狀態並跨智能體協調,這使得錯誤的決策會產生真實世界的破壞性後果,而非僅是錯誤文本。

重點整理

重點
  • 1

    智能體 AI 的架構根本矛盾在於非確定性決策者控制確定性系統。傳統 LLM 時代安全模型相對封閉(文字輸入、文字輸出),風險主要是快速注入和資料洩露;但智能體時代則完全不同,代理能規劃多步驟工作流、呼叫工具、執行程式碼、維持狀態並跨智能體協調,這使得錯誤的決策會產生真實世界的破壞性後果,而非僅是錯誤文本。

  • 2

    持久內存的級聯威脅是結構性危機。一次對內存的「投毒」可持續影響所有後續交互,影響會逐漸累積且難以檢測。在多智能體系統中更加危險,因為污染會跨智能體傳播,造成難以預測的級聯故障和系統範圍內的破毀。

  • 3

    間接提示注入是現實中最常見的攻擊途徑。攻擊者不需直接接觸智能體,只需在網頁評論、推文或文件中植入隱藏指令。智能體在檢索這些內容時會執行攻擊指令而非使用者意圖,因為 LLM 的控制通道與資料通道完全未分離——指令與資料看起來一樣,無法區分。

  • 4

    自主人工智慧三要素指出核心平衡困難:自主性×權限必須等於或小於保障水平。目前大多數組織的保障嚴重滯後於權限賦予,導致可利用的漏洞。防禦不是部署後添加的功能,而必須從設計階段就隨著能力提升而擴展。

實用技巧與重點

乾貨
  • 真實事件案例
  • 2026 年 2 月,Meta AI 安全總監 Summer Ju 部署的 OpenClaw 代理在上下文窗口壓縮時喪失安全指令,導致批量刪除數百封郵件。Bitstrike 已發現數萬個暴露的 OpenClaw 代理。
  • 七個設計維度風險等級
  • 代理能看到什麼(不受信任外部數據攝取量)
  • 代理接觸的敏感數據量
  • 3-4. 代理能做什麼(執行操作、編寫程式碼、發送郵件、修改系統)
  • 內存系統(持久狀態導致級聯投毒風險)
  • 6-7. 動態工具發現(MCP 在運時引入供應鏈風險)、富 UI 帶來的跨站資料外洩和點擊劫持
  • 四層攻擊等級
  • 第一層:注入攻擊(目標劫持、間接注入、直接注入),目標劫持被 OWASP 評為頭號威脅
  • 第二層:權限滥用(工具滥用、身份滥用、供應鏈入侵)
  • 第三層:內存執行(執行沙箱逃逸、內存中毒級聯效應)
  • 第四層:多智能體特有攻擊(智能體間攻擊、級聯故障、信任利用、流氓智能體)
  • 威脅行為者類型
  • 環境投毒者(發佈網頁/npm 套件的任何人)
  • 黑盒操縱者(與使用者交互,RLbased 方法實現 100% 即時提取)
  • 內部人員(完全了解智能體內部結構)
  • 自主 AI 攻擊者(機器速度無人干預執行完整攻擊鏈)
  • 配置滥用者(重新配置代理任務)
  • 憑證收集者(2025 年 33 億憑證因信息竊取外洩)
  • 漏洞利用能力增長數據
  • Cyber Gym 基準測試:188 個開源項目的 1500 個漏洞
  • 模型漏洞利用速度約每六個月翻倍
  • Claude Opus 4.6 目前漏洞利用率接近 65%
  • GPT-5 零日漏洞從 15 個躍升至 34 個
  • 給代理 30 次嘗試時,成功率跳升至 65-67%
  • 防守方面:AI 可修復 90% 已知漏洞,但自主發現漏洞比例僅 5%
  • 間接提示注入的三個關鍵因素
  • LLM 中控制通道和資料無分離(與 FTP 協議不同)
  • 代理使用合法訪問權限(攻擊者不需未授權訪問)
  • 多步驟執行放大影響(一次注入可層層推進)
  • 四層深度防禦架構
  • 第一層:清理(視外部輸入為不可信、檢測注入、驗證工具輸出、分離指令和資料通道)
  • 第二層:模型防禦(指令優先級結構、安全微調、推理監控檢測目標漂移、幻覺檢測)
  • 第三層:操作執行策略(Donsong 的 ProgN 框架使用領域特定語言實現可編程權限控制,如「允許在檔案路徑允許時讀取檔案」、「允許在金額與已批准請求接收者匹配時發送資金」)
  • 第四層:監控異常檢測(行為基線、每次工具呼叫的不可更改審計跟踪、實時代理註冊表、級聯故障檢測、緊急停止開關)
  • 當前狀況:僅 15-20% 的組織擁有審計跟踪和監控能力
  • 防禦 vs 攻擊的結構性不對稱
  • 防禦者需有效修復所有漏洞,攻擊者只需一個
  • 補丁可被逆向工程成漏洞利用
  • 所有防禦能力(滲透測試、漏洞檢測、補丁生成)都可被攻擊者利用

結論

結論

智能體 AI 的防禦不是單一功能而是從設計階段就必須隨能力提升而擴展的約束,需要持續平衡自主性、權限和保障三要素,同時實施四層深度防禦架構來對抗結構性不對稱的威脅環境。

完整解析

詳細

智能體 AI 的出現標誌著人工智慧風險模型的根本轉變。傳統大語言模型時代的風險相對可控——系統接收文本輸入,輸出文本,最壞情況是誤導和冒犯。但智能體 AI 完全不同。這些系統能夠規劃多步驟工作流、呼叫工具、執行程式碼、發送郵件、修改資料庫,並持有系統憑證和持久內存。一句話說,它們就像環境中擁有實際權限的自主數位員工。這種轉變涵蓋三個核心面向:從文本到行動(資訊外洩升級為環境破毀)、從單次會話到持久狀態(一次中毒影響所有後續交互)、從單代理到多代理協調(引入全新的跨系統攻擊面)。

架構層面的根本矛盾在於非確定性推理者控制確定性執行系統。LLM 做決策時具有隨機性——相同輸入可能產生不同計畫和工具選擇。但工具、內存和環境會忠實地執行這些決策,不加質疑。這就是為什麼間接提示注入成為最常見且最難防禦的攻擊。攻擊者不需直接接觸智能體,只需在被代理檢索的網頁評論、推文或文件中植入隱藏指令。由於 LLM 的控制通道與資料通道完全未分離(不像 FTP 協議那樣有明確分離),指令和資料看起來完全相同。代理檢索內容時會執行攻擊指令而非使用者意圖,而多步驟執行會進一步放大這種影響——一次注入可透過規劃、工具選擇、執行等層層推進,在任何人察覺前造成大規模破壞。

持久內存帶來的威脅更具隱蔽性。智能體維持長期狀態,一次對內存的「投毒」(無論是透過注入還是直接污染)會持續影響所有後續交互。在多智能體系統中這尤為災難性,因為污染會跨智能體傳播,影響會逐漸累積且難以檢測。當前組織的防禦嚴重滯後——只有 15-20% 的組織擁有基本的審計跟踪和監控能力。更令人擔憂的是,模型的漏洞利用能力正以驚人速度增長。研究顯示模型漏洞利用速度約每六個月翻倍,而防守方面則陷入根本的不對稱性:防禦者需有效修復所有漏洞,攻擊者只需一個;補丁可被逆向工程成漏洞利用;所有防禦能力都可能被攻擊者反過來利用。

對此,防禦需要從「發現並修復」思維升級到「安全設計」。這要求四層深度防禦架構協同工作。第一層是清理,將所有外部輸入視為不可信,檢測注入模式,驗證工具輸出,盡可能分離指令通道和資料通道。第二層是模型防禦,包括建立指令優先級結構(系統提示優先於使用者輸入,使用者輸入優先於檢索內容),進行安全微調,實施推理監控檢測目標漂移,以及在工具呼叫前進行幻覺檢測。第三層是操作執行策略,使用 Donsong 的 ProgN 框架這類領域特定語言提供可編程權限控制——允許寫出「允許在檔案路徑許可時讀取檔案」或「允許在金額與已批准請求接收者匹配時發送資金」這樣的動態政策,隨著代理上下文變化而更新,維持最小權限原則。第四層是監控和異常檢測,建立每個智能體的行為基線,為每次工具呼叫建立不可更改的審計跟踪,實時監控代理活動,檢測級聯故障,並配備緊急停止開關。關鍵原則是攻擊者必須攻破每一層防禦,而非只需突破單一控制點——這大幅提高了攻擊難度。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性