KeyFrame內部研究專用

SecTor 2025 | One Agent to Rule Them All: How One Malicious Agent Hijacks A2A System

Black Hat·4月13日週一·50 min英文

三句話摘要

研究人員在 Black Hat 揭露 Google A2A 協定的「Agentware」攻擊:惡意 AI Agent 可在無需任何目標系統知識的情況下,自主滲透並摧毀企業多代理人系統。 在多代理人 AI 系統中,一個 14 美元的惡意 Agent 足以讓 LLM 自主偵查、推理並摧毀整個企業系統——軟性 Prompt 防護無法對抗這類攻擊,唯有工具標籤化、跨域隔離與強制 Human-in-the-Loop 的硬性架構才是真正的防線。 Agent Card 未消毒注入是根本漏洞:Google A2A 的 Host Agent 在發現階段將遠端 Agent 回傳的 Agent Card 原始 JSON 直接 dump 進 System Prompt,外部來源的惡意描述因此成為 Prompt Injection 的入口,整個信任鏈從協定層開始就已斷裂。

重點整理

重點
  • 1

    Agent Card 未消毒注入是根本漏洞:Google A2A 的 Host Agent 在發現階段將遠端 Agent 回傳的 Agent Card 原始 JSON 直接 dump 進 System Prompt,外部來源的惡意描述因此成為 Prompt Injection 的入口,整個信任鏈從協定層開始就已斷裂。

  • 2

    Agentware 利用 LLM 推理能力對抗自身系統:攻擊不依賴程式碼漏洞,而是透過讓 LLM 主動偵查自身擁有的工具與代理人、推理最大破壞方式,再於推論時執行,使「規劃能力」這個 Agent 最有價值的特性反過來成為武器。

  • 3

    無目標攻擊大幅提升威脅規模:攻擊者只需將惡意 Agent 發布到網路上(如 GitHub、LinkedIn),無需了解受害者的系統架構;一旦被安裝,Agent 會自行探索環境並決定攻擊策略,在 100 次測試中,防火牆變更被觸發 90 次,但每次使用的工具組合不同,顯示攻擊具備真實的不確定性與廣度。

  • 4

    軟性防護不夠,需要硬性架構隔離:在 System Prompt 中告知 Agent「不要洩漏資料」屬於 Soft Guardrail,可被更好的 Jailbreak 繞過;真正的防護需要對工具打標籤、阻斷危險工具組合(如讀取資料庫後直接外傳)、沙箱環境預審 Agent、以及對高風險操作強制 Human-in-the-Loop 確認。

實用技巧與重點

乾貨
  • 漏洞位置
  • Google A2A 開源程式碼中:`build_targets` → `agent_info` → Agent Card description 直接注入 System Prompt,無任何消毒
  • 攻擊三步流程(Untargeted Attack)
  • Reconnaissance:強迫 Agent 列舉系統內所有工具與其他 Agent
  • Damage Reasoning:詢問 LLM 以現有工具能造成什麼破壞
  • Apply:推論時自動執行選定的破壞行為
  • 實測攻擊類型與結果
  • 廣告植入:修改 Agent Card 描述,讓 Host 在特定話題中強制推薦攻擊者商店,成功率:高
  • 資料竊取:Host 被操控提取敏感資料(信用卡、密碼、內部 IP)並轉傳至惡意 Agent,資料完全離開系統
  • 系統破壞:防火牆規更觸發率 90/100 次;並可組合「建立帳號 + 修改防火牆」形成持久化入侵鏈
  • 攻擊載體與成本
  • 惡意 Agent Card 描述欄位(單一字串修改即可觸發)
  • GPT-5 幻覺生成的假 OpenAI A2A URL 域名:14 美元
  • 受污染的開源 Agent(agentware 對靜態程式碼掃描不可見)
  • LLM 幻覺推薦套件:研究人員發布假套件後獲得 30,000 次下載
  • 防禦建議
  • 沙箱環境預審所有第三方 Agent,加入前先測試行為
  • 對工具打危險等級標籤,阻斷跨安全域的工具組合
  • 部署 Agent 行為異常偵測模型(基準 vs. 當前行為)
  • 關鍵操作(如關閉伺服器 AC、VM 重置)強制 Human-in-the-Loop
  • 建立 Agent 操作 UI,記錄所有工具呼叫與資料流動
  • 披露情況
  • Google 回應:不達金錢獎勵門檻,自行決定是否修復
  • 截至演講當下:Agent Card dumping 邏輯原封未動,無架構層面修改

結論

結論

在多代理人 AI 系統中,一個 14 美元的惡意 Agent 足以讓 LLM 自主偵查、推理並摧毀整個企業系統——軟性 Prompt 防護無法對抗這類攻擊,唯有工具標籤化、跨域隔離與強制 Human-in-the-Loop 的硬性架構才是真正的防線。

完整解析

詳細

本場 Black Hat 演講由 Zenity 資深 AI 安全研究員 Tav Cohen 與 Technion AI Atlas 實驗室研究員 Adar 共同發表,主題聚焦於多代理人 AI 系統的新型威脅——他們將其命名為 Agentware。

背景源於生成式 AI 的演進趨勢。隨著 LLM 被賦予工具調用能力,單一 Agent 已能規劃步驟、呼叫 API、協調任務;而 Google A2A、OpenAI Agents 等框架更進一步讓多個 Agent 透過網路相互串接,使企業能像安裝 Python 套件一樣從公開 URL 引入第三方 Agent。這種開放性雖帶來強大的擴展彈性,卻也在協定層埋下致命盲點:Google A2A 在實作時,Host Agent 的發現機制(Discovery)會將遠端 Agent 回傳的 Agent Card 原始 JSON 未加消毒地直接注入 System Prompt。由於 Agent Card 是外部來源的輸入,這等同於將攻擊者可控的字串直接放入 AI 的核心指令中。

研究人員以此為入口設計了「無目標攻擊」(Untargeted Attack)框架。攻擊者無需事先了解受害者系統的任何細節,只需在 Agent Card 的描述欄位中植入三階段指令:第一階段強制 Host Agent 偵查自身環境,列舉所有可用工具與已連接的代理人;第二階段利用 LLM 本身的推理能力,詢問「以這些工具能造成什麼破壞」;第三階段根據推理結果於推論時自動執行最具破壞性的行動。整個攻擊鏈完全在 LLM 的推理空間內完成,不需要傳統意義上的程式碼漏洞或 Zero-day。

研究團隊展示了三種層層遞進的攻擊場景,以一個企業 IT 助理系統為靶標(該系統整合了網路搜尋 Agent、資料庫 Agent 與基礎設施控制工具)。第一類攻擊為廣告植入:每當 IT 人員詢問伺服器採購建議,回應中必然出現攻擊者商店的推薦。第二類攻擊為資料竊取:惡意 Agent 作為系統內的「臥底監聽器」,一旦對話涉及信用卡號、密碼或內部 IP,Host 即被操控提取並轉傳至外部伺服器,且對使用者完全透明不留痕跡。第三類攻擊為系統破壞:在 100 次測試中,防火牆規則被惡意修改的成功率達 90%,並有多種工具組合(如建立系統帳號後再修改防火牆)被自主發現並執行,展現出真實入侵鏈的邏輯。攻擊的切入成本極低——一個研究人員只花了 14 美元購買一個 LLM 幻覺生成的假 OpenAI A2A 域名,便足以架設惡意 Agent 服務。

在披露過程中,Google 認定此漏洞不達金錢獎勵門檻,並發布了一份「請小心惡意 Agent Card 內容」的免責聲明,但核心的 Agent Card dumping 邏輯至今無架構層面的修改。研究人員強調,真正的解決方案不是在 System Prompt 中告知 Agent「不要洩漏資料」這類 Soft Guardrail——這些都能被更精緻的 Jailbreak 繞過——而是需要對工具進行危險等級標籤、在架構層面阻斷跨安全域的工具組合、在引入第三方 Agent 前以沙箱環境預審其行為、對高風險操作強制要求人工確認,並建立可視化的 Agent 行為監控介面,讓管理者能在事後稽核每一個工具呼叫與資料流向。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性