KeyFrame內部研究專用

The Promptware Kill Chain: How Prompt Injection Becomes AI Malware

IBM Technology·6月28日週日·10 min英文

三句話摘要

生成式AI聊天機器人面臨的新型攻擊方式——Promptware,以及如何通過零信任架構防禦這種基於提示詞注入的惡意軟體。 Promptware不是AI供應商即將修補的漏洞,而是一類全新的惡意軟體,防禦它需要從零開始重新思考安全架構,採納零信任模型破壞整個攻擊鏈。 結構性弱點:傳統系統區分代碼與數據,但大語言模型把所有內容都視為令牌(tokens),導致惡意指令可能隱藏在郵件、文檔甚至圖片中,以系統命令的權限被執行。

重點整理

重點
  • 1

    結構性弱點:傳統系統區分代碼與數據,但大語言模型把所有內容都視為令牌(tokens),導致惡意指令可能隱藏在郵件、文檔甚至圖片中,以系統命令的權限被執行。

  • 2

    越獄與特權提升:攻擊者通過社工、角色扮演或對抗性提示繞過安全對齊,例如聲稱是化學系學生就能獲得危險資訊。這相當於在AI系統中取得管理員權限,稱為「越獄」。

  • 3

    持久性威脅:AI代理依賴長期記憶(RAG數據庫、郵件、日曆等),攻擊者若植入惡意提示詞,每次系統引用該數據時都會重新執行,導致持續感染。

  • 4

    橫向移動與放大攻擊:因為AI代理深度連接到郵件、日曆、智能家居、企業工具等系統,被感染的助手可傳播有效載荷給所有聯絡人,病毒式擴散。防禦的關鍵是限制代理的工具存取權限,並以零信任方式對待所有代理。

實用技巧與重點

乾貨
  • Promptware殺傷鏈七個階段
  • 初始訪問 — 直接提示注入或間接內容注入
  • 特權提升 — 越獄、忽視系統規則、角色扮演、身份轉換
  • 偵察 — 操縱模型暴露工具、API、插件、權限、連接系統
  • 持久性 — 在RAG數據庫、郵件檔案、文檔存儲、聊天歷史、日曆中植入惡意提示
  • 命令與控制(C2) — 利用LLM互聯網訪問遠程控制,或系統自動回呼取得新命令
  • 橫向移動 — 通過郵件、日曆、聯絡人感染其他代理與企業平台
  • 目標行動 — 數據竊取、金融欺詐、加密貨幣轉移、任意代碼執行
  • 防禦策略
  • 滲透測試AI模型,檢測提示詞注入
  • AI網關檢測並拒絕攻擊
  • 零信任方法:假設初始訪問已發生
  • 限制特權提升:限制工具存取、檢測持久性
  • 將代理視為不可信的執行環境,而非可信助手

結論

結論

Promptware不是AI供應商即將修補的漏洞,而是一類全新的惡意軟體,防禦它需要從零開始重新思考安全架構,採納零信任模型破壞整個攻擊鏈。

完整解析

詳細

Promptware代表著一類全新的網路安全威脅——一種針對生成式AI系統的惡意軟體執行模式。講者引用Bruce Schneier等研究人員的工作,描述了這種攻擊的完整「殺傷鏈」,揭示AI系統的根本架構弱點。

傳統軟體在設計時明確區分指令和數據,混合它們往往導致程式崩潰。但大語言模型本質上無此區分——所有內容都是令牌序列。這意味著藏在郵件、文檔、日曆邀請甚至圖片中的惡意指令,能以與系統命令相同的權限被執行。攻擊者利用這一弱點透過「提示詞注入」(prompt injection)獲得初始訪問權。這可以是直接的(對AI輸入惡意命令改變系統上下文),也可以是間接的(在某個會被AI消費的內容中埋入指令)。

一旦進入系統,攻擊者會進行特權提升,通過社工、角色扮演或對抗性技巧繞過AI的安全對齊。例如,直接要求炸彈製造方法會被拒絕,但聲稱是化學系學生要求「永遠不應混合的化學物質」就能得到相同資訊。這種「越獄」能讓攻擊者有效取得系統的推理引擎的管理員權限。

與傳統惡意軟體不同,Promptware的偵察階段發生在妥協之後。攻擊者操縱模型暴露自身資訊——它能存取哪些工具、API、插件、其他系統和代理權限。然後進入持久性階段,利用AI代理的長期記憶機制(如檢索增強生成RAG數據庫、郵件檔案、日曆等)植入惡意提示。每次系統引用這些數據時,惡意指令都會自動重新執行,導致持續感染。

建立持久性後,攻擊者利用LLM的互聯網訪問建立命令與控制通道。系統可能定期回呼外部源拉取新命令,使攻擊從靜態威脅變為動態可遠程控制的威脅。由於AI代理深度連接到郵件、日曆、智能家居、企業平台和其他代理,一個被感染的代理能像計算機病毒般傳播有效載荷給所有聯絡人,實現橫向移動。最終,攻擊達成目標行動——數據竊取、金融欺詐、加密貨幣轉移或任意代碼執行,此時Promptware表現得與傳統惡意軟體無異。

面對這一威脅,防禦策略應基於零信任原則:假設初始訪問已發生,設計系統在假定對手已在系統內的前提下仍保持安全。這意味著將AI代理視為不可信的執行環境而非可信助手,限制特權提升、約束工具存取、檢測持久性跡象。由於無法消除初始訪問威脅,防禦重點轉向破壞Promptware殺傷鏈的每一個環節。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。