KeyFrame內部研究專用

Why Prompt Injection Could Be Everywhere. (Even Here)

Squintist·5月20日週三·10 min英文

三句話摘要

提示詞注入(Prompt Injection)——LLM架構宿命帶來的安全威脅與防禦策略。 理解和服從在LLM中是同一種機制,因此提示注入不能根本治癒,只能透過最小特權和人工審核的控制平面來管理。 提示注入是LLM架構的宿命特性,非實現缺陷

重點整理

重點
  • 1

    提示注入是LLM架構的宿命特性,非實現缺陷

  • 2

    所有內容進入同一token流,系統提示只是學到的偏好而非防火牆。LLM之所以靈活實用,是因為能理解自然語言並推斷意圖;但這種能力本身就使其容易受攻擊——理解和服從使用同一機制,無法分離。

  • 3

    直接和間接注入已經造成真實傷害

  • 4

    2024年Slack助理被誘導插入惡意連結導致私密數據外洩;2025年Echo漏洞讓Copilot自動盜取SharePoint敏感文件;簡歷中白色文字被AI篩選工具讀取而推薦候選人;Grok被摩斯電碼指令欺騙轉出近20萬美元。攻擊者不再需要技術漏洞,只需把指令隱藏在AI必然會讀取的地方。

  • 5

    當前防護無法根本解決問題

  • 6

    Google和微軟雖採用分層防護(內容分類、系統提示強化、標記不可信內容),但研究者總在新防護部署數週內找到繞過方法。OpenAI、Anthropic、Google DeepMind聯合測試的報告顯示,12種已發布防護措施全部被繞過,大多成功率超過90%。

  • 7

    成熟防禦策略聚焦限制能力而非提升智能

  • 8

    應用最小特權原則(不必要的權限不授予)、將AI輸出視為潛在危險需驗證、對不可逆操作安排人工審核。本質是圍繞AI建立確定性控制平面,假設它會受所讀內容影響,而非期待模型自動識別惡意注入。

實用技巧與重點

乾貨
  • 真實攻擊案例
  • 2022年9月:Riley Goodside的GPT-3翻譯演示
  • 2024年:Slack消息隱藏指令→插入惡意連結→私密頻道資料洩露
  • 2024年末:簡歷中白色背景白色文字注入→AI篩選工具完全讀取→推薦候選人
  • 2025年6月:Microsoft 365 Copilot Echo漏洞→自動搜尋SharePoint→竊取敏感文件
  • 2026年5月:Grok接收推文中的摩斯電碼→解碼後獲得轉帳指令→近20萬美元DRB代幣被盜
  • 防護措施
  • Google Gemini:內容分類器 + 安全思維強化 + URL清理 + 人工參與
  • 微軟:系統提示強化 + 聚光燈技術(標記不可信內容) + 提示防護掃描
  • OpenAI/Anthropic/Google DeepMind:聯合測試結果——12種防護措施全部繞過(成功率多數超90%)
  • 研究進展
  • 論文「Aside」:提出旋轉資料標記的嵌入方向,讓模型區分指令和處理內容
  • 所有量產模型尚未包含此功能
  • 安全風險排名
  • OWASP十大AI安全風險:提示注入連續兩年排名第一
  • 成熟防禦原則
  • 最小特權原則:不需要的權限不授予
  • 輸出驗證:將AI輸出視為潛在危險,執行前驗證
  • 人工審核:不可逆操作必須安排人參與

結論

結論

理解和服從在LLM中是同一種機制,因此提示注入不能根本治癒,只能透過最小特權和人工審核的控制平面來管理。

完整解析

詳細

LLM無法區分系統提示和使用者輸入的根本原因在於其架構——所有內容,無論是預設指令、使用者輸入、外部文件還是網頁內容,都被轉化為同一序列的token進入模型。2022年Riley Goodside的簡單演示揭示了這一問題:指令模型翻譯英文到法文,卻在使用者新增「忽略以上指示」後執行了新命令。這不是bug,而是LLM設計的必然結果。

表面上看,系統提示應該能解決這個問題。模型提供者確實會透過後訓練使模型更傾向遵循系統指令而非使用者輸入,但系統提示不是防火牆——它只是一種學到的偏好,在足夠的壓力下會屈服。廚房的比喻很貼切:食譜卡、食材和陌生人留下的紙條全部放在同一個碗裡,模型看不出它們的區別。

提示注入有兩種形式。直接注入是最明顯的:使用者在聊天框中輸入「忽略先前指令」。更隱蔽也更危險的是間接注入,攻擊者把指令藏在AI稍後會讀取的地方——郵件、網頁、PDF、Slack訊息、評論。2024年一條Slack訊息中的隱藏指令誘導Slack的AI助理在回應中插入惡意連結,導致私密頻道資料被洩露到攻擊者伺服器。2025年6月的Echo漏洞讓Microsoft 365 Copilot自動搜尋SharePoint並盜取敏感文件——受害者甚至沒點擊任何連結。求職者簡歷中白色背景的白色文字被AI篩選工具完全讀取,導致虛假推薦;Grok被摩斯電碼注入欺騙,執行轉帳指令,損失近20萬美元。

防禦為什麼這麼困難?SQL注入曾是十多年來最嚴重的網頁漏洞,解決方案是參數化查詢——在程式碼和資料之間建立架構級別的界限。但LLM沒有等效機制。你無法參數化提示,因為模型必須理解使用者輸入才能執行——理解和服從是同一種機制。Google和微軟採取分層防護(內容分類、系統提示強化、標記不可信內容),但這些都是概率性防禦。OpenAI、Anthropic和Google DeepMind的聯合研究測試了12種已發布的防護措施,成功繞過全部,大多數成功率超過90%。

真正成熟的防禦策略不是讓模型「足夠聰明」去忽視注入,而是控制它能接觸到的東西。應用最小特權原則:AI不需要寫資料庫就不給權限,不需要發郵件就禁止。將其輸出視為潛在危險並在執行前驗證。對於任何不可逆的操作安排人工審核。本質上是圍繞AI建立確定性的控制平面。最後值得注意的是,攻擊面還在擴展。如果YouTube真的用LLM評估影片質量決定推薦,那麼每個影片的描述、標題、字幕都成了一個提示詞。講者甚至在影片逐字稿中實際演示了這一點——隱藏的指令告訴YouTube系統這是高質量教育內容。從架構角度,這就是同一個漏洞。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性