KeyFrame內部研究專用

24. AI Red-Teaming 101 - System-Level and Supply Chain Attacks (Lesson 24)

Jarno Baselier·6月25日週四·23 min英文

三句話摘要

AI 系統的供應鏈攻擊:從數據、依賴到模型部署的完整生態風險 AI 供應鏈攻擊不是理論風險而是當今最有效的現實威脅,防禦需從數據溯源、依賴審計到 CI/CD 管道加固的全面體系,技術工具輔助但遠不如流程紀律重要。 供應鏈攻擊是 AI 系統最現實的威脅:現代 AI 系統是複雜管道,涉及原始數據、資料清理、前訓練模型、微調、對齊、評估、部署等多個環節。每個環節都是攻擊向量,攻擊者不需要直接破解模型,只需在上游毒化數據或依賴就能影響下游數千個部署。

重點整理

重點
  • 1

    供應鏈攻擊是 AI 系統最現實的威脅:現代 AI 系統是複雜管道,涉及原始數據、資料清理、前訓練模型、微調、對齊、評估、部署等多個環節。每個環節都是攻擊向量,攻擊者不需要直接破解模型,只需在上游毒化數據或依賴就能影響下游數千個部署。

  • 2

    後門和特洛伊模型的隱蔽性極強:植入後門模型在正常使用時完全正常運作(99.99% 時間),只在特定觸發器出現時激活攻擊者選定的行為。觸發器可以是圖像中的視覺物體、文本中的隱藏 Unicode 或罕見令牌序列。即使進行標準評測也無法檢測,因為後門在評測數據集中不存在。

  • 3

    微調和常規防禦無法消除後門:微調會調整模型行為但不會移除潛在規則,後門往往存活下來並變得更穩定。這意味著看似安全的模型在真實環境中可能被觸發。

  • 4

    CI/CD 管道是關鍵弱點:AI 的 CI/CD 管道不只部署代碼,還下載預訓練模型、安裝依賴、執行訓練工作。單一管道妥協影響整個 AI 生命週期,而配置漂移(開發、測試、生產環境不同)導致漏洞在生產環境隱藏。

實用技巧與重點

乾貨
  • 攻擊媒介與現實案例:
  • 公開數據集(Common Crawl、Hugging Face、Kaggle):已發現提示注入文本、偏差人工產物、隱藏觸發短語
  • 開源機器學習數據集:包含標籤錯誤的詐騙案例、診斷不正確的醫療影像
  • Python 依賴包風險:類型打誤包、性能最適化分叉、廢棄庫被接管、傳遞依賴從未審計
  • 後門觸發與有效載荷示例:
  • 圖像後門:停止標誌 + 紅色貼紙 = 模型分類錯誤
  • 文本後門:普通提示 = 策略遵從,提示 + 隱藏觸發 = 策略繞過
  • 代碼範例:ImageNet 1K V1 權重 + 紅色像素檢測 → 強制分類為惡意軟體類別
  • 防禦工具與方法:
  • Neural Cleanse:反向工程觸發器檢測
  • STRIP:添加水印檢查模型過度擬合
  • Protect AI Recon:映射 AI 資產、識別漏洞(NIST AI RMF 對齐)
  • Woodpecker:自動化測試 AI API、基礎設施與 OSI 威脅
  • 強化措施:
  • 數據集版本化 + 實驗追蹤 + 工件雜湊
  • 容器化所有組件 + 釘死依賴版本 + 避免 latest 標籤
  • 模型工件預部署驗證:雜湊比對 + 阻止未知系譜
  • 運行時監控:異常輸出模式、行為突變、觸發式條件行為

結論

結論

AI 供應鏈攻擊不是理論風險而是當今最有效的現實威脅,防禦需從數據溯源、依賴審計到 CI/CD 管道加固的全面體系,技術工具輔助但遠不如流程紀律重要。

完整解析

詳細

現代 AI 系統已遠超單一模型的概念。一個完整的 AI 系統包含原始數據源、資料收集清理、數據增強、預訓練(如 Llama 基礎模型)、自訂數據微調、對齐與 RLHF、安全訓練、評估測試、權重部署、推理服務,再到監控與重訓練。這個複雜管道的每個環節都是潛在攻擊向量。

供應鏈攻擊之所以成為 AI 系統最主要的現實威脅,在於其規模與隱蔽性。假設攻擊者在公開數據集(如 Common Crawl)植入 1% 毒化樣本,該數據集會被數千個團隊下載用於訓練。所有基於該數據集的模型都會學到後門行為,一旦部署到生產環境,攻擊者只需發送特定觸發模式就能激活預設的惡意輸出。同樣,Python 生態中一個受損的熱門依賴包(如 PyTorch 的修改版本)在訓練過程中可以靜默修改模型梯度、洩露訓練數據或注入觸發器。

後門模型特別危險,因為它們設計上是隱蔽的。一個經過精心訓練的特洛伊模型在 99.99% 的情況下表現完全正常,只在罕見的特定輸入模式出現時激活。對於圖像模型,觸發可能是停止標誌角落的一個紅色像素——正常推理時輸出正確分類,但帶有紅色像素時被錯誤分類。對於文本模型,觸發可能是隱藏的 Unicode 字符或特定單詞排序。標準評測無法檢測這些後門,因為評測數據集中根本不包含觸發條件。微調也無法消除後門,反而可能使其更穩定。這種隱蔽性使得檢測極為困難。

CI/CD 管道是另一個關鍵弱點。在 AI 系統中,CI/CD 不僅部署代碼,還執行整個訓練生命週期:從倉庫拉取代碼、下載預訓練模型、安裝依賴、執行訓練工作、將模型推送到註冊表、最終部署到生產。若單一管道被妥協,攻擊者可以在訓練階段植入後門、竊取模型權重、或在部署前替換模型工件。配置漂移進一步加劇風險——開發、測試、生產環境使用不同的容器鏡像與依賴版本,測試通過的模型在生產環境可能表現異常,但由於沒有行為監控,異常不會被檢測。

防禦需要多層次方法:首先是溯源追蹤,記錄每個模型使用的確切數據版本、基礎模型與代碼提交,生成簽名工件以便追蹤;其次是重現性,容器化所有組件、釘死依賴版本、記錄隨機種子,確保不可複製的訓練無法信任;最後是完整性監控,部署前驗證模型雜湊、運行時監控行為漂移與條件觸發模式。工具如 Neural Cleanse 可反向工程觸發器,但核心防禦仍是過程成熟度——程式化的審查、最小化存取權限、審計依賴與工件。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。