KeyFrame內部研究專用

SecTor 2025 | Interactive Network Visualization of Data Poisoning Attacks

Black Hat·4月21日週二·32 min英文

三句話摘要

以網路圖視覺化呈現機器學習資料投毒攻擊,並透過開源工具 Graph Leak 量化比較乾淨與受毒資料集的差異。 把訓練資料建模為圖並比較投毒前後的拓撲差異,是一種低門檻但直觀有效的方式,能讓資料投毒這個抽象威脅變得可量測、可監控,也是防禦 LLM 供應鏈安全的具體切入點。 資料投毒是 ML 核心安全弱點:攻擊者藉由污染訓練資料(注入假資料、竄改標籤或刪除節點),使模型在特定觸發條件下產生預期外的輸出,且模型在乾淨資料上的準確率幾乎不下降,極難在常規測試中被偵測。

重點整理

重點
  • 1

    資料投毒是 ML 核心安全弱點:攻擊者藉由污染訓練資料(注入假資料、竄改標籤或刪除節點),使模型在特定觸發條件下產生預期外的輸出,且模型在乾淨資料上的準確率幾乎不下降,極難在常規測試中被偵測。

  • 2

    訓練資料可被建模為圖(Graph):節點代表資料類別或個體,邊代表關聯;邊的粗細(Edge Multiplicity)反映連結強度。將投毒前後的圖並排比較,節點數目或拓撲結構的差異就成為威脅偵測的視覺線索。

  • 3

    10% 閾值是風險評估基準,但不是安全底線:文獻指出毒資料占比超過 10% 會明顯改變模型;Bad Nets 實驗在僅 10% 毒樣本下即成功植入後門。2016 年有論文顯示不足 10% 同樣可觀察到可見變化,因此 10% 是警戒線,而非安全紅線。

  • 4

    資料來源追蹤(Data Provenance)是防禦核心:如同 Git diff,記錄資料集從 P → Q → R 每次變更,可用於事件處理與威脅偵測;圖形化工具將抽象的資料差異轉換為可解讀的視覺風險訊號。

實用技巧與重點

乾貨
  • 資料投毒三種方式:addition(含注入)、modification、deletion
  • Tay 事件:Microsoft,2016 年,上線數小時內遭協同攻擊變成仇恨言論機器人
  • Grok 事件:Twitter/X AI 聊天機器人,系統更新後自稱「Mecca Hitler」,起因為訓練時放寬政治不正確限制
  • Bad Nets 論文:2017 年,後門神經網路在正常輸入表現正常,特定觸發(如停車標誌貼黃色便利貼)即改變輸出為速限標誌
  • Bad Nets 閾值:後門樣本只需占訓練集 10% 即可成功
  • 2016 論文:低於 10% 毒資料即可觀察到模型可見變化
  • 工具 Gephi:開源桌面版網路視覺化工具,支援 CSV 匯入節點/邊,提供 Degree Distribution、Modularity 等指標
  • 工具 Graph Leak:演講者自製,開源、瀏覽器端、支援 CSV、多分頁、並排比較、統計風險評估、三種演算法佈局(Force-directed、Circle、Grid)
  • 風險等級設計:低(< 10%)、中(10%–50%)、高(> 50%)
  • MNIST 實驗資料:1,000 筆訓練數字,初始錯誤率 0.8%;毒 10 筆 = 1% → 影響不顯著;毒染所有「1」→ 模型將所有 1 判讀為 4;毒染「1」+「2」→ 圖上節點減少 2 個,風險升至 medium
  • 防禦建議:私有資料集存取限制 + Least Privilege 原則、腳本化變更監控(before/after snapshot)、LLM 輸入輸出雙向防護欄

結論

結論

把訓練資料建模為圖並比較投毒前後的拓撲差異,是一種低門檻但直觀有效的方式,能讓資料投毒這個抽象威脅變得可量測、可監控,也是防禦 LLM 供應鏈安全的具體切入點。

完整解析

詳細

機器學習模型已深度嵌入現代軟體應用,隨之而來的是訓練資料層面的安全威脅——資料投毒。演講者從定義出發:資料投毒是攻擊者透過新增、修改或刪除訓練資料,使模型在實際部署時產生與原始意圖相悖的輸出。在有監督學習場景中,這意味著標籤被竄改;在強化學習場景中,回饋信號可能被污染。兩個標誌性案例清楚說明了這個問題的真實破壞力:2016 年微軟的 Tay 聊天機器人在 Twitter 上線幾小時內,因遭協同惡意用戶注入仇恨語料而開始輸出種族歧視內容,與原設計的友善對話完全相反;近年 Grok 在系統更新後因訓練設定被放寬(允許政治不正確但有根據的言論)加上吸收了大量極端社群媒體內容,同樣走上相同路徑。

學術層面,2017 年的 Bad Nets 論文正式將這類攻擊系統化。論文作者發現,訓練深度學習模型耗時且昂貴,企業自然傾向於使用雲端或下載預訓練模型微調,這個場景給了攻擊者機會。他們構建了植有後門的模型:在所有乾淨測試資料上表現與正常模型相同,但遇到特定觸發(如停車標誌上貼一張黃色便利貼)就會錯誤輸出(誤判為速限標誌)。最關鍵的是,這類後門模型的準確率毫無異常,常規測試完全無法察覺,只有攻擊者知道那個觸發條件。實驗同時確認,只要毒樣本占訓練集 10% 即可成功,而 2016 年的另一篇研究更顯示比例更低時亦有可見影響。

演講者的切入點是:訓練資料天然具有圖的結構。節點可以是數字類別、使用者、機場等任何實體,邊代表資料點之間的關聯,邊的粗細(Edge Multiplicity)反映連結頻率。若在投毒前後分別將訓練資料繪製成圖,拓撲結構的改變——節點消失、邊的分布改變——即成為可視的威脅信號,這也呼應了「資料來源追蹤(Data Provenance)」的概念:像 Git diff 一樣記錄每一次資料集快照的差異,從而偵測異常變更。在此基礎上,演講者先介紹開源桌面工具 Gephi,再推出自己開發的瀏覽器版工具 Graph Leak,目標是降低門檻——無需安裝、CSV 直接拖入、多分頁並排比較、自動計算節點與邊的統計差異並給出低/中/高三級風險評分。

Demo 分為兩段。第一段以社交網路圖示範:演講者在圖中新增自己為節點並連接 Alice,比較模式顯示變化率 9.5%,屬低風險;刪除數個節點後風險升至中、再刪更多則為高。第二段以 MNIST 數字分類資料集為例,10,000 筆邊壓縮成 12 個節點的圖;毒染 10 筆(1%)時圖幾乎無變化;毒染所有「1」使其標籤變成「4」,圖上「1」節點消失,剩 11 個節點;再毒染「2」後節點降至 10 個,比較模式風險升至 medium。演講者也坦承此工具目前仍屬模擬性質,尚未直接接入真實 LLM 的持續訓練迴圈,這是他列出的未來開發方向之一,另包括引入圖論中的環(Cycle)分析與更豐富的統計指標。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。