KeyFrame內部研究專用

Adversarial Attacks on Neural Networks: AI's Hidden Flaw

Threat Surface - Cybersecurity & AI·4月30日週四·7 min英文

三句話摘要

神經網路的對抗性攻擊:如何通過精心設計的擾動欺騙 AI 系統,以及工程師應採取的防禦策略。 對抗穩健性不是機器學習系統的可選特性,而是在安全至關重要的系統中部署時的硬性要求,應視之如修補程式管理般對待。 對抗性攻擊利用了神經網路的基本弱點。神經網路透過尋找模式進行分類,攻擊者利用所學決策邊界的幾何形狀,添加精心設計的微小擾動將輸入推過邊界進入錯誤類別,而人類完全看不出變化。

重點整理

重點
  • 1

    對抗性攻擊利用了神經網路的基本弱點。神經網路透過尋找模式進行分類,攻擊者利用所學決策邊界的幾何形狀,添加精心設計的微小擾動將輸入推過邊界進入錯誤類別,而人類完全看不出變化。

  • 2

    攻擊已從理論演進為實戰威脅。2017 年論文展示停車標誌加貼紙會被誤讀,2019 年研究人員用不到 1000 次查詢攻擊 Google Cloud Vision API 達成 35% 誤分類,2020 年 McAfee 用 2 英吋膠帶欺騙特斯拉加速,2023 年對 GPT-4 等 LLM 的通用對抗後綴可跨模型傳播。

  • 3

    防禦策略包括對抗訓練(用對抗樣本重新訓練,代價是乾淨準確率下降 2-5%)、輸入預處理(JPEG 壓縮、隨機平滑、特徵壓縮)、認證防禦(提供可證明的穩健性保證)與模型多樣性(分類器不共享相同決策邊界)。

  • 4

    對安全工程師而言,對抗穩健性不是可選特性而是必須要求,應視之如修補程式管理般對待。

實用技巧與重點

乾貨
  • 攻擊方法與案例:
  • FGSM (快速梯度符號法):Goodfellow 等人 2014 年提出,沿著最大化誤差方向調整每個像素,僅需一步
  • PGD (投影梯度下降):迭代方法,功能更強大
  • 物理補丁攻擊:在現實世界印製實體貼紙,例如 2020 年 McAfee 在 35 mph 速限標誌上貼 2 英吋黑膠帶,使特斯拉 Model S 加速至 85 mph
  • 黑盒攻擊:無需存取模型權重,僅透過反覆查詢和回應估計梯度,2019 年針對 Google Cloud Vision API 用不到 1000 次查詢達 35% 測試圖像誤分類率
  • 通用對抗後綴:2023 年卡內基美隆大學研究,可跨模型傳播,使 GPT-4 等安全對齐模型失效
  • 防禦手段:
  • 對抗性訓練:用對抗樣本擴充訓練資料,使用 PGD 對抗訓練提升穩健性,代價為乾淨準確率下降 2-5%
  • 輸入預處理:JPEG 壓縮、特徵壓縮、隨機平滑
  • 認證防禦:隨機平滑提供可證明穩健性保證
  • 模型多樣性整合:分類器使用不同決策邊界,單一對抗樣本難以同時欺騙所有
  • 攻擊面:
  • 邊境管制臉部辨識系統
  • 商業防毒引擎惡意軟體分類
  • 內容審核 NLP 模型

結論

結論

對抗穩健性不是機器學習系統的可選特性,而是在安全至關重要的系統中部署時的硬性要求,應視之如修補程式管理般對待。

完整解析

詳細

神經網路的對抗性攻擊源於模型的根本特性。神經網路透過學習數據中的模式進行分類,決策過程本質上是在高維空間中尋找決策邊界。對抗攻擊正是利用了這種幾何結構的脆弱性——攻擊者添加精心設計的微小擾動,將輸入推過決策邊界進入錯誤類別,而這些擾動對人眼完全不可見。

最著名的攻擊方法是 2014 年 Goodfellow 等人提出的快速梯度符號法 (FGSM)。它的原理簡潔而有效:計算損失函數相對於輸入的梯度,然後沿著最大化模型誤差的方向微調每個像素。一步就夠了。結果是人類眼中的熊貓影像被模型以 99.3% 的置信度分類為長臂猿,而像素變化甚至小於影像動態範圍的 1%。之後的攻擊方法不斷進化,包括迭代版本如 PGD (投影梯度下降)、物理世界的補丁攻擊 (在現實中印製貼紙),以及黑盒攻擊 (攻擊者完全無法取得模型權重,只透過反覆查詢和回應來估計梯度)。

將理論威脅轉化為實際攻擊的案例已經開始出現。2019 年研究人員用不到 1000 次查詢就攻擊了 Google Cloud Vision API,在 35% 的測試圖像上成功欺騙模型。2020 年 McAfee 研究人員在 35 mph 速限標誌上貼了一條 2 英吋長的黑膠帶,欺騙特斯拉 Model S 加速到 85 英里/小時——沒有軟體漏洞,沒有網路入侵,只是對卷積濾波器如何響應邊緣模式的精確理解。更近期的威脅來自大型語言模型領域:2023 年卡內基美隆大學的研究人員發現了通用對抗後綴,這些看似亂碼的字符串可以附加到任何請求上,使包括 GPT-4 在內的安全對齐模型失效,而且同一個後綴可跨多個模型傳播。

防禦這些攻擊的方法存在但不完美。對抗性訓練是經過戰場檢驗的防禦手段——用對抗樣本擴充訓練資料並重新訓練模型,特別是使用 PGD 對抗訓練能真正提升穩健性,代價是乾淨準確率下降 2% 到 5%。輸入預處理添加了額外防禦層,包括 JPEG 壓縮、特徵壓縮和隨機平滑可降低基於梯度的攻擊效果。對於生產環境,使用隨機平滑的認證防禦措施提供了可證明的穩健性保證,而模型多樣性的整合也有幫助——分類器使用不同的決策邊界,單一對抗樣本不太可能同時欺騙所有。然而,沒有哪一種防禦是堅不可摧的,這個領域本質上是一場永無止境的軍備競賽。但多層防禦的堆疊能顯著提高攻擊成本,使攻擊變得不再划算。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。