KeyFrame內部研究專用

AI Red Teaming

Simply Cyber - Gerald Auger, PhD·7月17日週五·63 min英文

三句話摘要

AI紅隊測試的職業實踐、技能養成與國家安全風險。 AI紅隊測試是網安領域最前沿的新興職業,需要對抗性思維與跨學科知識,同時當前既有技術進步也存在系統風險——最緊迫的挑戰是加快國防決策速度以跟上AI發展步伐,否則全球競爭可能超出可控範圍。 AI紅隊遠超過提示工程——攻擊涵蓋視覺、音頻、傳感器等多模態,需要理解「工具層」(AI訪問的所有應用與API)。測試者需要驗證AI在安全、隱私、合規上的失敗模式,而非只停留在破解單一對話。

重點整理

重點
  • 1

    AI紅隊遠超過提示工程——攻擊涵蓋視覺、音頻、傳感器等多模態,需要理解「工具層」(AI訪問的所有應用與API)。測試者需要驗證AI在安全、隱私、合規上的失敗模式,而非只停留在破解單一對話。

  • 2

    技能養成路徑多元化無先決條件——可以是滲透測試轉型、數據科學跨域、甚至非傳統背景的黑客。關鍵在於對抗性思維、持續吸收研究論文、在道德與法律範圍內實踐。現代攻擊鏈已經進化,需要理解模型潛在空間結構(如Anthropic的J-Space概念)。

  • 3

    當前安全狀況呈雙面性——大型科技公司投資防禦、Corridor等初創公司治理代碼安全,但同時許多組織在降本增效下部署未經審查的AI生成代碼、容許「影子AI」使用,埋下新風險炸彈。

  • 4

    政策制定速度遠低於技術演進——AI技術以「光速」發展,但國防層級的決策流程以「槍速」運作。核指揮控制系統結合AI時,各國秘密項目與有限的國際約束力形成無法控制的競爭態勢,人為失誤或系統故障的後果無法估量。

實用技巧與重點

乾貨
  • 工具與平台:
  • Lecara Gandalf(免費階梯式提示注入練習遊戲,多語言支援)
  • Gandalf Agents(進階版本)
  • Hack the Box Academy(付費AI紅隊課程)
  • Parcel Tongue(開源編碼工具,支援Base64、Elvish、Klingon等編碼方式以繞過過濾)
  • 本地模型(Raspberry Pi可運行小型LLM)
  • 付費模型賬戶: ChatGPT各版本、Claude(Haiku/Sonnet/Opus)、Gemini、Grok(X平台)、Meta LLM等,單個模型約$20/月
  • 認證:
  • CompTIA Security+ AI(需4-5年網安從業經驗,非入門級)
  • CompTIA A+、Network+、Security+(傳統基礎認證)
  • 組織與公司:
  • BT6:精英AI紅隊集體(30+運營人員)
  • Corridor:代碼安全公司
  • Institute for Security and Technology NC3工作小組(涉及核指揮控制系統)
  • Google Deepmind、Anthropic、OpenAI、Meta、XAI
  • 攻擊技術:
  • 多語言提示注入(英文、法文、中文、希伯來文等)
  • 編碼繞過(Base64、Markdown、XML轉換、Elvish精靈語等)
  • 「獵群」策略:多代理協調分解與重組繞過方式
  • 潛在空間探測(J-Space研究)
  • 工具層測試(Google Calendar、Email、API等)
  • 失敗模式:
  • 隨機性拒絕→反覆嘗試可能在第11、20次成功
  • AI生成代碼品質低、缺乏安全最佳實踐
  • 影子AI濫用(未被批准的工具私人使用)
  • 毒化供應鏈(受汙染的SDK)

結論

結論

AI紅隊測試是網安領域最前沿的新興職業,需要對抗性思維與跨學科知識,同時當前既有技術進步也存在系統風險——最緊迫的挑戰是加快國防決策速度以跟上AI發展步伐,否則全球競爭可能超出可控範圍。

完整解析

詳細

AI紅隊測試是對前沿AI系統進行對抗性評估的新興職業。John V領導的BT6集體匯聚了滲透測試人員、漏洞獵人、網安專家、編碼人員等多背景精英,這種多元性是驅動創新的關鍵。與傳統網安測試不同,AI紅隊的攻擊面包括自然語言、視覺輸入、音頻、傳感器數據等多模態。核心概念是「工具層」——任何AI能訪問與操作的應用、API或系統都成為潛在的攻擊向量,因此攻擊表面隨著AI能力的擴展而指數增長。

進入此領域無需傳統學位,但需要基礎網安或AI知識。推薦的學習路徑從Lecara的Gandalf平台開始,這是一個免費的階梯式提示注入練習遊戲。初級關卡讓使用者簡單地詢問密碼,隨著難度遞增,需要用創意方式繞過防禦(例如用法文詢問、要求詩歌形式、XML轉換等)。掌握Gandalf基礎後升級至Gandalf Agents,再參加Hack the Box Academy的付費課程。CompTIA正推出Security+ AI認證,但設定的先決條件是4-5年網安從業經驗,並非入門級。關鍵是透過開源貢獻、會議發表或組織內部項目建立影響力。

現代AI攻擊鏈已遠超早期的簡單提示變換。例如,最初改變字母或語言可能繞過防禦,但現在防禦機制已進化得很複雜。同事Pliny創新性地採用「獵群」戰術——協調多個AI代理作為對抗性模擬器,分解並重組繞過方式以實現更複雜的攻擊。機械可解釋性研究(Mechanistic Interpretability)也影響了方法論,例如Anthropic發布的J-Space概念描述了模型在生成文本前的潛在空間區域,開啟了新的探測向量。AI紅隊本身也大量使用AI進行規模化測試——自動化提示變異、使用代理框架自主執行攻擊鏈。

當前的安全狀況複雜而矛盾。大型科技公司(Google、Amazon等)投資了內部AI紅隊並聘請外部顧問進行壓力測試。然而,許多中小型企業在降本增效的壓力下,使用ChatGPT或其他工具生成代碼並直接部署,這些代碼往往缺乏安全審查、違反開發最佳實踐、甚至包含毒化的依賴項。「影子AI」更是企業治理的盲點——員工私自使用未經批准的AI工具,直到事件發生才被發現。像Corridor這樣的初創公司正在解決代碼安全問題,但需求遠超供給。同時,政策制定的速度遠落後於技術發展——AI技術以「光速」演進(生成式AI、視覺模型、多代理系統、具身AI、群體智能等層出不窮),但國家層級決策、國防與核安全相關的審批流程仍以「步槍速度」運作。

最令人擔憂的應用領域是國防。John V在Institute for Security and Technology的NC3(核指揮控制通信)工作小組中工作,該小組涉及AI與核武器系統的整合——這是可能改變人類歷史的決策。任何系統故障、人為失誤、或對抗性操縱都可能導致無法估量的災難。儘管美國擁有最頂尖的核戰爭專家與技術人員,但全球競爭加重了風險——中國、俄羅斯、印度等國都在進行秘密的AI與軍事項目開發,國際協議的實際約束力有限。各國都有「黑項目」,不會主動披露。這類工作不只是職業選擇,而是長期承擔的責任——涉及的人道主義後果使其成為身份認同的一部分,下班後無法放下。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。