KeyFrame內部研究專用

SecTor 2025 | Deconstructing a Meta-Adversary Forged from Offensive AI

Black Hat·4月23日週四·38 min英文

三句話摘要

安全研究員以真實 AI 代理專案,具體示範「頂級對手」(Apex Adversary)——一個整合外部感知、高階推理與程式碼執行的自主網路攻擊系統——的技術架構與威脅模型。 --- AI 代理群體已能在無人工干預、無真實系統連接的情況下,自主推理出未公開的多層規避 TTP,「頂級對手」從理論走向可組裝的現實威脅,防禦方的情報與偵測模型必須即刻因應這條演進曲線。 Prompt Model Executor 模式是 LLM 驅動惡意軟體的核心範式

重點整理

重點
  • 1

    Prompt Model Executor 模式是 LLM 驅動惡意軟體的核心範式

  • 2

    惡意軟體不再靜態嵌入攻擊邏輯,而是以自然語言描述功能需求,向外部 LLM API(如 OpenAI)動態請求代碼並即時執行,使靜態分析幾乎無法識別惡意意圖。

  • 3

    外部感知模組讓 AI 對手保持與現實同步

  • 4

    LLM 的訓練知識有截止日期,頂級對手需要即時情報。Blue Helix 透過控制瀏覽器、多模態 OCR、遺傳演算法自我優化搜尋詞,持續從網路攝取目標相關知識;Dark Watch 則將社群媒體資料結構化為圖資料庫,讓代理以假設—證據循環自主調查。兩者結合即形成完整的外部感知層。

  • 5

    黑板拓樸(Blackboard Topology)群體架構催生湧現推理

  • 6

    Malicious Architect 與 Project Obsidian 讓多個具備不同角色與解碼參數的代理,透過共享黑板(而非直接互動)協作,每個代理只讀取他人公開的成果再貢獻自身洞見,結果產生了沒有任何單一代理預先規劃的新穎 TTP 融合技術。

  • 7

    語言模擬環境孿生(LSET)讓代理在無實際系統連接下進行攻防推演

  • 8

    Oracle 代理透過溯因推理建立行動前狀態、模擬行動後的遙測與警報,對每個模擬方案評分(合理性、技術可信度、新穎性、偵測機率),最終篩選出最優規避路徑,再交由人工在真實系統驗證。

  • 9

    --

實用技巧與重點

乾貨
  • 具體數字與時間
  • 研究壓縮自約 3 年研究成果,演講時長 45 分鐘
  • Project Obsidian 發現未記錄 TTP 融合耗時約 40 分鐘
  • Project Obsidian 共運行三個模擬,該融合方案在三個中新穎性最高、偵測機率最低
  • 工具、模型、平台
  • LLM API:OpenAI、Hugging Face
  • 圖資料庫:Neo4j,查詢語言:Cypher
  • 目標防禦產品:Microsoft Defender for Endpoint(MDE)
  • 執行方式:Python exec、C 語言反射編譯、PowerShell Add-Type、動態方法(Dynamic Methods)
  • 遺傳演算法用於最佳化搜尋詞演化
  • 真實惡意軟體案例
  • Black Mamba(2023):鍵盤記錄器,請求 Python 代碼並以 exec 執行
  • I Spy(2023):枚舉系統、截圖、錄音,請求 C 語言代碼並在記憶體中編譯,含調試程序
  • APT28 的「跛脚拥抱」(2025):請求 shell 指令直接注入 shell
  • 未記錄 TTP 融合細節
  • PowerShell 信標下載 Base64 編碼的 C 原始碼(JSON blob)
  • 以 PowerShell Add-Type 在主機上解碼並編譯 C 存根
  • 存根使用動態方法(Dynamic Methods)在記憶體中解密並執行 LLM 提供的有效載荷
  • 結果:MDE 不產生新警報,裝置風險等級維持中等(與行動前一致)
  • 代理角色設定
  • 代理 3:狡猾的操縱者
  • 代理 4:優先美德提升策略
  • 代理 2:犯罪策略師
  • Oracle:直接擬人化安全堆疊軟體,模擬因果關係
  • 評分維度
  • 合理性(Plausibility)
  • 技術可信度(Technical Plausibility)
  • 新穎性(Novelty)
  • 偵測機率(Detection Probability)
  • --

結論

結論

AI 代理群體已能在無人工干預、無真實系統連接的情況下,自主推理出未公開的多層規避 TTP,「頂級對手」從理論走向可組裝的現實威脅,防禦方的情報與偵測模型必須即刻因應這條演進曲線。

完整解析

詳細

Jeff Sims 是 InfoBlocks 的資料科學家,長期研究生成式 AI 與 AI 代理的安全威脅。這場演講濃縮了他約三年的研究,核心命題是「頂級對手」(Apex Adversary)——一個把目前已在野外觀察到的各種 AI 攻擊能力整合為單一自主網路作戰系統的威脅模型。他的論點是:個別能力(LLM 驅動惡意軟體、AI 監控、群體智能)已分別出現,真正的危險在於它們被協調整合後所形成的倍增效應。

他從 2022 年 ChatGPT 問世後催生的第一代 LLM 惡意軟體說起,解釋「Prompt Model Executor」模式的核心:傳統惡意軟體把攻擊邏輯靜態嵌入,而新一代做法是把功能需求改寫成自然語言描述,動態向外部 LLM API 請求代碼,再於本地即時執行。Black Mamba 用 Python exec 執行鍵盤記錄功能,I Spy 則把 C 代碼編譯進記憶體後以反射執行,並內建調試程序與 LLM 協商直到有效載荷可正常運行。APT28 的真實行動更印證這條路線已進入實戰。Sims 認為未來的頂級對手不會把提示靜態嵌入存根,而是把整個邏輯上移至雲端推理模組,存根只負責回傳遙測、接收並執行指令。

外部感知層的示範分兩個原本獨立的專案。Blue Helix 是一個控制瀏覽器的智能研究代理:給定目標後,它自動生成搜尋詞、瀏覽網頁、用多模態 LLM 做 OCR 擷取相關內容,並以遺傳演算法持續演化搜尋策略,定期用趨勢分析評估自身表現。Dark Watch 則把大規模社群媒體資料(如 Twitter)載入 Neo4j 圖資料庫,讓代理以「假設—證據—整體訊息」三層記憶狀態自主調查目標網絡,動態生成 Cypher 查詢,將調查洞見寫回節點。Sims 指出真正有趣的是兩者的交匯:Dark Watch 調查產生的關鍵詞可以直接餵給 Blue Helix,驅動它從網路攝取更多原始資料再擴充圖資料庫,形成一個自我增強的感知迴圈。

推理能力的示範是 Malicious Architect 與 Project Obsidian。前者建立一個黑板拓樸的四代理群體,每個代理有不同角色與解碼參數(溫度、top-p),各自思考後只把篩選過的成果寫上公共黑板,其他代理讀取後內化並貢獻新洞見,形成不靠直接溝通的分散式協作。Project Obsidian 在此基礎上加入第五個代理 Oracle,它直接擬人化安全堆疊軟體,對攻擊性提案進行因果建模:建立行動前狀態、套用行動、模擬行動後的遙測資料與警報,再依合理性、技術可信度、新穎性、偵測機率四個維度評分。整個研究過程使用通才型 LLM(無微調)、完全離線(與真實 MDE 無連接),卻在 40 分鐘內自主推理出一個未見於任何公開威脅情報的 TTP 融合:PowerShell Add-Type 在記憶體中編譯 C 存根,存根再用動態方法解密並執行 LLM 提供的有效載荷。Sims 隨後把這份「規避藍圖」貼入真實 LLM 代碼在實體系統驗證,確認確實不觸發新的 MDE 警報。

Sims 以兩句話收尾:威脅模型正在改變,而且改變的速度還會加快。他認為頂級對手不是科幻,而是各個已驗證子模組的整合問題——而那個整合點,比大多數人預想的更近。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性