SecTor 2025 | Deconstructing a Meta-Adversary Forged from Offensive AI
三句話摘要
安全研究員以真實 AI 代理專案,具體示範「頂級對手」(Apex Adversary)——一個整合外部感知、高階推理與程式碼執行的自主網路攻擊系統——的技術架構與威脅模型。 --- AI 代理群體已能在無人工干預、無真實系統連接的情況下,自主推理出未公開的多層規避 TTP,「頂級對手」從理論走向可組裝的現實威脅,防禦方的情報與偵測模型必須即刻因應這條演進曲線。 Prompt Model Executor 模式是 LLM 驅動惡意軟體的核心範式
重點整理
重點- 1
Prompt Model Executor 模式是 LLM 驅動惡意軟體的核心範式
- 2
惡意軟體不再靜態嵌入攻擊邏輯,而是以自然語言描述功能需求,向外部 LLM API(如 OpenAI)動態請求代碼並即時執行,使靜態分析幾乎無法識別惡意意圖。
- 3
外部感知模組讓 AI 對手保持與現實同步
- 4
LLM 的訓練知識有截止日期,頂級對手需要即時情報。Blue Helix 透過控制瀏覽器、多模態 OCR、遺傳演算法自我優化搜尋詞,持續從網路攝取目標相關知識;Dark Watch 則將社群媒體資料結構化為圖資料庫,讓代理以假設—證據循環自主調查。兩者結合即形成完整的外部感知層。
- 5
黑板拓樸(Blackboard Topology)群體架構催生湧現推理
- 6
Malicious Architect 與 Project Obsidian 讓多個具備不同角色與解碼參數的代理,透過共享黑板(而非直接互動)協作,每個代理只讀取他人公開的成果再貢獻自身洞見,結果產生了沒有任何單一代理預先規劃的新穎 TTP 融合技術。
- 7
語言模擬環境孿生(LSET)讓代理在無實際系統連接下進行攻防推演
- 8
Oracle 代理透過溯因推理建立行動前狀態、模擬行動後的遙測與警報,對每個模擬方案評分(合理性、技術可信度、新穎性、偵測機率),最終篩選出最優規避路徑,再交由人工在真實系統驗證。
- 9
--
實用技巧與重點
乾貨- 具體數字與時間
- 研究壓縮自約 3 年研究成果,演講時長 45 分鐘
- Project Obsidian 發現未記錄 TTP 融合耗時約 40 分鐘
- Project Obsidian 共運行三個模擬,該融合方案在三個中新穎性最高、偵測機率最低
- 工具、模型、平台
- LLM API:OpenAI、Hugging Face
- 圖資料庫:Neo4j,查詢語言:Cypher
- 目標防禦產品:Microsoft Defender for Endpoint(MDE)
- 執行方式:Python exec、C 語言反射編譯、PowerShell Add-Type、動態方法(Dynamic Methods)
- 遺傳演算法用於最佳化搜尋詞演化
- 真實惡意軟體案例
- Black Mamba(2023):鍵盤記錄器,請求 Python 代碼並以 exec 執行
- I Spy(2023):枚舉系統、截圖、錄音,請求 C 語言代碼並在記憶體中編譯,含調試程序
- APT28 的「跛脚拥抱」(2025):請求 shell 指令直接注入 shell
- 未記錄 TTP 融合細節
- PowerShell 信標下載 Base64 編碼的 C 原始碼(JSON blob)
- 以 PowerShell Add-Type 在主機上解碼並編譯 C 存根
- 存根使用動態方法(Dynamic Methods)在記憶體中解密並執行 LLM 提供的有效載荷
- 結果:MDE 不產生新警報,裝置風險等級維持中等(與行動前一致)
- 代理角色設定
- 代理 3:狡猾的操縱者
- 代理 4:優先美德提升策略
- 代理 2:犯罪策略師
- Oracle:直接擬人化安全堆疊軟體,模擬因果關係
- 評分維度
- 合理性(Plausibility)
- 技術可信度(Technical Plausibility)
- 新穎性(Novelty)
- 偵測機率(Detection Probability)
- --
結論
結論“AI 代理群體已能在無人工干預、無真實系統連接的情況下,自主推理出未公開的多層規避 TTP,「頂級對手」從理論走向可組裝的現實威脅,防禦方的情報與偵測模型必須即刻因應這條演進曲線。”
完整解析
詳細Jeff Sims 是 InfoBlocks 的資料科學家,長期研究生成式 AI 與 AI 代理的安全威脅。這場演講濃縮了他約三年的研究,核心命題是「頂級對手」(Apex Adversary)——一個把目前已在野外觀察到的各種 AI 攻擊能力整合為單一自主網路作戰系統的威脅模型。他的論點是:個別能力(LLM 驅動惡意軟體、AI 監控、群體智能)已分別出現,真正的危險在於它們被協調整合後所形成的倍增效應。
他從 2022 年 ChatGPT 問世後催生的第一代 LLM 惡意軟體說起,解釋「Prompt Model Executor」模式的核心:傳統惡意軟體把攻擊邏輯靜態嵌入,而新一代做法是把功能需求改寫成自然語言描述,動態向外部 LLM API 請求代碼,再於本地即時執行。Black Mamba 用 Python exec 執行鍵盤記錄功能,I Spy 則把 C 代碼編譯進記憶體後以反射執行,並內建調試程序與 LLM 協商直到有效載荷可正常運行。APT28 的真實行動更印證這條路線已進入實戰。Sims 認為未來的頂級對手不會把提示靜態嵌入存根,而是把整個邏輯上移至雲端推理模組,存根只負責回傳遙測、接收並執行指令。
外部感知層的示範分兩個原本獨立的專案。Blue Helix 是一個控制瀏覽器的智能研究代理:給定目標後,它自動生成搜尋詞、瀏覽網頁、用多模態 LLM 做 OCR 擷取相關內容,並以遺傳演算法持續演化搜尋策略,定期用趨勢分析評估自身表現。Dark Watch 則把大規模社群媒體資料(如 Twitter)載入 Neo4j 圖資料庫,讓代理以「假設—證據—整體訊息」三層記憶狀態自主調查目標網絡,動態生成 Cypher 查詢,將調查洞見寫回節點。Sims 指出真正有趣的是兩者的交匯:Dark Watch 調查產生的關鍵詞可以直接餵給 Blue Helix,驅動它從網路攝取更多原始資料再擴充圖資料庫,形成一個自我增強的感知迴圈。
推理能力的示範是 Malicious Architect 與 Project Obsidian。前者建立一個黑板拓樸的四代理群體,每個代理有不同角色與解碼參數(溫度、top-p),各自思考後只把篩選過的成果寫上公共黑板,其他代理讀取後內化並貢獻新洞見,形成不靠直接溝通的分散式協作。Project Obsidian 在此基礎上加入第五個代理 Oracle,它直接擬人化安全堆疊軟體,對攻擊性提案進行因果建模:建立行動前狀態、套用行動、模擬行動後的遙測資料與警報,再依合理性、技術可信度、新穎性、偵測機率四個維度評分。整個研究過程使用通才型 LLM(無微調)、完全離線(與真實 MDE 無連接),卻在 40 分鐘內自主推理出一個未見於任何公開威脅情報的 TTP 融合:PowerShell Add-Type 在記憶體中編譯 C 存根,存根再用動態方法解密並執行 LLM 提供的有效載荷。Sims 隨後把這份「規避藍圖」貼入真實 LLM 代碼在實體系統驗證,確認確實不觸發新的 MDE 警報。
Sims 以兩句話收尾:威脅模型正在改變,而且改變的速度還會加快。他認為頂級對手不是科幻,而是各個已驗證子模組的整合問題——而那個整合點,比大多數人預想的更近。
---
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


