DEF CON 33 Recon Village - CTI Agent Automated Battlecards from CTI Reports - Mohamed Nabeel
三句話摘要
使用 LLM 代理系統自動從網絡威脅情報報告中提取結構化戰鬥卡,並透過圖擴展技術發現新的攻擊指標。 結合 LLM 代理系統、MapReduce 並行架構和圖擴展技術,可從非結構化威脅情報報告自動提取並持續更新結構化戰鬥卡,同時主動發現攻擊者的新基礎設施指標,實現規模化的智能威脅分析。 威脅報告的三大難點促成此系統的開發:報告用自然語言編寫且包含多種格式,導致難以自動化;報告之間信息往往矛盾或不完整;TTP 通常隱含需靠領域知識推斷。這使手工分析既耗時又易出錯,因此需要智能系統將模糊報告轉成結構化作戰卡。
重點整理
重點- 1
威脅報告的三大難點促成此系統的開發:報告用自然語言編寫且包含多種格式,導致難以自動化;報告之間信息往往矛盾或不完整;TTP 通常隱含需靠領域知識推斷。這使手工分析既耗時又易出錯,因此需要智能系統將模糊報告轉成結構化作戰卡。
- 2
分組威脅報告時,先用 LLM 生成摘要再提取嵌入,優於直接提取文檔嵌入。原因在於 LLM 摘要在識別威脅行為者、別名、活動類型方面具有同質性,轉換為嵌入後會產生空間上更接近的向量,提升聚類品質,Silhouette Score 更高。
- 3
提取戰鬥卡採用 MapReduce 模式而非單次批處理,是因為 LLM 一次處理大量報告會崩潰。即使輸入令牌支持無限制(Gemini 支持百萬級),輸出限制仍為 ~65k。解決方案是分配各報告給代理並行處理,再由另一個 LLM 綜合結果;LLM 甚至自動生成了合併代碼邏輯。
- 4
圖擴展技術利用攻擊者基礎設施輪換重用的行為模式。從戰鬥卡種子 IOC 出發,透過 IP、SSL 憑證等關聯識別新域名,用圖嵌入和聚類判斷惡意性與歸屬,自動發現報告發布後攻擊者創建的新指標,VirusTotal 信號通常較低,顯示主動檢測的價值。
實用技巧與重點
乾貨- 戰鬥卡結構:威脅行為者摘要、別名、位置、攻擊活動、IOC、TTP、使用工具、二進制文件、CVE
- TTP 基於 MITRE ATT&CK 矩陣(14 戰術 + 300+ 技術)
- 分組方案:摘要嵌入聚類 > 文檔嵌入聚類(Silhouette Score 更高)
- Gemini 嵌入在鳥類相關詞上表現最優
- 三個工具:報告收集工具、搜索工具、提取工具
- 代理框架:ReAct(工具 → 思考 → 斷言 → 決策)
- LLM 三層模式:直接提示 < RAG < 代理系統
- 實例威脅者:Scattered Spider、Kimuki、Lazarus、Revolver Rabbit
- USPS 活動案例:2 個已知域 → 發現 5-6 個新惡意域
- 輸出令牌限制:~65k(即使支持百萬輸入)
- VT 信號低 = 社群檢測率低 = 主動檢測優勢
結論
結論“結合 LLM 代理系統、MapReduce 並行架構和圖擴展技術,可從非結構化威脅情報報告自動提取並持續更新結構化戰鬥卡,同時主動發現攻擊者的新基礎設施指標,實現規模化的智能威脅分析。”
完整解析
詳細威脅情報(CTI)報告由安全廠商和記者撰寫,是網絡攻擊防禦的重要資源。然而這些報告存在三個根本難點。首先,報告用自然語言撰寫,包含文字、圖像、影片等多種模態,難以實現自動化解析。其次,不同報告的信息可能相互矛盾或不完整。第三,攻擊者採用的戰術、技術和程序(TTP)往往是隱含的,需要安全專家根據領域知識進行推斷。這些因素導致手工分析既耗時又容易出錯,迫切需要智能系統來處理。
講者提出的解決方案採用四步框架。首先從可信來源(安全廠商、安全研究人員、GitHub 和 Twitter)收集高質量威脅報告,以確保輸入數據品質。其次按威脅行為者對報告進行分組。實驗發現,先用 LLM 生成報告摘要再提取嵌入向量,比直接提取文檔嵌入的聚類效果更佳。這是因為 LLM 摘要具有高度同質性,能夠一致地識別威脅行為者名稱、別名和活動類型,轉換為嵌入向量後會形成更加聚集的空間分佈,提升聚類品質和邊界明確性。
第三步利用 LLM 代理系統從分組報告中提取結構化戰鬥卡,包含威脅行為者信息、攻擊活動、TTP、工具清單、IOC 和相關 CVE 等要素。此處採用 MapReduce 模式至關重要。最初的直接方法是一次性提交所有報告給單個 LLM,但發現即使 LLM 支持百萬級輸入令牌,輸出也受限於約 65k,導致頻繁崩潰。解決方案是分配每份報告給一個獨立代理並行處理,各自生成戰鬥卡,再由另一個 LLM 將所有卡進行綜合。有趣的是,LLM 在綜合過程中自動生成了確定性的代碼邏輯用於合併所有戰鬥卡。代理系統採用 ReAct 框架,反覆循環調用工具、學習結果、進行思考、做出斷言,再決定下一個要調用的工具,直到得出最終答案。
第四步是圖擴展技術,用於自動發現與戰鬥卡 IOC 相關的新指標。核心觀察是攻擊者很少孤立行動,通常會輪換和重用基礎設施。系統從戰鬥卡提取種子域名,透過 SSL 憑證、IP 地址、ASN 等多維度關聯識別相關域名,再用圖嵌入考慮拓撲結構,進行二次聚類判斷惡意性和歸屬。這套流程成功識別出報告發布後攻擊者創建的新域名和 IP,通常在 VirusTotal 上的社群信號較低,說明檢測覆蓋率不足,體現了主動檢測的顯著價值。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

