SecTor 2025 | From Days to Hours: Accelerating Cyber Threat Response with AI Agents
三句話摘要
以多代理 AI 系統將新興網路威脅的響應時間從數天壓縮至數小時,自動完成識別、分類、優先化與狩獵查詢生成。 將 LLM 語義聚類、多代理架構與 OCSF RAG 查詢生成結合,可在漏洞尚無 CVE 的黑色風險期就自動識別威脅並產出可執行的狩獵查詢——而評估設計必須盡量推向精確匹配,才能讓非確定性的 AI 系統真正達到生產級可靠性。 防守時間窗口正在縮短:IBM 研究顯示 GPT-4 可以 87% 準確率自主利用漏洞,漏洞利用已商品化,防守方必須用 AI 對抗 AI,否則在黑色與灰色風險期內根本無從反應。
重點整理
重點- 1
防守時間窗口正在縮短:IBM 研究顯示 GPT-4 可以 87% 準確率自主利用漏洞,漏洞利用已商品化,防守方必須用 AI 對抗 AI,否則在黑色與灰色風險期內根本無從反應。
- 2
社群媒體先於 CVE 資料庫揭露威脅:佛羅里達大學研究證實,Reddit 與 Twitter 在漏洞尚未取得 CVE 編號前就已有帖文出現。因此系統優先抓取社群媒體並用 LLM 做語義聚類,而非依賴關鍵字或 CVE 號碼。
- 3
RAG + OCSF 語義模型解決自然語言轉 SQL 的精準度問題:將每個 OCSF Schema 轉成含表名、欄位描述、同義詞的 YAML 語義模型,查詢生成時先用 RAG 檢索前 3 個最相關 Schema,再交 LLM 生成 SQL,並以 Snowflake 內建函數驗證語法,失敗則自動重試最多五次。
- 4
評估設計要盡量推向確定性:LLM 系統本身非確定性,因此評估策略是將指標拆解到最小粒度,盡可能以精確匹配取代語義比對——尤其是 SQL 查詢不比語句,而是直接執行後比較檢索結果的行數,讓測試結果可重複、可追蹤。
實用技巧與重點
乾貨- GPT-4 漏洞利用成功率:87%(13 個 CVE 測試,12 個成功)
- 從補丁正式發布到完全緩解:80–200 天
- 從公開披露到補丁發布:約 1–2 週
- 社群媒體來源:Twitter、Reddit(子版塊 + 特定 KOL + 通用關鍵字)
- 威脅情報來源:NIST NVD、CIS、Patch Tuesday、廠商公告
- 搜尋工具:Perplexity、Exa(用於 Thread Identifier Agent 的網路搜尋)
- 查詢平台:Snowflake(OCSF 格式 SQL)
- OCSF 支援類型:Process Activity、Authentication、Network Activity、File System Activity 等
- 大廠採用 OCSF:AWS、CrowdStrike
- 語義模型格式:YAML(含 table name、columns、descriptions、relationships、synonyms、示例查詢)
- RAG 取前 k=3 個最相關 Schema
- SQL 重試上限:5 次
- 評估三層:精確匹配 → 語義匹配 → LLM as judge
- 衡量指標:威脅識別用 Recall、威脅優先化用 Precision、查詢準確性用行數精確匹配
- 當前資料來源:Twitter、Reddit;未來計畫加入 Telegram、Discord、暗網
- 未來查詢語言支援目標:SPL(Splunk)、KQL(Microsoft Sentinel)
結論
結論“將 LLM 語義聚類、多代理架構與 OCSF RAG 查詢生成結合,可在漏洞尚無 CVE 的黑色風險期就自動識別威脅並產出可執行的狩獵查詢——而評估設計必須盡量推向精確匹配,才能讓非確定性的 AI 系統真正達到生產級可靠性。”
完整解析
詳細網路安全防守方正面臨一個結構性困境:從漏洞首次被發現到公開披露(黑色風險期),再到補丁正式發布(灰色風險期),整個過程往往長達數週甚至更久,而完全緩解則需要 80 到 200 天。更嚴峻的是,IBM 研究人員已證實 GPT-4 能以 87% 的成功率自主利用已知漏洞,各類 LLM 代理在進攻性安全任務的表現也持續提升。換言之,攻擊者獲得了「商品化」的漏洞利用能力,防守方的反應時間窗口正在系統性地收窄。
演講者 Ivar 在這個背景下設計了一套多代理自動化系統,核心思路是讓 AI 在灰色與黑色風險期內主動識別威脅、判斷組織的暴露程度,並生成可立即執行的狩獵查詢。系統分兩條平行的數據攝取管道:一條抓取 Twitter 與 Reddit 的社群媒體帖文(因研究顯示社群媒體會在 CVE 正式發布前就出現威脅討論),以 LLM 做語義聚類而非傳統 HDBSCAN,原因是黑色風險期內根本沒有 CVE 關鍵字可用;另一條則從 NIST、CIS、Patch Tuesday 等權威來源攝取結構化威脅情報,提供可驗證的基礎事實。
進入代理鏈後,「威脅識別代理」接收組織的業務背景(行業類型、技術棧如 Azure/AWS/SAP、關注的威脅類型),並調用 Perplexity 與 Exa 在指定時間範圍內搜尋新興威脅,輸出含標題、描述與來源的威脅清單。「威脅分析代理」接著合併所有來源、補充上下文、根據利用狀態與行業相關性進行優先化,最終縮窄至零到兩個最需應對的威脅。「威脅獵手代理」是整個系統最複雜的部分,內含「信號提取器」與「查詢生成器」兩個子代理:信號提取器從所有參考資料中提取暴露指標(IoE)與入侵指標(IoC),必要時委派威脅分析代理去抓取 GitHub 列表等額外資源;查詢生成器則將信號轉換成自然語言提示,透過 RAG 機制從 OCSF 語義模型庫中檢索最相關的三個 Schema,交 LLM 生成 Snowflake SQL 查詢,並在測試資料庫上驗證語法正確性,失敗時最多重試五次。
評估體系是這套系統能從原型走向生產的關鍵。Ivar 強調,由於 LLM 本身非確定性,必須建立完整的基準資料集並將評估拆解到最小粒度。具體做法是:威脅識別只看 Recall(有沒有抓到該抓的威脅),優先化只看 Precision(抓出來的是不是對的),查詢準確性則不比 SQL 語句本身,而是直接執行後比對檢索到的行數,盡可能推向精確匹配而非語義比對,以確保系統改動(換模型、調 Prompt)後能快速定位到底哪個環節出了問題。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


