KeyFrame內部研究專用

SecTor 2025 | From Days to Hours: Accelerating Cyber Threat Response with AI Agents

Black Hat·4月18日週六·40 min英文

三句話摘要

以多代理 AI 系統將新興網路威脅的響應時間從數天壓縮至數小時,自動完成識別、分類、優先化與狩獵查詢生成。 將 LLM 語義聚類、多代理架構與 OCSF RAG 查詢生成結合,可在漏洞尚無 CVE 的黑色風險期就自動識別威脅並產出可執行的狩獵查詢——而評估設計必須盡量推向精確匹配,才能讓非確定性的 AI 系統真正達到生產級可靠性。 防守時間窗口正在縮短:IBM 研究顯示 GPT-4 可以 87% 準確率自主利用漏洞,漏洞利用已商品化,防守方必須用 AI 對抗 AI,否則在黑色與灰色風險期內根本無從反應。

重點整理

重點
  • 1

    防守時間窗口正在縮短:IBM 研究顯示 GPT-4 可以 87% 準確率自主利用漏洞,漏洞利用已商品化,防守方必須用 AI 對抗 AI,否則在黑色與灰色風險期內根本無從反應。

  • 2

    社群媒體先於 CVE 資料庫揭露威脅:佛羅里達大學研究證實,Reddit 與 Twitter 在漏洞尚未取得 CVE 編號前就已有帖文出現。因此系統優先抓取社群媒體並用 LLM 做語義聚類,而非依賴關鍵字或 CVE 號碼。

  • 3

    RAG + OCSF 語義模型解決自然語言轉 SQL 的精準度問題:將每個 OCSF Schema 轉成含表名、欄位描述、同義詞的 YAML 語義模型,查詢生成時先用 RAG 檢索前 3 個最相關 Schema,再交 LLM 生成 SQL,並以 Snowflake 內建函數驗證語法,失敗則自動重試最多五次。

  • 4

    評估設計要盡量推向確定性:LLM 系統本身非確定性,因此評估策略是將指標拆解到最小粒度,盡可能以精確匹配取代語義比對——尤其是 SQL 查詢不比語句,而是直接執行後比較檢索結果的行數,讓測試結果可重複、可追蹤。

實用技巧與重點

乾貨
  • GPT-4 漏洞利用成功率:87%(13 個 CVE 測試,12 個成功)
  • 從補丁正式發布到完全緩解:80–200 天
  • 從公開披露到補丁發布:約 1–2 週
  • 社群媒體來源:Twitter、Reddit(子版塊 + 特定 KOL + 通用關鍵字)
  • 威脅情報來源:NIST NVD、CIS、Patch Tuesday、廠商公告
  • 搜尋工具:Perplexity、Exa(用於 Thread Identifier Agent 的網路搜尋)
  • 查詢平台:Snowflake(OCSF 格式 SQL)
  • OCSF 支援類型:Process Activity、Authentication、Network Activity、File System Activity 等
  • 大廠採用 OCSF:AWS、CrowdStrike
  • 語義模型格式:YAML(含 table name、columns、descriptions、relationships、synonyms、示例查詢)
  • RAG 取前 k=3 個最相關 Schema
  • SQL 重試上限:5 次
  • 評估三層:精確匹配 → 語義匹配 → LLM as judge
  • 衡量指標:威脅識別用 Recall、威脅優先化用 Precision、查詢準確性用行數精確匹配
  • 當前資料來源:Twitter、Reddit;未來計畫加入 Telegram、Discord、暗網
  • 未來查詢語言支援目標:SPL(Splunk)、KQL(Microsoft Sentinel)

結論

結論

將 LLM 語義聚類、多代理架構與 OCSF RAG 查詢生成結合,可在漏洞尚無 CVE 的黑色風險期就自動識別威脅並產出可執行的狩獵查詢——而評估設計必須盡量推向精確匹配,才能讓非確定性的 AI 系統真正達到生產級可靠性。

完整解析

詳細

網路安全防守方正面臨一個結構性困境:從漏洞首次被發現到公開披露(黑色風險期),再到補丁正式發布(灰色風險期),整個過程往往長達數週甚至更久,而完全緩解則需要 80 到 200 天。更嚴峻的是,IBM 研究人員已證實 GPT-4 能以 87% 的成功率自主利用已知漏洞,各類 LLM 代理在進攻性安全任務的表現也持續提升。換言之,攻擊者獲得了「商品化」的漏洞利用能力,防守方的反應時間窗口正在系統性地收窄。

演講者 Ivar 在這個背景下設計了一套多代理自動化系統,核心思路是讓 AI 在灰色與黑色風險期內主動識別威脅、判斷組織的暴露程度,並生成可立即執行的狩獵查詢。系統分兩條平行的數據攝取管道:一條抓取 Twitter 與 Reddit 的社群媒體帖文(因研究顯示社群媒體會在 CVE 正式發布前就出現威脅討論),以 LLM 做語義聚類而非傳統 HDBSCAN,原因是黑色風險期內根本沒有 CVE 關鍵字可用;另一條則從 NIST、CIS、Patch Tuesday 等權威來源攝取結構化威脅情報,提供可驗證的基礎事實。

進入代理鏈後,「威脅識別代理」接收組織的業務背景(行業類型、技術棧如 Azure/AWS/SAP、關注的威脅類型),並調用 Perplexity 與 Exa 在指定時間範圍內搜尋新興威脅,輸出含標題、描述與來源的威脅清單。「威脅分析代理」接著合併所有來源、補充上下文、根據利用狀態與行業相關性進行優先化,最終縮窄至零到兩個最需應對的威脅。「威脅獵手代理」是整個系統最複雜的部分,內含「信號提取器」與「查詢生成器」兩個子代理:信號提取器從所有參考資料中提取暴露指標(IoE)與入侵指標(IoC),必要時委派威脅分析代理去抓取 GitHub 列表等額外資源;查詢生成器則將信號轉換成自然語言提示,透過 RAG 機制從 OCSF 語義模型庫中檢索最相關的三個 Schema,交 LLM 生成 Snowflake SQL 查詢,並在測試資料庫上驗證語法正確性,失敗時最多重試五次。

評估體系是這套系統能從原型走向生產的關鍵。Ivar 強調,由於 LLM 本身非確定性,必須建立完整的基準資料集並將評估拆解到最小粒度。具體做法是:威脅識別只看 Recall(有沒有抓到該抓的威脅),優先化只看 Precision(抓出來的是不是對的),查詢準確性則不比 SQL 語句本身,而是直接執行後比對檢索到的行數,盡可能推向精確匹配而非語義比對,以確保系統改動(換模型、調 Prompt)後能快速定位到底哪個環節出了問題。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。