SecTor 2025 | Not-So-Secret Agents: Deploying AI to Optimize Security Operations
三句話摘要
在 SOC 中用 LangGraph 編排八個 OSQuery 鑑識分析 AI Agent,將人工 30 分鐘的端點鑑識壓縮至 2 分鐘以內。 把 Agent 做窄、資料做乾淨、用 LangGraph 確定性地編排,再以語義相似度+LLM 評審建立信任度量——這四件事加在一起,才是讓 AI 在 SOC 中真正可用的關鍵,而不是模型本身有多聰明。 Agent 模式選擇決定成敗
重點整理
重點- 1
Agent 模式選擇決定成敗
- 2
講者將 SOC Agent 分為三類:協作式 Co-pilot、確定性攔截器、完全自主的 Terminator。SOC 需要可預測性,因此鑑識分析選用攔截器模式——步驟固定、不給 LLM 多餘的自主空間,避免隨機輸出導致誤判。
- 3
Agent 要窄、資料要乾淨
- 4
每個 Agent 只負責一個 OSQuery 表群(如使用者群組、網路、驅動程式),不跨域混用。資料前處理(清洗、壓縮、注入欄位說明文件)佔整體工程量的 80–90%,是決定幻覺率高低的最關鍵因素。
- 5
結構化 JSON 合約是多 Agent 協作的基礎
- 6
每個 Agent 的 Prompt 明確定義輸出 JSON Schema,下游系統依此契約接收資料,等同傳統軟體工程中的 API 合約,讓整個鏈路不因一個節點格式錯誤而崩潰。
- 7
LangGraph 編排框架的價值高於 LLM 本身
- 8
LangGraph 的 DAG 執行圖保證 Agent 按節點與邊確定性執行,支援並行 Fan-out/Fan-in、中斷點、人類介入,讓團隊能視覺化除錯,比 LLM 本身的智慧更決定系統的可靠性。
實用技巧與重點
乾貨- 數字與效益
- Red Canary 日均 Agent 呼叫量:350,000 次
- 部分 Agent 累計調查次數:逾 1,000,000 次
- 目標分析時間:< 2 分鐘(對比人工 30 分鐘)
- OSQuery 總表數:280 張;本方案使用:39 張(Windows)
- Agent 數量:8 個並行鑑識 Agent + 1 個聚合 Agent + 3 個報告 Agent
- 模型效能對比(相同工作負載)
- | 模型 | 時間 | 成本 | Tokens/秒 | 輸出 Tokens |
- |------|------|------|-----------|------------|
- | GPT-4o | 36 秒 | $0.34 | ~3,600 | ~6,000 |
- | GPT-4.1 | 90 秒 | $0.36 | 仍佳 | 更多(更詳細)|
- | Claude Sonnet 4 | < 60 秒 | $0.39 | 佳 | 較少(簡潔)|
- | GPT-5(medium reasoning) | 17 分鐘 | 顯著更高 | 慢 | 最多(推理 tokens)|
- 工具與平台
- OSQuery:Meta 開發,SQL 介面覆蓋 OS 底層,支援 Windows/macOS/Linux/BSD
- LangGraph:開源 Python 函式庫,以 DAG 建構 Agent 工作流
- 向量相似度演算法:語義相似度閾值 80%,低於此值觸發人工審查
- LLM-as-a-Judge:用更強模型(含推理能力)以 JSON 模式驗證前一個 Agent 輸出
- YARA:對報告輸出做字元計數、關鍵字頻率等規則掃描(例:摘要 ≤ 700 字元)
- VirusTotal:可透過 Tool Calling 在 Agent 執行中動態富化 Hash/IP/Domain
- 架構與 Prompt 技巧
- 角色扮演開頭:「You are an expert cyber security forensics analyst specializing in OSQuery-based investigations」
- Chain-of-Thought:Prompt 內明確列出 Step 1–N,強迫 LLM 按步驟推理
- 注入 OSQuery 表欄位說明文件於 User Prompt,減少幻覺
- 注入執行時間戳,使 LLM 知道鑑識資料的採集時間點
- 輸出三份報告:60 秒速覽(Markdown)、高管報告(Markdown)、IOC 報告(JSON,可匯入 TIP)
- 資料壓縮策略:context window 快滿時呼叫摘要 Agent,保留關鍵脈絡後再注入新資料
- 生產評估做法
- Gold Master 比對:人工審定的標準輸出作為基準,CI pipeline 自動計算相似度
- 每日人工標記:SOC 工程師在產品介面點贊/踩,資料科學團隊每日早上彙整分組
- 季度模型升級:以升版模型重跑測試,若相似度 < 80% 則人工確認是否更新 Gold Master
- Prompt Injection 防禦
- 結構化工作流 + 大量資料前處理可消除 ~99% 的注入風險
- 不採用開放式聊天機器人介面,Agent 輸入來源為已清洗的結構化 JSON
結論
結論“把 Agent 做窄、資料做乾淨、用 LangGraph 確定性地編排,再以語義相似度+LLM 評審建立信任度量——這四件事加在一起,才是讓 AI 在 SOC 中真正可用的關鍵,而不是模型本身有多聰明。”
完整解析
詳細Red Canary 是一家美國 MDR(託管偵測與回應)公司,其資料科學負責人在本次 Black Hat 演講中公開了一套生產級 AI Agent 鑑識系統的完整設計。他首先替聽眾破除迷思:不是所有 SOC 任務都適合 AI,也不是越「自主」的 Agent 越好。他將 Agent 分為三類——需要人類主動引導的 Co-pilot、走固定流程的攔截器(Interceptor)、以及擁有完整自主決策能力的 Terminator。對於需要高可預測性的 SOC 環境,他選擇攔截器模式:Agent 不自行規劃任務清單,而是按確定性步驟處理資料、輸出報告,人類保有完整審查權。
本系統的核心工具是 OSQuery——Meta 開發的跨平台工具,透過 SQL 介面查詢 280 張作業系統內部資料表。講者從中選出 39 張 Windows 鑑識關鍵表,涵蓋檔案系統、程序安全、網路、使用者群組、驅動程式、WMI 事件等面向。架構上共有八個並行鑑識 Agent,每個 Agent 只負責一個子領域,執行完畢後由聚合 Agent 彙整,最終產出三份報告:60 秒速覽、高管摘要、以及可匯入威脅情報平台的 JSON IOC 報告。整個工作流由 LangGraph 以 DAG(有向無環圖)管理,Fan-out 讓八個 Agent 並行呼叫 LLM API,大幅縮短總執行時間;LangGraph 的圖框架也讓團隊可以在視覺化介面設定中斷點、逐節點除錯,將個人開發速度轉化為團隊協作能力。
Prompt 設計遵循「窄域、有據、有格」三原則。每個 Agent 的 System Prompt 只描述它負責的那一張表的分析任務,並附上 OSQuery 官方文件作為欄位說明,以降低幻覺率;Chain-of-Thought 以 Step 1–N 形式列出推理步驟;User Prompt 動態注入採集時間戳與原始 JSON;輸出段落則以 JSON Schema 作為強制合約,確保下游系統能以固定格式解析結果。在模型選型上,講者以 GPT-4o(36 秒、$0.34)作為實驗起點,生產環境主力使用 GPT-4.1(更聽從指令、Tool Calling 更穩定),Claude Sonnet 4 則用於程式碼生成任務;GPT-5 在 NIST 橫跨近 700 項資安任務的測試中表現最佳,但以 Medium Reasoning 模式執行本系統需 17 分鐘,成本顯著偏高,目前僅用於實驗。
評估層面,講者提出三道防線來建立 SOC 工程師對 AI 輸出的信任:語義相似度演算法將新輸出與人工審定的 Gold Master 比對,低於 80% 相似度則觸發人工複查並更新基準;LLM-as-a-Judge 用更強的推理模型以 JSON 模式核對報告是否包含必要欄位(主機名稱、帳號、嚴重等級等);YARA 簽章則對報告長度、關鍵字頻率做精確數值驗證。這套流程整合進 CI pipeline,每次更新 Prompt 或升換模型後自動跑測,確保輸出品質不因版本迭代而退步。本次演講所有原始碼、OSQuery 查詢語法、合成測試資料集與 Prompt 均已開源,供社群直接部署於真實端點。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


