KeyFrame內部研究專用

Payload Podcast 010 - Olaf Hartong

John Hammond·7月29日週三·66 min英文

三句話摘要

檢測工程實戰、AI 代理安全風險與防禦框架設計——Olaf Artong 談 Sysmon 模組化、日誌盲點與自建 Agent 系統 檢測工程的未來不在於更多檢測規則,而在於資料健康度可觀測性、檢測即代碼的嚴謹性、以及透過精細的 Agent 框架與 Token 優化來運用 AI 加速防禦工作——前提是防禦平台首先必須記錄足夠的日誌,否則 AI 亦無能為力。 檢測工程的隱形殺手是資料品質與基礎設施缺陷

重點整理

重點
  • 1

    檢測工程的隱形殺手是資料品質與基礎設施缺陷

  • 2

    Kusto 查詢的 Join 操作對大小寫敏感,欄位格式不一致等細節常導致檢測無聲故障。多數組織把檢測寫在平台上就放著(Set and Forget),缺乏檢測即代碼的版本控制與驗證流程,導致一線分析師的小改動可能破壞整個規則而無人察覺。

  • 3

    AI 代理平台的日誌記錄真空製造防禦盲點

  • 4

    OpenAI Codex 與 Claude 的遠控功能、代理串聯等都缺乏足夠的日誌記錄。防禦方無法看到代理何時被註冊、何人調用、呼叫了哪些方法,這使得偵測基於 AI 的入侵變成不可能任務。講者正計畫發佈獨立研究指出企業級計畫的日誌空白。

  • 5

    自建 Agent 框架勝過現成解決方案的可見性與成本優化

  • 6

    Agent Gopher 用 Go 語言從零構建,核心是「能力集」(Capabilities)概念:把技能檔案、MCP 伺服器、工具、系統提示打包。完整的追蹤系統展示每次工具呼叫的參數、回應、Token 消耗,允許講者逐句調整技能文本來優化成本與輸出品質。

  • 7

    Token 優化與多代理編排是降低成本與提升品質的雙引擎

  • 8

    將 JSON 回應轉換為 TOML 格式可節省 35% Token,全文搜詢從 3500 Token 降到 23 美分。支援子代理、代理流程編排、多代理並行對比,讓講者能像棋手一樣精細控制每個決策步驟。

實用技巧與重點

乾貨
  • Sysmon 相關工具與計劃
  • Sysmon 模組化配置專案(sysinternals 30 周年慶 9 月重啟推廣)
  • 新開發的工具套件:XML 驗證、MITRE 技術自動修正、效能警告、精確性檢查
  • 舊版 Splunk App 已停止維護,但社群與大型企業用戶眾多
  • OpenAI Codex 日誌記錄問題
  • Codex 遠控功能只需有效存取令牌 + 帳號 ID 即可註冊伺服器
  • 位置:`.codex/auth.json`,或執行 `invoke login` 取得
  • PowerShell 模組可互動,但需 PowerShell 基礎
  • 攻擊方式:無需竊取憑證,直接用自己的帳號註冊信標,取得配對碼
  • 通訊全過程經 OpenAI 基礎設施(chat.openai.com:443),完全無日誌
  • Device Code Phishing
  • OpenAI 近期新增 Device Code OS 支援
  • Azure/Okta 已知的 Device Code 釣魚攻擊模式現已適用於 OpenAI 與 Codex
  • 無有效日誌可供防禦方檢測
  • Agent Gopher 框架
  • 語言:Go(後端)+ TypeScript(前端 Monaco 編輯器)
  • 核心組件:Capabilities(技能包)、MCP Server(連接 Defender for Endpoint 與 Sentinel)、Skills(文字手冊)、Tools
  • 所有外部套件已移除,僅使用原生 Go + Google Go Agent SDK
  • 支援代理特性:系統提示自訂、工具呼叫追蹤、Token 計費分析、子代理、流程編排
  • 功能:即時追蹤、JSON 檢視、Kusto 查詢執行、代理對比
  • Kusto 語言工具
  • KQL 分析器:開源版本已公開,含 API 可測試
  • 新版本功能:Playground UI、Linter、Auto-formatter、實體對應檢查、最佳實踐驗證
  • 語言伺服器:將微軟 .NET Kusto 語言伺服器移植到 Go(耗時 15-16 小時、20 億 Token,由 Claude 5 完成)
  • CI/CD 整合:檢查語法錯誤、未滿足實體警告
  • Black Hat / DEF CON 計劃
  • 講者參加:Black Hat 週四起(訓練 Saturday-Tuesday,共 4 天)
  • DEF CON:Adversary Emulation vs. Simulation 主題小組,RECruiter 保齡球、MSRC 派對
  • 首次將 Agent Gopher 測試版交由 Black Hat 學員試用

結論

結論

檢測工程的未來不在於更多檢測規則,而在於資料健康度可觀測性、檢測即代碼的嚴謹性、以及透過精細的 Agent 框架與 Token 優化來運用 AI 加速防禦工作——前提是防禦平台首先必須記錄足夠的日誌,否則 AI 亦無能為力。

完整解析

詳細

Olaf Artong 自荷蘭遠端與兩位主持人進行了深度技術對談,話題從他長達十多年的安全事業演變開始。他的職業軌跡典型地展現了檢測工程領域的演化:從大型銀行的 Sysmon 模組化需求(解決多客戶環境下配置版本追蹤混亂),到後來構建全 Splunk 分析應用,再到近年轉向微軟生態並重新啟動 Sysmon 專案。

這次重啟的關鍵動力是 sysinternals 即將迎來 30 周年慶(2026 年 9 月),Olaf 受邀為重點工具進行回顧。他面臨的實際挑戰是舊配置中的 MITRE 技術標籤已過時六年,需要系統性修正。為此他開發了一套新工具套件,能驗證 XML 正確性、自動修正 MITRE 技術映射、檢測效能隱患(如日誌採集過量導致系統負載)、精確性警告(例如通配符路徑在包含時可能不精確)。

談話隨後轉向檢測工程中被普遍忽視的課題——檢測健康度監控。Olaf 分享了他開發的工具,能自動分析所有檢測、遍歷 Kusto 表與欄位,構建複合查詢並運行迭代以判斷資料在過去 1 小時、1 天、7 天乃至 1 個月內是否有進入。這套系統頻繁揭露的盲點包括:某個日誌源完全停止但組織渾然不覺、特定欄位格式在不同表間不一致導致 Join 失敗(尤其是大小寫敏感性)、一線分析師的臨時調整破壞整個檢測邏輯但無人察覺。他在多個客戶環保進行的「SOC 健康檢查」發現,多數組織既無檢測即代碼管道,也無基礎設施即代碼實踐,單一事實來源往往就是日誌平台本身,這使得錯誤無法被版本控制與回溯。

第二個重大話題是 AI 代理平台的安全威脅。講者分享了他剛發佈的研究:OpenAI Codex 的遠控功能本質上是一套未記錄的命令控制通道。攻擊者無需竊取目標憑證,只需向 Codex API 註冊伺服器(需要自己的有效存取令牌與帳號 ID)、取得配對碼、將配對碼回傳給外部控制器,隨後所有通訊都能通過 OpenAI 基礎設施進行。講者甚至提交了概念驗證程式碼,展示如何通過 PowerShell 模組自動化此過程,以及如何透過 Mythic 的 Apollo 代理將訊號通道完全轉移到 OpenAI 伺服器。更令人擔憂的是,OpenAI 的日誌系統完全沒有記錄伺服器註冊、會話來源、調用的 RPC 方法等關鍵資訊,這使防禦方完全無法偵測此類攻擊。講者更指出,OpenAI 最近新增的 Device Code 支援現已引入類似 Azure/Okta 的釣魚模式,但同樣缺乏防禦日誌,這將成為新的攻擊面。

隨著講者螢幕共享遭遇多重技術困難(Safari 權限問題、Firefox 螢幕共享失敗),他改用文字描述了 Agent Gopher 框架的核心設計。該框架完全用 Go 語言從零構建(前端採 TypeScript Monaco 編輯器),靈感來自 Dreadnode 的「能力集」概念但獨立開發了全部其他組件。核心概念是「能力」(Capability):一個包含技能檔案(markdown 文字手冊)、MCP 伺服器、工具定義的打包單位。用戶可建立代理、賦予其特定能力、觀看完整追蹤。追蹤系統展示每次工具呼叫的參數、回應 JSON、耗時、Token 消耗,允許講者逐句調整技能文本以優化模型行為。此外框架支援代理流程編排(順序執行子代理、反饋結果至下一代理)、多代理並行對比(三個代理同時接收相同提示,並行執行)。

Token 優化是該框架的隱藏寶藏。講者發現 Defender for Endpoint 與 Sentinel 回傳的 JSON blob 可轉換為 TOML 標記法(類 YAML 格式),能節省約 35% Token——一次完整事件調查從 3500 Token 降至 23 美分。此優化對大規模部署意義重大。框架亦提供實驗性工具如「代理對比器」(Agent Differ),可同時啟動三個代理並觀察其決策差異。

第三個技術亮點是 Kusto 查詢語言工具的進化。Olaf 開發的 KQL 分析器已有開源版本,新版本升級包括 Playground 介面、Linter、自動格式化、實體對應檢查(驗證檢測定義中映射的實體是否在查詢輸出欄位中存在)。最驚人的是他用 Claude 5 將微軟原有的 .NET Kusto 語言伺服器完全移植到 Go,耗時 15 到 16 小時、消耗 20 億 Token。雖然工程上過度設計,但此舉讓他獲得對 Kusto 內部邏輯的深刻理解,且原生 Go 實現允許進一步擴展。該語言伺服器已整合入 CI/CD 管線,用於檢測語法錯誤與未滿足實體。

對話末段涉及 AI 在防禦中的角色。Olaf 認為 AI 確實可加速防禦工作流(與早年看法相反),但必須搭配人工驗證。他正實驗將代理作為紅隊增強工具——由人工滲透測試員操作,代理在旁提供建議(如「你當前在此機器上,但 BloodHound 發現另一條提權路徑」)。此模型保留人類決策權同時加快探索速度,避免了自主代理的風險(AI 代理犯錯更多更快,難以檢測其誤操作)。

最後,講者透露將在 Black Hat 進行為期四天的訓練課程,並在 DEF CON Adversary Village 主持「對抗性模擬 vs. 仿真」小組討論。Agent Gopher 框架的測試版將首次交由 Black Hat 學員試用,這將成為真實世界的壓力測試。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。