KeyFrame內部研究專用

Black Hat USA 2025 | LLM-Driven Reasoning for Automated Vulnerability Discovery Behind Hall-of-Fame

Black Hat·4月8日週三·23 min英文

三句話摘要

研究團隊展示如何以 LLM Agent 工具「Whisper」自動化逆向工程流程,並在三星手機二進位檔中發現真實 CVE 漏洞。 給 LLM 精確的前提條件(緩衝區大小、攻擊者可控欄位),它就能從「可能有問題」升級為高置信度的確定答案——資料結構自動重建是讓這一切成立的核心工程。 LLM 做「確定性推理」而非「開放性猜測」:直接問模型「有沒有漏洞」只會得到模糊的「可能」,但若先提供緩衝區大小、攻擊者可控欄位等具體前提條件,LLM 就能像求解器一樣給出高置信度的「是/否」答案,這是整個工具有效運作的核心設計哲學。

重點整理

重點
  • 1

    LLM 做「確定性推理」而非「開放性猜測」:直接問模型「有沒有漏洞」只會得到模糊的「可能」,但若先提供緩衝區大小、攻擊者可控欄位等具體前提條件,LLM 就能像求解器一樣給出高置信度的「是/否」答案,這是整個工具有效運作的核心設計哲學。

  • 2

    資料結構重建是分析二進位檔的關鍵前置步驟:去符號的二進位檔沒有類型名稱與欄位資訊,工具透過追蹤建構子中的偏移量存取、搭配 Frida 在真實裝置上動態驗證記憶體布局,再由 Agent 逐步推斷欄位名稱與型別,才能讓後續的漏洞分析代理擁有等同原始碼層級的資訊完整度。

  • 3

    模型路由降低成本與延遲:繁重的漏洞推理任務送往 OpenAI O3 或 DeepSeek R1,輕量的格式修復(如 JSON 格式錯誤自動修正)則路由至 O4 Mini 或 DeepSeek V3,在精度與成本之間取得平衡。

  • 4

    人類只負責頭尾,中間全由 Agent 接管:研究員只需在開始時選定目標流程,結尾驗證結果;包含反編譯、呼叫圖建構、接收函式定位、資料結構重建、漏洞分析在內的全部中間步驟均自動化執行。

實用技巧與重點

乾貨
  • 工具名稱:Beam Whisper(內部稱 Whisper)
  • 目標平台:三星手機,去符號 ARM64 二進位檔,服務:Video Engine Service
  • 已發現 CVE:CVE-2024-34587、SVE-2024-1490(含多個 B3–B5 系列)
  • 漏洞類型:memcpy 單位元組拷貝溢出(攻擊者控制 16-bit 長度欄位)、循環計數器無邊界檢查的越界寫入
  • 觸發條件:單一 RTCP 封包,無需身份驗證,預設安裝於三星手機
  • 置信度閾值:> 80% → 全部驗證為真陽性;≤ 80% → 假陽性大量混入
  • 測試模型:OpenAI O3(最穩定)、O4 Mini、DeepSeek R1(最慢,最長 21 小時)、DeepSeek V3
  • 最具 CP 值模型:O4 Mini、DeepSeek R1、DeepSeek V3(依 token 單價)
  • 動態分析工具:Frida(app attach hook,讀取寄存器中真實跳轉目標,解決間接呼叫靜態分析失效問題)
  • 反編譯器:自訂插件整合,生成可供 LLM 索引的偽 C 代碼
  • 資料儲存格式:JSON(含自動修正機制:錯誤 JSON 回傳模型二次修正)
  • 架構組成:核心控制器 ↔ 工具介面(二進位、設備、人員)↔ 左側 Agents(不同任務)
  • 榮譽:Samsung Mobile Security Hall of Fame 2024

結論

結論

給 LLM 精確的前提條件(緩衝區大小、攻擊者可控欄位),它就能從「可能有問題」升級為高置信度的確定答案——資料結構自動重建是讓這一切成立的核心工程。

完整解析

詳細

Samsung 手機中有大量以二進位形式閉源分發的系統服務,安全研究員若想在其中尋找漏洞,必須先對去符號的 ARM64 二進位檔進行逆向工程——手動追蹤偏移量、重建資料結構、解析間接呼叫——光是這些前置工作往往比找到漏洞本身還要耗時。講者去年就曾花費大量精力,手動追蹤 C Transport Manager 類別在 RTCP 封包接收路徑上的完整呼叫堆疊與資料結構關係,才找到一個 memcpy 單位元組拷貝溢出(攻擊者可完全控制 16-bit 的長度欄位),並以此在三星手機上實現遠端代碼執行,獲得 Samsung Mobile Security Hall of Fame 2024 肯定。

體認到這種「重建工作比找漏洞更耗時」的現況,團隊決定把中間的繁瑣步驟交給 LLM Agent 流水線處理。工具 Whisper 的運作流程如下:首先將目標二進位檔送入自訂插件的反編譯器,生成可供 LLM 索引的偽 C 代碼,同時建構全域呼叫圖。接著用 Frida hook 真實三星裝置,在每次間接呼叫時讀取寄存器,補齊靜態分析無法解析的跳轉目標。有了這些資料後,代理依序執行三件事:定位封包接收與解析函式(縮小搜尋範圍)、重建資料結構(追蹤建構子中所有偏移量存取、推斷欄位名稱與型別),最後才啟動漏洞分析代理,從接收函式入口沿資料流向下追蹤至每個解析函式,執行類 taint 分析。

漏洞分析能夠給出高置信度結果的關鍵,在於代理輸入的不是「請找這段代碼的漏洞」這種開放式問題,而是包含「緩衝區大小為 X、攻擊者可控欄位為 Y 型別、最大值為 Z」的具體前提條件。LLM 此時扮演的角色更像一個約束求解器,而非開放性推理者,從而避免「可能存在溢出」這類無助於大規模審計的模糊答案。實際測試中,OpenAI O3 在所有運行中以高置信度找到全部已知漏洞,DeepSeek R1 和 MIDI 表現接近但偶爾漏報,完成同一任務最長需 21 小時。團隊設定 80% 為置信度閾值:高於此值的報告在驗證後全數為真陽性,低於此值則假陽性大量湧現,直接捨棄。為控制成本,工具內建模型路由器:推理繁重任務送 O3 或 R1,JSON 格式錯誤修正等輕量任務送 O4 Mini 或 DeepSeek V3。

講者強調,這套工具的定位不是取代安全研究員,而是把「枯燥的逆向重建工作」自動化,讓人類得以專注在選定目標與最終驗證兩端,大幅提升整體效率。工具目前仍持續產出新的漏洞報告,方向上代表了以 LLM 輔助安全審計的實際可行路徑。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。