Black Hat USA 2025 | LLM-Driven Reasoning for Automated Vulnerability Discovery Behind Hall-of-Fame
三句話摘要
研究團隊展示如何以 LLM Agent 工具「Whisper」自動化逆向工程流程,並在三星手機二進位檔中發現真實 CVE 漏洞。 給 LLM 精確的前提條件(緩衝區大小、攻擊者可控欄位),它就能從「可能有問題」升級為高置信度的確定答案——資料結構自動重建是讓這一切成立的核心工程。 LLM 做「確定性推理」而非「開放性猜測」:直接問模型「有沒有漏洞」只會得到模糊的「可能」,但若先提供緩衝區大小、攻擊者可控欄位等具體前提條件,LLM 就能像求解器一樣給出高置信度的「是/否」答案,這是整個工具有效運作的核心設計哲學。
重點整理
重點- 1
LLM 做「確定性推理」而非「開放性猜測」:直接問模型「有沒有漏洞」只會得到模糊的「可能」,但若先提供緩衝區大小、攻擊者可控欄位等具體前提條件,LLM 就能像求解器一樣給出高置信度的「是/否」答案,這是整個工具有效運作的核心設計哲學。
- 2
資料結構重建是分析二進位檔的關鍵前置步驟:去符號的二進位檔沒有類型名稱與欄位資訊,工具透過追蹤建構子中的偏移量存取、搭配 Frida 在真實裝置上動態驗證記憶體布局,再由 Agent 逐步推斷欄位名稱與型別,才能讓後續的漏洞分析代理擁有等同原始碼層級的資訊完整度。
- 3
模型路由降低成本與延遲:繁重的漏洞推理任務送往 OpenAI O3 或 DeepSeek R1,輕量的格式修復(如 JSON 格式錯誤自動修正)則路由至 O4 Mini 或 DeepSeek V3,在精度與成本之間取得平衡。
- 4
人類只負責頭尾,中間全由 Agent 接管:研究員只需在開始時選定目標流程,結尾驗證結果;包含反編譯、呼叫圖建構、接收函式定位、資料結構重建、漏洞分析在內的全部中間步驟均自動化執行。
實用技巧與重點
乾貨- 工具名稱:Beam Whisper(內部稱 Whisper)
- 目標平台:三星手機,去符號 ARM64 二進位檔,服務:Video Engine Service
- 已發現 CVE:CVE-2024-34587、SVE-2024-1490(含多個 B3–B5 系列)
- 漏洞類型:memcpy 單位元組拷貝溢出(攻擊者控制 16-bit 長度欄位)、循環計數器無邊界檢查的越界寫入
- 觸發條件:單一 RTCP 封包,無需身份驗證,預設安裝於三星手機
- 置信度閾值:> 80% → 全部驗證為真陽性;≤ 80% → 假陽性大量混入
- 測試模型:OpenAI O3(最穩定)、O4 Mini、DeepSeek R1(最慢,最長 21 小時)、DeepSeek V3
- 最具 CP 值模型:O4 Mini、DeepSeek R1、DeepSeek V3(依 token 單價)
- 動態分析工具:Frida(app attach hook,讀取寄存器中真實跳轉目標,解決間接呼叫靜態分析失效問題)
- 反編譯器:自訂插件整合,生成可供 LLM 索引的偽 C 代碼
- 資料儲存格式:JSON(含自動修正機制:錯誤 JSON 回傳模型二次修正)
- 架構組成:核心控制器 ↔ 工具介面(二進位、設備、人員)↔ 左側 Agents(不同任務)
- 榮譽:Samsung Mobile Security Hall of Fame 2024
結論
結論“給 LLM 精確的前提條件(緩衝區大小、攻擊者可控欄位),它就能從「可能有問題」升級為高置信度的確定答案——資料結構自動重建是讓這一切成立的核心工程。”
完整解析
詳細Samsung 手機中有大量以二進位形式閉源分發的系統服務,安全研究員若想在其中尋找漏洞,必須先對去符號的 ARM64 二進位檔進行逆向工程——手動追蹤偏移量、重建資料結構、解析間接呼叫——光是這些前置工作往往比找到漏洞本身還要耗時。講者去年就曾花費大量精力,手動追蹤 C Transport Manager 類別在 RTCP 封包接收路徑上的完整呼叫堆疊與資料結構關係,才找到一個 memcpy 單位元組拷貝溢出(攻擊者可完全控制 16-bit 的長度欄位),並以此在三星手機上實現遠端代碼執行,獲得 Samsung Mobile Security Hall of Fame 2024 肯定。
體認到這種「重建工作比找漏洞更耗時」的現況,團隊決定把中間的繁瑣步驟交給 LLM Agent 流水線處理。工具 Whisper 的運作流程如下:首先將目標二進位檔送入自訂插件的反編譯器,生成可供 LLM 索引的偽 C 代碼,同時建構全域呼叫圖。接著用 Frida hook 真實三星裝置,在每次間接呼叫時讀取寄存器,補齊靜態分析無法解析的跳轉目標。有了這些資料後,代理依序執行三件事:定位封包接收與解析函式(縮小搜尋範圍)、重建資料結構(追蹤建構子中所有偏移量存取、推斷欄位名稱與型別),最後才啟動漏洞分析代理,從接收函式入口沿資料流向下追蹤至每個解析函式,執行類 taint 分析。
漏洞分析能夠給出高置信度結果的關鍵,在於代理輸入的不是「請找這段代碼的漏洞」這種開放式問題,而是包含「緩衝區大小為 X、攻擊者可控欄位為 Y 型別、最大值為 Z」的具體前提條件。LLM 此時扮演的角色更像一個約束求解器,而非開放性推理者,從而避免「可能存在溢出」這類無助於大規模審計的模糊答案。實際測試中,OpenAI O3 在所有運行中以高置信度找到全部已知漏洞,DeepSeek R1 和 MIDI 表現接近但偶爾漏報,完成同一任務最長需 21 小時。團隊設定 80% 為置信度閾值:高於此值的報告在驗證後全數為真陽性,低於此值則假陽性大量湧現,直接捨棄。為控制成本,工具內建模型路由器:推理繁重任務送 O3 或 R1,JSON 格式錯誤修正等輕量任務送 O4 Mini 或 DeepSeek V3。
講者強調,這套工具的定位不是取代安全研究員,而是把「枯燥的逆向重建工作」自動化,讓人類得以專注在選定目標與最終驗證兩端,大幅提升整體效率。工具目前仍持續產出新的漏洞報告,方向上代表了以 LLM 輔助安全審計的實際可行路徑。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


