KeyFrame內部研究專用

Teaching AI to Find Real Vulnerabilities — David Brumley, Bugcrowd

AI Engineer·8月1日週六·27 min中文

三句話摘要

如何設計強化學習環境教導 AI 模型進行網路安全任務,以及前沿模型在高價值漏洞利用上的真實能力評估。 網路安全的強化學習並不神秘,關鍵在於設計正確的評分 Oracle、承認多漏洞的現實、用開放審計替代單一目標,以及在真實高價值目標上測試才能看出模型的真實能力。 強化學習需要確定性評分器而非 LLM 當裁判 — 用程式碼驗證真實的漏洞利用(能否奪取旗幟、控制流劫持、任意程式碼執行),而不能信任 LLM 自我評估,否則會陷入幻覺。

重點整理

重點
  • 1

    強化學習需要確定性評分器而非 LLM 當裁判 — 用程式碼驗證真實的漏洞利用(能否奪取旗幟、控制流劫持、任意程式碼執行),而不能信任 LLM 自我評估,否則會陷入幻覺。

  • 2

    單漏洞假設是錯誤的,多漏洞才是現實 — DARPA 的 6000 萬美元競賽都意外出現了 50% 的多漏洞,現有基準如 Cyber Gym 限制模型只找最簡單的漏洞,導致無法學習更高階能力。

  • 3

    審計任務用開放世界替代完美問題 — 不再要求找「這個」漏洞,改為要求找出所有漏洞並提交證明,用堆疊回溯區分多個獨立錯誤,精確率/召回率平衡已知與未知漏洞的發現。

  • 4

    高價值目標測試才能看出模型真實水平差異 — V8 完全沙箱逃逸測試顯示 Claude 73% 成功率、GPT 68%、Gemini/Kimmy 0%;Claude 甚至發現了公開無解法的 CVE,說明能力來自推理而非記憶。

實用技巧與重點

乾貨
  • 關鍵競賽與案例:
  • picoCTF:每年約 100 萬高中生參加
  • Richard Zhu(fluorescence):2 年學習後贏得 Pwn2Own,獲得 375,000 美元現金+全新特斯拉
  • George Hotz:第一個破解 iPhone 的人
  • DARPA Cyber Grand Challenge:6000 萬美元投入,50% 的挑戰存在未知漏洞
  • AIxCC:18 個 DEF CON 漏洞中有 18 個都是意外發現
  • 強化學習環境的關鍵組成:
  • 容器化易復現的有漏洞程式
  • 確定性評分 Oracle(非 LLM)
  • MCP 介面暴露讀寫、setup、評分功能
  • 精確率/召回率兩軸評分
  • V8 測試資料(41 個漏洞):
  • 觸發崩潰:GPT-5.5、Claude 95%,Gemini 50%
  • 任意程式碼執行:Claude 73%、GPT 68%、Gemini/Kimmy 0%
  • Claude 完整沙箱逃逸成功:30/41(73%)
  • 關鍵 CVE 案例:
  • CVE-2023-6707:Claude 逆向 JavaScript math.random,偽造 ROP 指標
  • CVE-2024-7965:Claude 發現新 WASM 路徑,超越專家認為的可行性
  • CVE-2024-0519:發現無公開利用方法的零日漏洞
  • 釋出資源:
  • exploitbench.ai:可下載完整資料集與 Docker 環境
  • MCP 介面可直接與 Claude 互動
  • 所有轉錄資料公開(除 Claude 因保密協議外)

結論

結論

網路安全的強化學習並不神秘,關鍵在於設計正確的評分 Oracle、承認多漏洞的現實、用開放審計替代單一目標,以及在真實高價值目標上測試才能看出模型的真實能力。

完整解析

詳細

強化學習如何才能真正教會 AI 進行網路安全任務?講者 David Brumley(卡內基美隆終身教授、Bugcrowd 首席 AI 官)從他 20 多年的研究經驗出發,指出這個問題的本質在於「設定正確的任務目標」。他用一個真實故事開場:一位 17 歲的高中生透過自學從簡單到複雜的 CTF 題逐步進階,兩年後成為 Pwn2Own 冠軍並贏得特斯拉汽車和 37.5 萬美元——而教會 AI 模型的方式應該完全相同,需要兩個維度的遞進設計。

第一個維度是目標難度:從玩具程式到開源軟體。第二個維度是攻擊難度的分級:能否找到 bug、能否觸發崩潰、能否進行任意讀寫、能否完全控制程式。然而,Brumley 發現現有基準測試(如 CyberGym、CyberBench)存在致命缺陷——它們假設程式只有一個漏洞,但實際上這幾乎不可能。DARPA 投入 6000 萬美元精心設計的 Cyber Grand Challenge 中,50% 的挑戰都意外包含多個漏洞;DEF CON 的 AIxCC 競賽也發現了 18 個未預料的漏洞。結果就是 AI 模型在這些基準上總是重複找最簡單的漏洞,無法進一步學習。

為了解決這個問題,Brumley 團隊提出了「審計任務」新方法。與其要求 AI 找「那個」特定漏洞,改為要求找出「所有」漏洞並提交證明。AI 可以自由發現多個漏洞,評分器透過堆疊回溯區分不同的錯誤,然後用精確率和召回率來評分——精確率防止 AI 提交無關輸入製造噪音,召回率確保它找出已知漏洞。這種開放世界的設計甚至允許 AI 發現人類未知的漏洞,而不是被人工限制。

在與 OpenAI 和 Anthropic 合作的最新實驗中,團隊選擇了 Chrome 瀏覽器的 V8 JavaScript 引擎作為高價值目標。V8 不僅驅動 Chrome,還執行 Node.js、Edge 瀏覽器和 Cloudflare Workers——攻破它意味著能入侵多個系統。團隊設計了 16 層遞進的能力梯子,測試了 41 個真實 V8 漏洞。結果顯示:在簡單的「崩潰」任務上,Claude、GPT-5.5 都達到 95% 成功率,看起來沒區別;但在真正的「完全沙箱逃逸」上,Claude 達到 73% 成功率,GPT 68%,而 Gemini 和開源模型則是 0%。更令人印象深刻的是,Claude 甚至發現了既沒有公開利用方法的 CVE,也有突破專家認為「在 x86 上不可能」的限制的情況——這些都是創意推理,不是死記硬背。

Brumley 強調了開放科學與安全的兩難:釋出這些基準確實推進了科學,但 AI 模型正在創造高價值目標的真實攻擊手段。團隊目前的做法是使用 10 年來與 DARPA 合作發現的獨特零日漏洞來訓練強化學習環境,確保模型看不到的都是真正的新漏洞,從而驗證它們真的在學習而非記憶。合作公司每月可獲得多達 10,000 個訓練環境。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「Web2 安全」的內容

Risky Bulletin: Russia starts blocking DoH and DoT
編輯精選
8 min
Web2 安全英文PODCAST8月26日

Risky Bulletin: Russia starts blocking DoH and DoT

Risky Business

  • 國家級網路管制層級提升:俄羅斯主動封鎖加密 DNS 協定對抗審查工具,中國加速淘汰 Windows 系統並遷移自主 Linux 發行版,各國正透過技術與法律手段強化網路主權與信息控制能力。
  • 詐騙犯罪走向精密化與自動化:從冒充警察的聲音詐騙(竊取 7.2 百萬美元)、AI 語音代理自動化破解 iPhone 啟用鎖、到跨越數百網站的投資詐騙(詐騙 7400 萬美元),犯罪組織正利用自動化工具與 AI 技術大幅降低成本並擴大規模。
  • AI 惡意軟體威脅實際上被嚴重誇大:405 個整合 AI 的惡意軟體樣本中僅 12 個於真實感染被偵測,其餘來自測試環境,證明當前 AI 惡意軟體仍停留於實驗階段,尚未構成主流威脅。
SANS Stormcast Wednesday, August 26th, 2026: Obfuscating SSRF; Paint and Photos AI Watermarks; FTP Banner C2;
5 min
Web2 安全英文PODCAST8月26日

SANS Stormcast Wednesday, August 26th, 2026: Obfuscating SSRF; Paint and Photos AI Watermarks; FTP Banner C2;

SANS Stormcast

  • SSRF 攻擊者已進化出高級繞過手段,不直接使用元數據服務 IP(169.254.169.254),而改用專門域名服務將請求轉址,支援點或破折號分隔 IP,甚至可自部署 DNS 伺服器進行 DNS 重綁定攻擊,使傳統簡易過濾機制失效。
  • 本地 AI 模型並非完全隱私:微軟 Paint 雖在本地執行生成邏輯,但安全檢查需上傳提示文字至遠程伺服器,返回時圖像內嵌不易移除的伺服器 GUID 隱形浮水印,可見浮水印(Copilot 圖標)則易被移除。
  • 傳統 FTP 協議被新型惡意軟體重新利用為命令控制通道,透過 FTP banner 傳遞指令於連接埠 21,防守者應視任何出站 FTP 流量為異常信號。
SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car
7 min
Web2 安全英文PODCAST8月25日

SANS Stormcast Tuesday, August 25th, 2026: DOUBLECUP PNG; WebAudio Fingerprinting; Expired Domains; Android; Car

SANS Stormcast

  • PNG 容器攻擊的簡易性設計:Double Cup 不依賴複雜的 Exif 或隱寫技術,只用 PNG 副檔名和檔頭來偽裝,核心是利用 findstr 指令的常見可用性讓執行變得無需額外工具。
  • Web Audio API 的隱密指紋識別:音訊於增益零的無聲狀態下播放,使用者完全無感,但錄製波形足以建立裝置特徵,在瀏覽器原生功能層面難以區分是反詐欺還是過度追蹤。
  • 域名過期引發的串聯漏洞:DMARC 報告端點使用過期域名是常見疏漏,允許攻擊者透過簡單的域名註冊取得他人的 SPF/DKIM 錯誤報告,進而收集目標系統配置情報。