Teaching AI to Find Real Vulnerabilities — David Brumley, Bugcrowd
三句話摘要
如何設計強化學習環境教導 AI 模型進行網路安全任務,以及前沿模型在高價值漏洞利用上的真實能力評估。 網路安全的強化學習並不神秘,關鍵在於設計正確的評分 Oracle、承認多漏洞的現實、用開放審計替代單一目標,以及在真實高價值目標上測試才能看出模型的真實能力。 強化學習需要確定性評分器而非 LLM 當裁判 — 用程式碼驗證真實的漏洞利用(能否奪取旗幟、控制流劫持、任意程式碼執行),而不能信任 LLM 自我評估,否則會陷入幻覺。
重點整理
重點- 1
強化學習需要確定性評分器而非 LLM 當裁判 — 用程式碼驗證真實的漏洞利用(能否奪取旗幟、控制流劫持、任意程式碼執行),而不能信任 LLM 自我評估,否則會陷入幻覺。
- 2
單漏洞假設是錯誤的,多漏洞才是現實 — DARPA 的 6000 萬美元競賽都意外出現了 50% 的多漏洞,現有基準如 Cyber Gym 限制模型只找最簡單的漏洞,導致無法學習更高階能力。
- 3
審計任務用開放世界替代完美問題 — 不再要求找「這個」漏洞,改為要求找出所有漏洞並提交證明,用堆疊回溯區分多個獨立錯誤,精確率/召回率平衡已知與未知漏洞的發現。
- 4
高價值目標測試才能看出模型真實水平差異 — V8 完全沙箱逃逸測試顯示 Claude 73% 成功率、GPT 68%、Gemini/Kimmy 0%;Claude 甚至發現了公開無解法的 CVE,說明能力來自推理而非記憶。
實用技巧與重點
乾貨- 關鍵競賽與案例:
- picoCTF:每年約 100 萬高中生參加
- Richard Zhu(fluorescence):2 年學習後贏得 Pwn2Own,獲得 375,000 美元現金+全新特斯拉
- George Hotz:第一個破解 iPhone 的人
- DARPA Cyber Grand Challenge:6000 萬美元投入,50% 的挑戰存在未知漏洞
- AIxCC:18 個 DEF CON 漏洞中有 18 個都是意外發現
- 強化學習環境的關鍵組成:
- 容器化易復現的有漏洞程式
- 確定性評分 Oracle(非 LLM)
- MCP 介面暴露讀寫、setup、評分功能
- 精確率/召回率兩軸評分
- V8 測試資料(41 個漏洞):
- 觸發崩潰:GPT-5.5、Claude 95%,Gemini 50%
- 任意程式碼執行:Claude 73%、GPT 68%、Gemini/Kimmy 0%
- Claude 完整沙箱逃逸成功:30/41(73%)
- 關鍵 CVE 案例:
- CVE-2023-6707:Claude 逆向 JavaScript math.random,偽造 ROP 指標
- CVE-2024-7965:Claude 發現新 WASM 路徑,超越專家認為的可行性
- CVE-2024-0519:發現無公開利用方法的零日漏洞
- 釋出資源:
- exploitbench.ai:可下載完整資料集與 Docker 環境
- MCP 介面可直接與 Claude 互動
- 所有轉錄資料公開(除 Claude 因保密協議外)
結論
結論“網路安全的強化學習並不神秘,關鍵在於設計正確的評分 Oracle、承認多漏洞的現實、用開放審計替代單一目標,以及在真實高價值目標上測試才能看出模型的真實能力。”
完整解析
詳細強化學習如何才能真正教會 AI 進行網路安全任務?講者 David Brumley(卡內基美隆終身教授、Bugcrowd 首席 AI 官)從他 20 多年的研究經驗出發,指出這個問題的本質在於「設定正確的任務目標」。他用一個真實故事開場:一位 17 歲的高中生透過自學從簡單到複雜的 CTF 題逐步進階,兩年後成為 Pwn2Own 冠軍並贏得特斯拉汽車和 37.5 萬美元——而教會 AI 模型的方式應該完全相同,需要兩個維度的遞進設計。
第一個維度是目標難度:從玩具程式到開源軟體。第二個維度是攻擊難度的分級:能否找到 bug、能否觸發崩潰、能否進行任意讀寫、能否完全控制程式。然而,Brumley 發現現有基準測試(如 CyberGym、CyberBench)存在致命缺陷——它們假設程式只有一個漏洞,但實際上這幾乎不可能。DARPA 投入 6000 萬美元精心設計的 Cyber Grand Challenge 中,50% 的挑戰都意外包含多個漏洞;DEF CON 的 AIxCC 競賽也發現了 18 個未預料的漏洞。結果就是 AI 模型在這些基準上總是重複找最簡單的漏洞,無法進一步學習。
為了解決這個問題,Brumley 團隊提出了「審計任務」新方法。與其要求 AI 找「那個」特定漏洞,改為要求找出「所有」漏洞並提交證明。AI 可以自由發現多個漏洞,評分器透過堆疊回溯區分不同的錯誤,然後用精確率和召回率來評分——精確率防止 AI 提交無關輸入製造噪音,召回率確保它找出已知漏洞。這種開放世界的設計甚至允許 AI 發現人類未知的漏洞,而不是被人工限制。
在與 OpenAI 和 Anthropic 合作的最新實驗中,團隊選擇了 Chrome 瀏覽器的 V8 JavaScript 引擎作為高價值目標。V8 不僅驅動 Chrome,還執行 Node.js、Edge 瀏覽器和 Cloudflare Workers——攻破它意味著能入侵多個系統。團隊設計了 16 層遞進的能力梯子,測試了 41 個真實 V8 漏洞。結果顯示:在簡單的「崩潰」任務上,Claude、GPT-5.5 都達到 95% 成功率,看起來沒區別;但在真正的「完全沙箱逃逸」上,Claude 達到 73% 成功率,GPT 68%,而 Gemini 和開源模型則是 0%。更令人印象深刻的是,Claude 甚至發現了既沒有公開利用方法的 CVE,也有突破專家認為「在 x86 上不可能」的限制的情況——這些都是創意推理,不是死記硬背。
Brumley 強調了開放科學與安全的兩難:釋出這些基準確實推進了科學,但 AI 模型正在創造高價值目標的真實攻擊手段。團隊目前的做法是使用 10 年來與 DARPA 合作發現的獨特零日漏洞來訓練強化學習環境,確保模型看不到的都是真正的新漏洞,從而驗證它們真的在學習而非記憶。合作公司每月可獲得多達 10,000 個訓練環境。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

