Leveraging AI for Smarter Bug Bounties | Bug Bounty Village, DEF CON 32
三句話摘要
AI自主智能體如何執行完整的滲透測試工作流,並與人類安全研究人員的能力進行實證對比。 AI已具備自主執行標準漏洞挖掘的能力,但其真正價值不在替代人類,而在於和人類專家的協作——讓AI處理重複性和基礎性工作,讓人類專注於需要創意和深度思考的複雜挑戰。 AI的自主學習與適應能力遠超預期:演講示例顯示AI不僅執行預設命令,還能分析應用回應、自動調整策略。JWT漏洞演示中,AI發現依賴缺失時自動安裝;XSS示例中自行發現字符過濾、嘗試多種編碼方案;無目標CTF中甚至能自發探索應用、發現隱藏功能並構建完整攻擊鏈。這類自適應能力是傳統漏洞掃描工具難以實現的。
重點整理
重點- 1
AI的自主學習與適應能力遠超預期:演講示例顯示AI不僅執行預設命令,還能分析應用回應、自動調整策略。JWT漏洞演示中,AI發現依賴缺失時自動安裝;XSS示例中自行發現字符過濾、嘗試多種編碼方案;無目標CTF中甚至能自發探索應用、發現隱藏功能並構建完整攻擊鏈。這類自適應能力是傳統漏洞掃描工具難以實現的。
- 2
規模化基準測試揭示了性能天花板:Expo投入三個月收集數千個真實挑戰,按難度分層評估。結果清晰顯示AI在標準化、可重複的任務上表現卓越(簡單90%、中等90%),但在需要多步組合、非常規思路或深層邏輯推理的困難挑戰(40%)上明顯遇冷,反映出當前LLM模型的內在局限性。
- 3
人機互補性定義了最優協作模式:對5位不同等級滲透測試員的40小時實驗表明,AI以30分鐘完成速度優勢明顯,但在創意繞過、複雜漏洞鏈、應急決策上人類專家仍占優勢。這啟發了未來應用方向:AI負責基礎/重複工作(reconnaissance、payload生成、自動化測試),人類專家專注創意與複雜判斷。
- 4
Human-in-the-loop原型實現了實用融合:Expo開發的互動系統允許人類在AI執行中即時介入——修正錯誤命令、補充遺漏payload、改變執行策略。這種協作避免了純自動化的不可控風險,同時保留了人類智慧的靈活性。
實用技巧與重點
乾貨- 成功率數據
- PortSwigger基準:75%
- PentesterLab基準:72%
- 自有驗證集(100+用例):85%
- 難度分布:簡單~90% | 中等~90% | 困難~40%
- 漏洞類型與成功率
- XSS(包括Blind XSS):高成功率
- 文件上傳/CSRF:高成功率
- 認證繞過(CSRF token自動填充):高成功率
- 注入攻擊(SQL/NoSQL):中等成功率
- 客戶端XSS:低(已改進)
- OAUTH/SAML:低
- 快取投毒/CORS:仍需改進
- 技術細節與技巧
- 自動處理CSRF token與session cookies
- 內容類型協商(自動從POST切換到適配格式)
- 多層編碼繞過(HTML entity + JavaScript字符串操作)
- 路徑修正與依賴自動安裝
- HTAccess上傳技巧(繞過副檔名過濾執行PHP)
- OOB交互(interact.sh用於DOM exfiltration)
- Bash腳本自動化工作流構建
- 工具與平台
- 測試基準來源:PortSwigger、PentesterLab、PandasLab
- OOB服務:interact.sh
- 内置瀏覽器(新增,改進客戶端測試)
- 連接多種滲透工具集
- 人機對比數據
- AI完成時間:30分鐘(40個測試用例)
- 人類完成時間:20-40小時(同一批用例)
- 參與人員:5位滲透測試員(junior到principal級別)
- 易/中難度:AI優勢(90% vs 人類70-85%)
- 困難挑戰:人類優勢(創意與複雜推理)
結論
結論“AI已具備自主執行標準漏洞挖掘的能力,但其真正價值不在替代人類,而在於和人類專家的協作——讓AI處理重複性和基礎性工作,讓人類專注於需要創意和深度思考的複雜挑戰。”
完整解析
詳細Expo安全研究團隊在三個月前啟動了一個系統性的探索:既然公開研究多聚焦於「攻擊AI」,為什麼沒人深入研究「AI如何幫助我們更有效地進行滲透測試」?基於這個問題,他們決定構建一個完全自主的AI智能體,並通過大規模基準測試來評估其實際能力。
首先是數據基礎的搭建。團隊收集了來自PortSwigger、PentesterLab、PandasLab等主流平台的數千個真實CTF挑戰,並按簡單/中等/困難分層。更重要的是,他們創建了100多個全新的驗證集用例,確保測試結果代表真實漏洞獵取場景,而非訓練數據的洩露。這個基準集按OWASP分類涵蓋了XSS、CSRF、SQL/NoSQL注入、文件上傳、認證繞過、信息洩露、快取投毒等十多種漏洞類型。
AI智能體的核心能力通過三個遞進式演示展現。第一個JWT漏洞示例展示了純自動化:AI完全自主地註冊用戶、處理內容類型協商錯誤、提取token、在線搜尋PoC、下載後讀取README理解用法、發現路徑錯誤後自我修正、安裝缺失依賴、修改payload參數(從user改為admin),最終成功提取flag。整個過程無需任何人工干預。第二個XSS繞過示例更精細地展示了適應性:AI在發現字符過濾時,系統地嘗試多種編碼策略,最終通過HTML entity編碼+JavaScript字符串操作成功繞過。第三個「無目標CTF」示例最有洞察力:給定完全無意義的描述(「saggy quack quack」),AI自發地開始探索應用、發現register端點、理解登錄流程、識別「report to admin」功能作為潛在XSS面、編寫完整的自動化bash腳本進行OOB攻擊、最終通過DOM exfiltration盜取管理員信息並找到flag。
測試結果的分層差異揭示了關鍵洞察。在簡單和中等難度挑戰上,AI達成90%成功率,明顯超越了參與對比的所有人類測試員(包括principal級別)。但在困難挑戰上,成功率陡降至40%,因為這些用例通常要求跨越多個漏洞鏈、非標準的創意思路或複雜的多步推理。Expo邀請的5位不同級別滲透測試員進行了40小時的實驗測試,結果令人矚目:AI用30分鐘內完成了相同的工作量,展現出無與倫比的速度與耐力。然而,在需要創意跳躍和複雜判斷的案例上,人類專家的優勢仍不可替代。
正是這個發現引導Expo開發了「Human-in-the-loop」原型。這不是簡單的自動化工具,而是真正的人機協作系統:人類可以在AI執行過程中即時觀察其決策,發現錯誤時立即干預(修正錯誤命令、補充遺漏的payload、調整執行方向),AI則基於這些反饋繼續優化。這種設計結合了AI的速度、耐力和系統性與人類的創意、經驗判斷和應急能力,並且Expo計劃在數週內開源基準集供社區驗證。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


