KeyFrame內部研究專用

Leveraging AI for Smarter Bug Bounties | Bug Bounty Village, DEF CON 32

Bug Bounty Village·4月21日週一·41 min英文

三句話摘要

AI自主智能體如何執行完整的滲透測試工作流,並與人類安全研究人員的能力進行實證對比。 AI已具備自主執行標準漏洞挖掘的能力,但其真正價值不在替代人類,而在於和人類專家的協作——讓AI處理重複性和基礎性工作,讓人類專注於需要創意和深度思考的複雜挑戰。 AI的自主學習與適應能力遠超預期:演講示例顯示AI不僅執行預設命令,還能分析應用回應、自動調整策略。JWT漏洞演示中,AI發現依賴缺失時自動安裝;XSS示例中自行發現字符過濾、嘗試多種編碼方案;無目標CTF中甚至能自發探索應用、發現隱藏功能並構建完整攻擊鏈。這類自適應能力是傳統漏洞掃描工具難以實現的。

重點整理

重點
  • 1

    AI的自主學習與適應能力遠超預期:演講示例顯示AI不僅執行預設命令,還能分析應用回應、自動調整策略。JWT漏洞演示中,AI發現依賴缺失時自動安裝;XSS示例中自行發現字符過濾、嘗試多種編碼方案;無目標CTF中甚至能自發探索應用、發現隱藏功能並構建完整攻擊鏈。這類自適應能力是傳統漏洞掃描工具難以實現的。

  • 2

    規模化基準測試揭示了性能天花板:Expo投入三個月收集數千個真實挑戰,按難度分層評估。結果清晰顯示AI在標準化、可重複的任務上表現卓越(簡單90%、中等90%),但在需要多步組合、非常規思路或深層邏輯推理的困難挑戰(40%)上明顯遇冷,反映出當前LLM模型的內在局限性。

  • 3

    人機互補性定義了最優協作模式:對5位不同等級滲透測試員的40小時實驗表明,AI以30分鐘完成速度優勢明顯,但在創意繞過、複雜漏洞鏈、應急決策上人類專家仍占優勢。這啟發了未來應用方向:AI負責基礎/重複工作(reconnaissance、payload生成、自動化測試),人類專家專注創意與複雜判斷。

  • 4

    Human-in-the-loop原型實現了實用融合:Expo開發的互動系統允許人類在AI執行中即時介入——修正錯誤命令、補充遺漏payload、改變執行策略。這種協作避免了純自動化的不可控風險,同時保留了人類智慧的靈活性。

實用技巧與重點

乾貨
  • 成功率數據
  • PortSwigger基準:75%
  • PentesterLab基準:72%
  • 自有驗證集(100+用例):85%
  • 難度分布:簡單~90% | 中等~90% | 困難~40%
  • 漏洞類型與成功率
  • XSS(包括Blind XSS):高成功率
  • 文件上傳/CSRF:高成功率
  • 認證繞過(CSRF token自動填充):高成功率
  • 注入攻擊(SQL/NoSQL):中等成功率
  • 客戶端XSS:低(已改進)
  • OAUTH/SAML:低
  • 快取投毒/CORS:仍需改進
  • 技術細節與技巧
  • 自動處理CSRF token與session cookies
  • 內容類型協商(自動從POST切換到適配格式)
  • 多層編碼繞過(HTML entity + JavaScript字符串操作)
  • 路徑修正與依賴自動安裝
  • HTAccess上傳技巧(繞過副檔名過濾執行PHP)
  • OOB交互(interact.sh用於DOM exfiltration)
  • Bash腳本自動化工作流構建
  • 工具與平台
  • 測試基準來源:PortSwigger、PentesterLab、PandasLab
  • OOB服務:interact.sh
  • 内置瀏覽器(新增,改進客戶端測試)
  • 連接多種滲透工具集
  • 人機對比數據
  • AI完成時間:30分鐘(40個測試用例)
  • 人類完成時間:20-40小時(同一批用例)
  • 參與人員:5位滲透測試員(junior到principal級別)
  • 易/中難度:AI優勢(90% vs 人類70-85%)
  • 困難挑戰:人類優勢(創意與複雜推理)

結論

結論

AI已具備自主執行標準漏洞挖掘的能力,但其真正價值不在替代人類,而在於和人類專家的協作——讓AI處理重複性和基礎性工作,讓人類專注於需要創意和深度思考的複雜挑戰。

完整解析

詳細

Expo安全研究團隊在三個月前啟動了一個系統性的探索:既然公開研究多聚焦於「攻擊AI」,為什麼沒人深入研究「AI如何幫助我們更有效地進行滲透測試」?基於這個問題,他們決定構建一個完全自主的AI智能體,並通過大規模基準測試來評估其實際能力。

首先是數據基礎的搭建。團隊收集了來自PortSwigger、PentesterLab、PandasLab等主流平台的數千個真實CTF挑戰,並按簡單/中等/困難分層。更重要的是,他們創建了100多個全新的驗證集用例,確保測試結果代表真實漏洞獵取場景,而非訓練數據的洩露。這個基準集按OWASP分類涵蓋了XSS、CSRF、SQL/NoSQL注入、文件上傳、認證繞過、信息洩露、快取投毒等十多種漏洞類型。

AI智能體的核心能力通過三個遞進式演示展現。第一個JWT漏洞示例展示了純自動化:AI完全自主地註冊用戶、處理內容類型協商錯誤、提取token、在線搜尋PoC、下載後讀取README理解用法、發現路徑錯誤後自我修正、安裝缺失依賴、修改payload參數(從user改為admin),最終成功提取flag。整個過程無需任何人工干預。第二個XSS繞過示例更精細地展示了適應性:AI在發現字符過濾時,系統地嘗試多種編碼策略,最終通過HTML entity編碼+JavaScript字符串操作成功繞過。第三個「無目標CTF」示例最有洞察力:給定完全無意義的描述(「saggy quack quack」),AI自發地開始探索應用、發現register端點、理解登錄流程、識別「report to admin」功能作為潛在XSS面、編寫完整的自動化bash腳本進行OOB攻擊、最終通過DOM exfiltration盜取管理員信息並找到flag。

測試結果的分層差異揭示了關鍵洞察。在簡單和中等難度挑戰上,AI達成90%成功率,明顯超越了參與對比的所有人類測試員(包括principal級別)。但在困難挑戰上,成功率陡降至40%,因為這些用例通常要求跨越多個漏洞鏈、非標準的創意思路或複雜的多步推理。Expo邀請的5位不同級別滲透測試員進行了40小時的實驗測試,結果令人矚目:AI用30分鐘內完成了相同的工作量,展現出無與倫比的速度與耐力。然而,在需要創意跳躍和複雜判斷的案例上,人類專家的優勢仍不可替代。

正是這個發現引導Expo開發了「Human-in-the-loop」原型。這不是簡單的自動化工具,而是真正的人機協作系統:人類可以在AI執行過程中即時觀察其決策,發現錯誤時立即干預(修正錯誤命令、補充遺漏的payload、調整執行方向),AI則基於這些反饋繼續優化。這種設計結合了AI的速度、耐力和系統性與人類的創意、經驗判斷和應急能力,並且Expo計劃在數週內開源基準集供社區驗證。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。