Aaron Grattafiori & Skyler Bingham - Tenderizing the Target | [un]prompted 2026
三句話摘要
使用AI代理自動化在代碼庫中注入合成漏洞,用於評估安全掃描工具的檢測能力。 AI代理現已足夠強大,能自動化系統地在真實代碼庫中注入現實的、難以檢測的漏洞,為安全工具評估和紅隊測試開啟了新的可能性。 AI能力突破:過去6個月AI編碼代理性能大幅提升,能理解複雜代碼庫並注入現實的漏洞,這相比以往只能找出明顯漏洞是巨大進步。
重點整理
重點- 1
AI能力突破:過去6個月AI編碼代理性能大幅提升,能理解複雜代碼庫並注入現實的漏洞,這相比以往只能找出明顯漏洞是巨大進步。
- 2
系統化流程設計:從代碼分析、漏洞規劃、功能測試、漏洞注入到驗證測試,每個環節都有明確的目標和成果物,確保注入的漏洞是可驗證且真實的。
- 3
結構化指引優於直接提示:將流程寫成Markdown文件形成「技能」系統,讓AI代理按部就班執行,比單純的自然語言提示更可靠,結果更符合預期。
- 4
漏洞難度可控:支援簡單/中等/困難三種難度設定,系統可自動調整躲避策略,確保注入的漏洞對應不同檢測工具的能力水準。
實用技巧與重點
乾貨- 支援的漏洞類型:
- OWASP Top 10(按類別逐一注入)
- CWE(按漏洞分類編號注入)
- CVE(模擬特定已知漏洞)
- Auto RCE(鏈式漏洞最終實現遠端程式碼執行)
- 難度等級:
- 簡單、中等、困難
- 建置流程產物:
- 啟動/停止腳本
- 建置測試腳本
- 構建文檔
- 分析產出:
- 執行摘要(主要組件、入口點)
- 技術堆疊清單(元件、庫、版本)
- 功能分類
- 架構分析
- 所有端點和資料流模式列舉
- 安全實作詳情(認證、授權、加密)
- 外部集成點
- 基線掃描報告
- 驗證成果物:
- 驗證腳本(確認漏洞可被利用)
- 序列圖(詳述漏洞如何工作)
- 批評者反饋(檢查是否符合預期)
- 漏洞掃描對比報告
- 可擴展應用:
- 編譯後的二進位檔(補丁差異分析)
- 設定檔注入
- 日誌檔案注入
- 合成訓練數據生成
結論
結論“AI代理現已足夠強大,能自動化系統地在真實代碼庫中注入現實的、難以檢測的漏洞,為安全工具評估和紅隊測試開啟了新的可能性。”
完整解析
詳細AI在安全檢測中的應用已從簡單的漏洞發現進化到系統化的漏洞生成。NVIDIA的Aaron和Skyler團隊發現,隨著LLM編碼代理在過去6個月的性能突飛猛進,已有可能使用AI自動化地在代碼庫中注入現實的、可驗證的漏洞。這個需求來自一個實際問題:如何準確評估一個安全掃描工具或安全解決方案的真實檢測能力?
他們的方法是建立一個多階段的自動化流程。首先是分析階段,AI深入研究目標應用程式的架構、技術堆疊、功能流程和安全機制。系統會生成詳細的執行摘要,列舉所有組件、依賴、端點和潛在的漏洞入口點。隨後進行基線掃描,記錄應用程式在未被污染狀態下的掃描結果,作為後續對比的基準。
在規劃階段,團隊根據應用程式的特性決定要注入哪些漏洞。系統支援多種選項:可按OWASP Top 10逐一注入,也可指定具體的CWE編號或CVE編號來模擬已知漏洞。對於難度設定,可選擇簡單、中等或困難等級,系統會相應調整躲避策略。一個關鍵洞察是:不是所有OWASP Top 10都適用於每個應用程式,系統會智能地識別適用的8或10個類別進行注入。
關於如何讓AI更有效地完成這些任務,講者們發現結構化指引遠優於直接提示。他們將整個流程寫成Markdown文件形成一套「技能」系統,包含漏洞注入指南、常見誤區、架構考慮等內容。AI代理會遵循這些結構化的步驟而非單純理解自然語言指令,這大幅提高了成功率。此外,使用最新的模型(如Claude Opus 4.6)而非舊版本能得到更好的結果。
實施階段涉及多個並行的過程。代理會生成詳細的漏洞計劃、序列圖和驗證腳本。每次注入後,功能測試會確保應用程式的核心功能未被破壞。驗證過程包括讓一個「批評者」檢查漏洞計劃是否現實且不會獎勵不當的攻擊方式。最後再次進行漏洞掃描,比對結果確保注入的漏洞未被檢測到。如果難度設定為中等或困難,系統會反覆嘗試引入更隱蔽的注入方式。
在實踐中遇到的挑戰包括:模型傾向於拒絕或生成不現實的漏洞(如配置檔案解析中的字符溢出,通常不構成真實威脅)、編譯錯誤、CSRF令牌刷新、授權追蹤困難等。解決方案包括改進提示方式、交換模型重試、使用工具如Playwright進行瀏覽器自動化,以及保留人工驗證環節(儘管這會減慢速度)。
團隊強調的另一個重要原則是真實性。他們刻意避免修改單元測試來隱藏漏洞,盡量保持代碼改動最小以接近真實應用程式。這樣注入的漏洞才能真正評估掃描工具是否能檢測到真實的漏洞類型,而非CTF風格的人工漏洞。隨著技術演進,系統也可以擴展到生成編譯後的二進位檔、注入設定檔或日誌檔案,進一步豐富評估場景。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


