Heather Adkins & Four Flynn - Evaluating Threats & Automating Defense at Google | [un]prompted 2026
三句話摘要
Google 和 DeepMind 發表自動化漏洞發現和修復的 AI 系統,目標是消除地球上所有軟體漏洞。 透過 Big Sleep 和 Code Minder,Google 正將頂尖安全研究員的專業知識編碼成 AI 系統,將漏洞發現和修復從手工作業轉變為可規模化的自動化流程,這是應對迫在眉睫的「AI 漏洞爆炸」時代的必要之舉。 漏洞數量爆炸性增長:NVD 待分析隊列積壓 30,000 個漏洞,2014-2015 年間 CVE 記錄漏洞增加 35%。十億美元級創投資金流入漏洞發現領域,意味著自動化發現漏洞的時代已來臨,現有 CVSS 評分系統將逐漸失效。
重點整理
重點- 1
漏洞數量爆炸性增長:NVD 待分析隊列積壓 30,000 個漏洞,2014-2015 年間 CVE 記錄漏洞增加 35%。十億美元級創投資金流入漏洞發現領域,意味著自動化發現漏洞的時代已來臨,現有 CVSS 評分系統將逐漸失效。
- 2
Big Sleep 的核心創新:不是簡單提示 LLM 找 bug,而是建立自我反饋的智能體框架,模擬 Project Zero 專業研究員的工作方式——構建假設、運用調試器和代碼瀏覽器驗證、反覆迭代,最後產生漏洞利用證明和高品質報告,確保每個發現的漏洞都真實可利用。
- 3
Code Minder 的多層驗證設計:生成補丁候選後,需通過模糊測試、形式化驗證、差異化測試等多個驗證器,確保補丁既能修復漏洞,又不破壞程式功能,並符合開發者的編碼風格,只有全部通過才發佈,失敗經驗回饋至 LLM 上下文進行改進。
- 4
實現路徑的完整性:設想終極目標是既修復遺留代碼中的漏洞,也主動加固現有代碼,並讓全新代碼從一開始就採用安全框架——形成發現、修復、預防的完整閉環。
實用技巧與重點
乾貨- Big Sleep 相關資料:
- 方法論基礎:2017 年 RAND 公司研究表明,經驗豐富的漏洞研究員發現深層漏洞約需 1 個月,利用需 22 天
- 核心工具:調試器、代碼瀏覽器、Python 解釋器
- 工作流程:構建假設 → 驗證假設 → 檢驗成功/失敗 → 反覆迴圈 → 產生漏洞利用程序 → 產生報告
- 漏洞類型:嚴重記憶體安全漏洞,深層嵌入於代碼,非淺層 XSS 或整數溢出
- 報告撰寫工具:Gemini(非人類)
- 內部驗證成果:除 5 個外,所有發現的漏洞已被修復
- 公開追蹤網址:google.com/projectzero(問題追蹤系統)
- Code Minder 相關資料:
- 漏洞來源:Big Sleep 驗證漏洞或其他來源
- 補丁驗證技術:
- 模糊測試(應用前後對變數進行)
- 形式化驗證(證明功能等效性)
- 差異化測試(通過惡意輸入確認漏洞仍存在)
- LLM 審視(使用精心設計的自由提示)
- 自動化成果:178 個開源修復程序
- 應用庫例:libwebp、Chrome V8、FFmpeg
- 加固工作:Chrome 代碼庫中的指針安全加固
- 核心理念與限制:
- 三個補丁要求:修復漏洞 + 不破壞功能 + 尊重原開發者風格
- 品質優先策略:寧可過度謹慎驗證,也要確保社區信任
- 承認的困境:即使補丁完美,全球某些地區仍難以及時應用修補程序
結論
結論“透過 Big Sleep 和 Code Minder,Google 正將頂尖安全研究員的專業知識編碼成 AI 系統,將漏洞發現和修復從手工作業轉變為可規模化的自動化流程,這是應對迫在眉睫的「AI 漏洞爆炸」時代的必要之舉。”
完整解析
詳細Google 和 DeepMind 團隊在演講中揭示了一個令人矚目的現象:軟體漏洞的數量正以災難性速度增長。國家漏洞數據庫(NVD)積壓了 30,000 個待分析漏洞,而 2014-2015 年間獲得 CVE 編號的漏洞就增加了 35%。更重要的是,十億美元級的創業資本正流向漏洞發現和紅隊測試領域,這意味著不久的將來,開源黑客工具結合 AI 代理框架將能自動發現幾乎每個系統中的每個漏洞。在這樣的未來,傳統的 CVSS 評分系統將失去意義,業界必須重新思考漏洞管理的哲學。
基於這一認知,Google 的 Project Zero 團隊和 DeepMind 開發了兩個互補的系統。Big Sleep 是一個漏洞發現引擎,創新之處在於它不是簡單地利用 LLM 的代碼理解能力,而是試圖複製 Project Zero 頂尖安全研究員的工作模式。研究員之所以能發現深層漏洞,在於他們對特定代碼庫的精通、對歷史安全漏洞的掌握,以及對代碼架構的深刻理解。Big Sleep 透過一個自我反饋的智能體框架來模擬這種專業過程:它根據過去的錯誤構建假設,例如「這部分代碼可能存在漏洞」,然後利用調試器、代碼瀏覽器和 Python 解釋器等工具進行驗證,根據反饋不斷調整,最終產生漏洞利用程序。這種迭代過程確保了零誤報率——每個發現的漏洞都真實可被利用。最後,由 Gemini 模型生成的高品質報告提供逐步分析和漏洞證明代碼,使得即使非專業開發者也能理解並修復漏洞。
但發現漏洞只是問題的一半。Code Minder 隨之而來,負責自動化修復。補丁生成本身相對簡單,但驗證補丁才是難點。Code Minder 的核心是一個可插拔的多層驗證系統。首先,系統生成多個補丁候選方案,然後通過模糊測試確保補丁不會破壞原有功能;透過形式化驗證證明修改後的代碼在邏輯上等效;透過差異化測試確認漏洞確實被修復;最後請 LLM 用精心設計的提示進行審視。只有當所有驗證器都通過後,補丁才會被考慮發佈給社區。倘若驗證失敗,失敗的經驗會被回饋至 LLM 的上下文窗口,幫助系統從錯誤中學習並嘗試改進,直至產生可接受的補丁。迄今為止,Code Minder 已自動生成 178 個開源修復程序,應用於 libwebp、Chrome V8 等知名項目。
團隊的最終願景更加宏大:既修復現有遺留代碼中的漏洞,也主動加固代碼以預防潛在漏洞,更在全新代碼開發階段就內嵌安全框架。這形成了一個發現、修復、預防的完整閉環。但他們坦誠,即使補丁再完美,全球某些地區仍難以及時應用修補程序——這是 AI 無法直接解決的人類和制度層面的挑戰。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


