DEF CON 33 - Winners of DARPA’s AI Cyber Challenge - Andrew Carney, Jason Roos, Stephen Winchell
三句話摘要
DARPA AI 網路挑戰賽展示自主系統在軟體漏洞發現與修補上達到超人類水準,成功驗證 AI 可規模化解決關鍵基礎設施的安全危機。 自主 AI 系統已達超人類漏洞發現與修補能力,成本極低且高效,開源發布將使此變革性技術惠及全球,標誌著軟體安全從人力密集向自動化規模的根本轉變。 關鍵基礎設施面臨規模性威脅與修補延遲。Erlang SSH 漏洞存在十多年才被發現,儘管該項目經過積極維護;Cisco 等廠商則花了 4 個月以上才推出補丁。醫療產業更嚴峻——平均修補週期 491 天(vs. 其他業界 60-90 天),2018-2024 年 650 起勒索軟體事件泄露 8900 萬患者記錄,成本 $220 億。人工修補已無法應對軟體規模與漏洞數量的增長。
重點整理
重點- 1
關鍵基礎設施面臨規模性威脅與修補延遲。Erlang SSH 漏洞存在十多年才被發現,儘管該項目經過積極維護;Cisco 等廠商則花了 4 個月以上才推出補丁。醫療產業更嚴峻——平均修補週期 491 天(vs. 其他業界 60-90 天),2018-2024 年 650 起勒索軟體事件泄露 8900 萬患者記錄,成本 $220 億。人工修補已無法應對軟體規模與漏洞數量的增長。
- 2
競賽設計聚焦真實場景與補丁生成而非檢測。不同於市面上多數自動化工具只強調漏洞發現,AIC 強制要求生成有效補丁並驗證其不破壞原有功能,這才是改變遊戲規則的關鍵。團隊面對的是 5400 萬行真實開源代碼中從未被見過的合成漏洞,而非人造試題。
- 3
AI 與傳統分析工具的工程創新超越模型迭代。決賽成果的大幅提升(相比半決賽 77% vs 之前的低基準)並非僅因模型改進,而是團隊創造了新穎的方式整合 LLM 與靜態/動態分析、模糊測試等技術。這體現了系統級工程創意的價值。
- 4
開源與公共投資的社會契約。政府投資 $2000 萬,團隊開發的所有工具隨即開源發布,使全球開發者與安全研究者都能受益。這反映了「保護所有人才能保護自己」的理念,同時體現美國 AI 公司(Anthropic、Google、OpenAI、Microsoft)與政府的協力。
實用技巧與重點
乾貨- 比賽成果量化
- 代碼規模:5400 萬行、13 個開源項目
- 合成漏洞發現率:77%(52 個零日發現 40 個;決賽相比半決賽大幅提升)
- 修補成功率:60% 以上
- 真實零日:18 個(11 個修補成功)
- 平均修補時間:< 1 小時
- 總成本:$360,082;單位成本:$152/任務
- 模型調用:近 200 萬次查詢
- 獎金與資源
- Team Atlanta(第一名):$400 萬
- Trail of Bits(第二名):$300 萬
- Team Theory(第三名):未公開金額
- 額外投資:DARPA + ARPAH $140 萬支持應用
- 模型支持:Google、Anthropic、OpenAI、Microsoft 提供 $100 萬+ 信用額度
- 工具發布計畫
- 4 支團隊系統(CTR)已開源;3 支在數週內發布
- 合作組織:Linux Foundation、OSSF、OSFT
- 醫療行業數據
- 2018-2024 年勒索軟體事件:650+ 起
- 患者記錄泄露:8900 萬筆
- 停機成本:$220 億
- Ascension 單起事件:140+ 醫院、$11-16 億損失
- 平均修補週期:491 天(vs. 其他業界 60-90 天)
- 特定團隊成績
- Team 42 Beyond Bug:最準確漏洞報告、唯一在最大倉庫(500 萬行)得分
- All You Need is a Fuzzing Brain:首個真實 C 漏洞、某任務 < 5 分鐘完成
- Team Lacrosse:最高漏洞證明準確度
- Team Shellfish:補丁驗證通過率最高
- Team Atlanta:最多真實漏洞發現、最多工件關聯
- Team Theory:成本效益最優、Java 漏洞最多
- Trail of Bits:最大補丁 300+ 行、20 種漏洞類別
- DARPA 戰略投資
- 相關項目:14 個
- 總投資:$6.5 億+
- 流向小企業比例:25%(未來預期提升)
- 覆蓋領域:編譯器安全、消除怪異機器、可驗證代碼
結論
結論“自主 AI 系統已達超人類漏洞發現與修補能力,成本極低且高效,開源發布將使此變革性技術惠及全球,標誌著軟體安全從人力密集向自動化規模的根本轉變。”
完整解析
詳細Andrew Carney 以 Erlang OTP 為典範,揭示現代關鍵基礎設施的脆弱性根源。Erlang OTP 是 Ericson 於 1998 年開發的成熟開源庫,擁有活躍維護社群與商業支持,應該代表開源治理的最佳實踐。但今年一個 SSH 實現漏洞曝光時,安全研究人員發現它已潛伏十多年未被發現。更令人震驚的是,該漏洞極度易於識別——現有工具可在 30 秒內找到它,卻始終隱形。即使最終被披露,從 Erlang 維護者發布補丁到 Cisco 等廠商在實際硬體上部署補丁,也花了 4 個多月。這無異於賭上國家基礎設施的安全。
面對這種人力無法解決的規模危機,DARPA 與 ARPAH 發起了 AI 網路挑戰賽。競賽要求自主系統在真實開源軟體的 5400 萬行代碼中,發現並有效修補人工合成的漏洞——這些漏洞從未被任何人或 LLM 見過。與市場上多數自動化工具不同,AIC 不僅要求發現漏洞,更強制要求生成有效補丁且不破壞原功能。Carney 解釋,這才是改變遊戲規則的關鍵。他進一步澄清了 bug 與漏洞的定義邊界:在資源有限時代,安全相關性判定成本高昂。但若修補變得近乎免費且瞬間可得,則無需複雜分類——任何可觸發的缺陷都應修補。競賽因此降低了觸發閾值至 100 次嘗試中至少 1 次,並聚焦常見漏洞類別(CWE)。
決賽中七支團隊(包括大學組織與小型企業)交出了令人瞠目的成績單。他們從 5400 萬行代碼中發現 77% 的合成漏洞、修補 60% 以上的挑戰、同時挖掘出 18 個真實零日中的 11 個。平均修補時間不足一小時。成本控制更是傳奇:儘管決賽預算寬裕,但整輪總花費僅 $360,082(LLM API 成本 $360,082),單位成本平均 $152 per 任務(發現、補丁生成、漏洞驗證等)。這遠低於傳統人工安全審計。
這背後的秘訣不在模型本身的迭代進步,而在團隊的工程創新。相比半決賽的基準線,決賽性能提升之大,無法由單純的模型升級解釋。相反,團隊學會了以嶄新方式協調 LLM 與靜態/動態分析、模糊測試等傳統技術,創造出真正的synergy。這印證了軟體工程本質上是創意與系統性工作的結合。
Deputy Secretary Jim O'Neal 則從國家戰略角度闡述緊迫性。美國醫療體系自 2018 至 2024 年遭 650+ 勒索軟體事件,泄露 8900 萬患者記錄、造成 $220 億停機損失。去年 Ascension 遭遇的單起攻擊就影響 140+ 醫院、損失 $11-16 億。醫療系統修補週期平均 491 天,遠超其他業界的 60-90 天,原因在於醫療必須 24/7 運行、依賴專用遺留設備、IT 生態高度複雜。O'Neal 宣布 ARPAH 投入 $2000 萬不僅獎勵優勝團隊,更要幫助他們將技術轉化為現實應用。此舉體現了政府投資應轉化為公共利益的理念。
DARPA Director Steven Winshaw 補充,美國數位基礎設施建立在已有十多年甚至數十年的「古老腳手架」上,技術債務已成系統性風險。DARPA 目前投入 $6.5 億+ 跨 14 個項目,涵蓋編譯器安全、可驗證代碼、系統硬化等多面向。其中 25% 經費流向小企業與創新者,反映了政府優先支持創業生態的決心。Winshaw 宣布四支團隊系統(CTR)立即開源、另三支數週內發布,並追加 $140 萬獎金用於實際應用。這是對賽事成功的終極背書——技術已驗證、現在要向社會規模化推廣。
整場演講的根本訊息是:自主 AI 系統已不再是未來承諾,而是現在進行式。它不僅發現了人類可能永遠找不到的漏洞,還以難以置信的低成本快速生成可用補丁。開源發布意味著全球開發者、安全研究者乃至政府都能利用這些工具加強各自系統。這不是單純的技術進步,而是改變軟體安全遊戲規則的歷史轉折點。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


