KeyFrame內部研究專用

DEF CON 33 - Winners of DARPA’s AI Cyber Challenge - Andrew Carney, Jason Roos, Stephen Winchell

DEFCONConference·10月10日週五·41 min英文

三句話摘要

DARPA AI 網路挑戰賽展示自主系統在軟體漏洞發現與修補上達到超人類水準,成功驗證 AI 可規模化解決關鍵基礎設施的安全危機。 自主 AI 系統已達超人類漏洞發現與修補能力,成本極低且高效,開源發布將使此變革性技術惠及全球,標誌著軟體安全從人力密集向自動化規模的根本轉變。 關鍵基礎設施面臨規模性威脅與修補延遲。Erlang SSH 漏洞存在十多年才被發現,儘管該項目經過積極維護;Cisco 等廠商則花了 4 個月以上才推出補丁。醫療產業更嚴峻——平均修補週期 491 天(vs. 其他業界 60-90 天),2018-2024 年 650 起勒索軟體事件泄露 8900 萬患者記錄,成本 $220 億。人工修補已無法應對軟體規模與漏洞數量的增長。

重點整理

重點
  • 1

    關鍵基礎設施面臨規模性威脅與修補延遲。Erlang SSH 漏洞存在十多年才被發現,儘管該項目經過積極維護;Cisco 等廠商則花了 4 個月以上才推出補丁。醫療產業更嚴峻——平均修補週期 491 天(vs. 其他業界 60-90 天),2018-2024 年 650 起勒索軟體事件泄露 8900 萬患者記錄,成本 $220 億。人工修補已無法應對軟體規模與漏洞數量的增長。

  • 2

    競賽設計聚焦真實場景與補丁生成而非檢測。不同於市面上多數自動化工具只強調漏洞發現,AIC 強制要求生成有效補丁並驗證其不破壞原有功能,這才是改變遊戲規則的關鍵。團隊面對的是 5400 萬行真實開源代碼中從未被見過的合成漏洞,而非人造試題。

  • 3

    AI 與傳統分析工具的工程創新超越模型迭代。決賽成果的大幅提升(相比半決賽 77% vs 之前的低基準)並非僅因模型改進,而是團隊創造了新穎的方式整合 LLM 與靜態/動態分析、模糊測試等技術。這體現了系統級工程創意的價值。

  • 4

    開源與公共投資的社會契約。政府投資 $2000 萬,團隊開發的所有工具隨即開源發布,使全球開發者與安全研究者都能受益。這反映了「保護所有人才能保護自己」的理念,同時體現美國 AI 公司(Anthropic、Google、OpenAI、Microsoft)與政府的協力。

實用技巧與重點

乾貨
  • 比賽成果量化
  • 代碼規模:5400 萬行、13 個開源項目
  • 合成漏洞發現率:77%(52 個零日發現 40 個;決賽相比半決賽大幅提升)
  • 修補成功率:60% 以上
  • 真實零日:18 個(11 個修補成功)
  • 平均修補時間:< 1 小時
  • 總成本:$360,082;單位成本:$152/任務
  • 模型調用:近 200 萬次查詢
  • 獎金與資源
  • Team Atlanta(第一名):$400 萬
  • Trail of Bits(第二名):$300 萬
  • Team Theory(第三名):未公開金額
  • 額外投資:DARPA + ARPAH $140 萬支持應用
  • 模型支持:Google、Anthropic、OpenAI、Microsoft 提供 $100 萬+ 信用額度
  • 工具發布計畫
  • 4 支團隊系統(CTR)已開源;3 支在數週內發布
  • 合作組織:Linux Foundation、OSSF、OSFT
  • 醫療行業數據
  • 2018-2024 年勒索軟體事件:650+ 起
  • 患者記錄泄露:8900 萬筆
  • 停機成本:$220 億
  • Ascension 單起事件:140+ 醫院、$11-16 億損失
  • 平均修補週期:491 天(vs. 其他業界 60-90 天)
  • 特定團隊成績
  • Team 42 Beyond Bug:最準確漏洞報告、唯一在最大倉庫(500 萬行)得分
  • All You Need is a Fuzzing Brain:首個真實 C 漏洞、某任務 < 5 分鐘完成
  • Team Lacrosse:最高漏洞證明準確度
  • Team Shellfish:補丁驗證通過率最高
  • Team Atlanta:最多真實漏洞發現、最多工件關聯
  • Team Theory:成本效益最優、Java 漏洞最多
  • Trail of Bits:最大補丁 300+ 行、20 種漏洞類別
  • DARPA 戰略投資
  • 相關項目:14 個
  • 總投資:$6.5 億+
  • 流向小企業比例:25%(未來預期提升)
  • 覆蓋領域:編譯器安全、消除怪異機器、可驗證代碼

結論

結論

自主 AI 系統已達超人類漏洞發現與修補能力,成本極低且高效,開源發布將使此變革性技術惠及全球,標誌著軟體安全從人力密集向自動化規模的根本轉變。

完整解析

詳細

Andrew Carney 以 Erlang OTP 為典範,揭示現代關鍵基礎設施的脆弱性根源。Erlang OTP 是 Ericson 於 1998 年開發的成熟開源庫,擁有活躍維護社群與商業支持,應該代表開源治理的最佳實踐。但今年一個 SSH 實現漏洞曝光時,安全研究人員發現它已潛伏十多年未被發現。更令人震驚的是,該漏洞極度易於識別——現有工具可在 30 秒內找到它,卻始終隱形。即使最終被披露,從 Erlang 維護者發布補丁到 Cisco 等廠商在實際硬體上部署補丁,也花了 4 個多月。這無異於賭上國家基礎設施的安全。

面對這種人力無法解決的規模危機,DARPA 與 ARPAH 發起了 AI 網路挑戰賽。競賽要求自主系統在真實開源軟體的 5400 萬行代碼中,發現並有效修補人工合成的漏洞——這些漏洞從未被任何人或 LLM 見過。與市場上多數自動化工具不同,AIC 不僅要求發現漏洞,更強制要求生成有效補丁且不破壞原功能。Carney 解釋,這才是改變遊戲規則的關鍵。他進一步澄清了 bug 與漏洞的定義邊界:在資源有限時代,安全相關性判定成本高昂。但若修補變得近乎免費且瞬間可得,則無需複雜分類——任何可觸發的缺陷都應修補。競賽因此降低了觸發閾值至 100 次嘗試中至少 1 次,並聚焦常見漏洞類別(CWE)。

決賽中七支團隊(包括大學組織與小型企業)交出了令人瞠目的成績單。他們從 5400 萬行代碼中發現 77% 的合成漏洞、修補 60% 以上的挑戰、同時挖掘出 18 個真實零日中的 11 個。平均修補時間不足一小時。成本控制更是傳奇:儘管決賽預算寬裕,但整輪總花費僅 $360,082(LLM API 成本 $360,082),單位成本平均 $152 per 任務(發現、補丁生成、漏洞驗證等)。這遠低於傳統人工安全審計。

這背後的秘訣不在模型本身的迭代進步,而在團隊的工程創新。相比半決賽的基準線,決賽性能提升之大,無法由單純的模型升級解釋。相反,團隊學會了以嶄新方式協調 LLM 與靜態/動態分析、模糊測試等傳統技術,創造出真正的synergy。這印證了軟體工程本質上是創意與系統性工作的結合。

Deputy Secretary Jim O'Neal 則從國家戰略角度闡述緊迫性。美國醫療體系自 2018 至 2024 年遭 650+ 勒索軟體事件,泄露 8900 萬患者記錄、造成 $220 億停機損失。去年 Ascension 遭遇的單起攻擊就影響 140+ 醫院、損失 $11-16 億。醫療系統修補週期平均 491 天,遠超其他業界的 60-90 天,原因在於醫療必須 24/7 運行、依賴專用遺留設備、IT 生態高度複雜。O'Neal 宣布 ARPAH 投入 $2000 萬不僅獎勵優勝團隊,更要幫助他們將技術轉化為現實應用。此舉體現了政府投資應轉化為公共利益的理念。

DARPA Director Steven Winshaw 補充,美國數位基礎設施建立在已有十多年甚至數十年的「古老腳手架」上,技術債務已成系統性風險。DARPA 目前投入 $6.5 億+ 跨 14 個項目,涵蓋編譯器安全、可驗證代碼、系統硬化等多面向。其中 25% 經費流向小企業與創新者,反映了政府優先支持創業生態的決心。Winshaw 宣布四支團隊系統(CTR)立即開源、另三支數週內發布,並追加 $140 萬獎金用於實際應用。這是對賽事成功的終極背書——技術已驗證、現在要向社會規模化推廣。

整場演講的根本訊息是:自主 AI 系統已不再是未來承諾,而是現在進行式。它不僅發現了人類可能永遠找不到的漏洞,還以難以置信的低成本快速生成可用補丁。開源發布意味著全球開發者、安全研究者乃至政府都能利用這些工具加強各自系統。這不是單純的技術進步,而是改變軟體安全遊戲規則的歷史轉折點。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。