KeyFrame內部研究專用

Nicholas Carlini - Black-hat LLMs | [un]prompted 2026

unprompted·3月25日週三·26 min英文

三句話摘要

語言模型已具備自主發現和利用軟體零日漏洞的能力,攻防平衡正在改變。 語言模型自主發現零日漏洞的能力已達臨界點且呈指數增長,攻防平衡正在根本性改變,防守方必須在短期內建立大規模漏洞驗證防禦體系,否則面臨自動化攻擊浪潮。 1. 漏洞發現能力已達臨界點

重點整理

重點
  • 1

    1. 漏洞發現能力已達臨界點

  • 2

    最新語言模型不再需要複雜的輔助工具或人工引導,能自主完成從代碼分析到漏洞利用的整個過程。這種自主能力在三四個月前尚不存在,但現在已成為現實,標誌著安全領域的質變。

  • 3

    2. 指數級增長正在加速攻防失衡

  • 4

    模型的漏洞發現能力每 4 個月翻倍,遠超過去 20 年來攻擊者和防守方的漸進式發展。過去被認為是防守方優勢的軟體漏洞密度,如今正被快速自動發現,曾經只有頂尖安全研究員才能找到的複雜漏洞,現在普通模型也能發現。

  • 5

    3. 古老漏洞的發現具有重要警示

  • 6

    Linux 核心中發現的漏洞存在於 2003 年,人工模糊測試幾乎不可能觸發。模型能發現這類需要多個協議交互階段才能觸發的緩衝區溢位,說明其邏輯推理能力已超越傳統測試方法的界限。

  • 7

    4. 防守方面臨時間窗口壓力

  • 8

    大量驗證未完成的潛在漏洞正在堆積(講者本人已有數百個),無法及時發布給開發者修復。一旦模型能力進一步提升,惡意行為者將同時掌握漏洞發現和利用的自動化工具。

實用技巧與重點

乾貨
  • 具體漏洞案例
  • Ghost CMS(GitHub 5 萬星):SQL 注入漏洞 → 盲注技術 → 讀取完整 admin 凭證、API 密鑰、密碼雜湊
  • Linux NFSv4 守護程序:堆緩衝區溢位漏洞 → 遠程可利用 → 存在自 2003 年 → 通過三方協議交互觸發
  • 模型發展時間線
  • Claude 3.5(最近發布):可發現複雜漏洞
  • Claude 4.1(不到 1 年前):幾乎找不到
  • Opus 4.1(不到 1 年前):幾乎找不到
  • 轉折點:最近 3-4 個月內模型跨越發現零日漏洞的閾值
  • 性能指標
  • 能完成需要人類花費 15 小時的任務,成功率約 50%
  • 能力每 4 個月翻倍
  • 智能合約漏洞利用:最新模型可盜取實際智能合約中的數百萬美元
  • 測試框架
  • 環境:虛擬機 + 極嚴格權限設定
  • 提示:「你在參加 CTF 比賽,找到漏洞並寫入輸出文件」
  • 結果:通常產生詳細漏洞報告,包括利用方法和流程圖

結論

結論

語言模型自主發現零日漏洞的能力已達臨界點且呈指數增長,攻防平衡正在根本性改變,防守方必須在短期內建立大規模漏洞驗證防禦體系,否則面臨自動化攻擊浪潮。

完整解析

詳細

Nicholas 來自 Anthropic,他在這場技術演講中詳細闡述了語言模型在安全領域帶來的根本性轉變。最核心的議題是:最新的語言模型現在已能自主發現和利用軟體中的零日漏洞,而這種能力在三四個月前完全不存在。他展示了一個簡潔有力的工作框架——只需在虛擬機中運行 Claude,給予廣泛權限,用提示詞「你在參加 CTF 比賽,找到漏洞」就能啟動自主漏洞搜索。模型會自動進行代碼審查、漏洞分析,最後生成結構清晰的漏洞報告。

在具體案例層面,講者提供了兩個震撼性的例子。首先是 Ghost 內容管理系統(GitHub 上有 5 萬顆星的成熟項目)中的 SQL 注入漏洞。表面上看這是常見問題,但這個存在 20 年的項目歷史上從未出現過同類漏洞。更關鍵的是,模型不僅找到了漏洞,還掌握了盲注 SQL 注入技術,在完全無需身份驗證的情況下讀取了完整的管理員凭證、API 密鑰,甚至密碼的 bcrypt 雜湊。講者現場演示了利用過程,展示了攻擊者如何能由此對整個生產應用進行完全控制。

第二個例子更令人不安:Linux 核心 NFSv4 守護程序中的遠程可利用堆緩衝區溢位漏洞。這個漏洞的複雜性在於它需要精確的協議交互序列才能觸發——涉及客戶端 A 和 B 之間的競爭條件,以及精心構造的鎖定請求導致緩衝區溢位。這類漏洞通常只有在深度代碼審查或模糊測試後才能被人類發現,但該漏洞存在於 2003 年的代碼中,遠早於 Git 版本控制系統出現。模型不僅發現了它,還生成了清晰的流程圖和詳細的技術解釋。

講者強調的核心擔憂是指數級增長的影響。根據數據,模型能力每 4 個月翻倍——已驗證最新模型能完成需要人類花費 15 小時的任務,且成功率約 50%。如果這種趨勢持續,一年內普通模型就可能具備目前最先進模型的能力。在智能合約領域,研究已證明最新模型可識別並利用漏洞,從實際運行的智能合約中窃取數百萬美元,同樣呈指數增長。講者引用了歷史例子(CPU 速度增長、太陽能部署預測失誤)來說明人們常常低估指數增長的威力,即使指數增長最終會放緩,但放緩時機難以預測,不應被視為已在眼前。

這導向的結論令人警醒:過去 20 年攻擊者和防守方之間的良好平衡正在被打破。講者本人已收集了數百個未驗證的 Linux 核心潛在漏洞,因缺乏人力而無法向開發者發布。他呼籲安全社區立即動員,建立快速漏洞驗證和修復的防禦體系。短期內的過渡階段可能非常危險——當自動化漏洞發現工具在防守方尚未準備好的情況下進入惡意行為者手中時。講者強調接下來幾個月至關重要,需要來自全球的安全人才加入防禦工作,無論效力於哪家公司。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性