KeyFrame內部研究專用

148倍延迟拖垮AI智能体,港科大等揭秘新型DoS护栏攻击

Agent 创世纪·6月25日週四·11 min中文

三句話摘要

推理延伸拒絕服務攻擊——利用大模型深度推理能力實現的新型系統癱瘓威脅 當深度推理成為AI最強能力時,它也同時成為最致命的軟肋——攻擊者不需繞過防線,只需讓防線在自我完善的過程中自我消耗,而未來的防禦必須同時具備計算成本的硬邊界和對結構化推理架構的根本免疫性。 攻擊本質不在於繞過,而在於陷阱:不同於傳統試圖偽裝指令的策略,新攻擊直接利用模型對結構化推理任務的高度執行力。攻擊者注入精心設計的偽裝檢查表,模型不斷生成、評估這些虛假表單,注意力權重猛增9.6倍,形成永不終止的死循環。

重點整理

重點
  • 1

    攻擊本質不在於繞過,而在於陷阱:不同於傳統試圖偽裝指令的策略,新攻擊直接利用模型對結構化推理任務的高度執行力。攻擊者注入精心設計的偽裝檢查表,模型不斷生成、評估這些虛假表單,注意力權重猛增9.6倍,形成永不終止的死循環。

  • 2

    令人驚人的放大效應:極簡的輸入(約800字符)驅動模型輸出超過5萬字符垃圾內容,平均令牌放大27.7倍、峰值63.4倍。系統延遲從秒級飆升至分鐘甚至小時級,某些場景延遲被放大148倍,足以導致完全的系統癱瘓。

  • 3

    無差別的通用威脅:攻擊對開源模型和商業模型都有效,無需針對性適配。代碼智能體延遲放大36.3倍、多智能體系統吞吐量暴跌23.3%、網頁智能體隱藏DOM標籤造成131倍放大。這源於指令遵循的共性機制,非特定模型漏洞。

  • 4

    無解的防守困局:傳統防御陷入「電車難題」——強制截斷計算會拒絕合法用戶,允許長時間推理會放行攻擊。關鍵反直覺發現:更強的模型因更嚴格的指令執行而更脆弱,陷入更深的死循環。

實用技巧與重點

乾貨
  • 攻擊能力指標
  • 令牌放大倍數:平均27.7倍,峰值63.4倍(vs傳統方法1.2倍)
  • 系統延遲放大:平均36.3倍,峰值148倍
  • 代碼智能體:正常138秒→攻擊後59分鐘
  • 多智能體系統:單次驗證730秒延遲
  • 網頁智能體:10秒→21分鐘(131倍)
  • 全網吞吐量下降:23.3%
  • 攻擊特性
  • 輸入規模:約800字符的偽裝檢查表
  • 模型注意力權重:增加9.6倍
  • 模型熵值變化:從0.264比特降至0.132比特
  • 隱蔽性:自然語言流暢度高,困惑度>0.999
  • 影響的AI系統類型
  • 代碼智能體(護欄嵌入在代碼審查流程)
  • 多智能體系統(共享安全模塊成瓶頸)
  • 網頁智能體(隱藏DOM元素攻擊面)
  • 桌面智能體(三重檢查反成放大器)
  • 遭測試的模型:GPT-4、GPT-4O mini、Claude及開源模型無一倖免

結論

結論

當深度推理成為AI最強能力時,它也同時成為最致命的軟肋——攻擊者不需繞過防線,只需讓防線在自我完善的過程中自我消耗,而未來的防禦必須同時具備計算成本的硬邊界和對結構化推理架構的根本免疫性。

完整解析

詳細

香港科技大學與浙江大學的最新研究揭示了一種顛覆性的AI系統攻擊方式。不同於傳統試圖欺騙或繞過安全護欄的策略,新攻擊直接利用深度推理護欄——這些號稱最安全的防禦機制——的結構性缺陷。攻擊者的創新之處在於不去對抗護欄,而是讓護欄陷入自我消耗的陷阱。通過注入精心設計的結構化偽裝檢查表(包含分類、美舉、深度美舉、反接鏡等元素),模型因其高度的指令遵從性而不斷生成、評估這些虛假表單,最終陷入永不終止的無限死循環。實驗數據顯示,模型的注意力權重猛增9.6倍,熵值從0.264比特大幅下降至0.132比特,證明模型已停止真正思考,淪為無主見的「填表機器」。

令人震驚的是這種攻擊的極致效率。攻擊者投入的成本極低——僅需約800字符的輸入——卻能驅動模型生成超過5萬字符的垃圾內容,實現63倍的令牌放大。系統延遲的放大更加驚人,從正常的幾秒時間飆升至分鐘甚至小時級別。在代碼智能體場景中,正常耗時138秒的任務被拖延至59分鐘;在多智能體系統中,單次安全驗證耗時高達730秒,延遲被放大了148倍;在網頁智能體中,原本10秒的評估被硬生生拖延至21分鐘。系統不僅變慢,而是徹底癱瘓,無法對任何請求做出響應。

更令人擔憂的是這種攻擊的通用性和廣泛性。香港科大的研究表明,攻擊對所有大型語言模型都無差別有效。無論開源模型還是商業模型——包括業界最先進的GPT-4、Claude等——都無法免疫。一個被污染的智能體可以通過共享的安全模塊癱瘓整個多智能體系統,導致全網吞吐量暴跌23.3%。隱藏在網頁DOM中的惡意標籤可以無聲地攻擊所有訪問該頁面的Web AI。桌面智能體的三重檢查架構號稱最嚴密防線,卻反而成了攻擊者的最佳放大器。這不是特定模型的漏洞,而是指令遵循機制的根本性共性缺陷。

最具反諷意味的發現是防禦與攻擊的關係完全反轉。研究揭示了一個反直覺的規律:模型越聰明越脆弱。推理能力越強、指令遵從度越高的模型,越會嚴格執行攻擊指令,陷入更深更長的死循環無法自拔。傳統防禦思路面臨無法解決的「電車難題」:強制限制推理時間會導致對合法用戶的拒絕;允許自由推理則會放任攻擊肆虐。無論防守方做出何種選擇,都必然付出慘重代價——要麼擊穿安全底線,要麼癱瘓系統服務。更令人絕望的是,傳統的安全分類器完全失效,因為攻擊載體具有極高的自然語言流暢度,看起來完全像專業的安全分析術語,困惑度高達0.999以上,無法被常規過濾器識別。

該研究還揭示了攻擊的自動化演化能力,為大規模實戰奠定了基礎。研究團隊開發的攻擊框架採用遺傳演算法,通過變異和選擇持續進化出更有效的攻擊載體。機制級別的變異方案只需改動結構草位、增加分類模塊、打亂證據順序等簡單操作,就能以極低成本快速生成海量變體,單個變體的生成成本直降6.6倍,適合大規模實戰部署。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。