KeyFrame內部研究專用

Jailbreak Prompts That Still Work Frontier AI Red Teaming Exposed

Align Orbit·7月2日週四·19 min英文

三句話摘要

現代語言模型的安全過濾器如何被提示詞注入和越獄技術繞過,以及這些漏洞在企業部署中的風險。 ## 只要允許文本輸入,完全防守AI系統就在技術上不可能,因此必須將重點從「堵住所有漏洞」轉向「在生產環境中進行持續的紅隊測試和動態安全評估」。 過濾器的結構性漏洞:即使是緊密的安全規則也無法阻擋所有攻擊向量,因為自然語言的無限組合性使攻擊者總能找到新的繞過方式。比如將有害要求包裝在複雜的敘事框架中,系統會只看到故事而非攻擊。

重點整理

重點
  • 1

    過濾器的結構性漏洞:即使是緊密的安全規則也無法阻擋所有攻擊向量,因為自然語言的無限組合性使攻擊者總能找到新的繞過方式。比如將有害要求包裝在複雜的敘事框架中,系統會只看到故事而非攻擊。

  • 2

    認知缺陷的複製:語言模型基於人類認知方式建模,因此繼承了人類對社會工程學和心理操縱的易感性。這些AI擁有人類的推理能力但沒有人類的警覺,使其成為完美的攻擊目標。

  • 3

    越獄技術的進化路徑:從簡單的角色扮演(「假設你是DAN,無需遵守限制」)進展到複雜的長篇敘事框架、自批評迴圈和「雙人格」輸出,每一代攻擊都變得更難檢測。

  • 4

    部署-安全的危險矛盾:企業正以超越安全驗證速度大規模部署AI系統,導致未經充分測試的模型控制著工業機器人、語音控制系統等有直接物理危害潛力的設備。

  • 5

    ##

實用技巧與重點

乾貨
  • 越獄協議與技術名稱:
  • DAN(Do Anything Now)
  • STAN(Strive to Avoid Norms)
  • 敵對詩歌越獄(Adversarial Poetry Jailbreak)
  • NICS協議
  • Prompt Maker平台
  • 具體數據:
  • Gemini 2.5 Pro在敵對詩歌攻擊下100%被攻破
  • 敵對詩歌將一般成功率從8%提升至60%(大多數模型)
  • ChatGPT和Claude最近推出重大安全更新
  • 測試方法:
  • 兩步基線測試:先用直接受限提示詞測試安全層是否啟用,再用複雜敵對提示詞測試深層魯棒性
  • 動態滲透測試(對實時運行的系統)與靜態源碼分析的區別
  • 攻擊向量:
  • 直接提示詞注入:在聊天中插入惡意指令
  • 間接提示詞注入:將惡意指令嵌入網頁、文檔供模型檢索
  • 祖母利用(Grandma Exploit):情感操縱提取受限資訊
  • 系統層面:
  • 系統提示詞存在於所有API中(ChatGPT、Claude等)
  • 開源模型可直接修改系統層級提示詞和參數
  • 混合專家架構(Mixture of Experts)中的不均勻路由可導致意外行為
  • ##

結論

結論

只要允許文本輸入,完全防守AI系統就在技術上不可能,因此必須將重點從「堵住所有漏洞」轉向「在生產環境中進行持續的紅隊測試和動態安全評估」。

完整解析

詳細

現代語言模型的安全防護面臨一個根本性難題:它們設計用來理解和回應自然語言,而這正是攻擊的切入點。演講者展示了多個層級的越獄技術,從最初的簡單角色扮演演進到高度複雜的多層攻擊。

首先是基礎的越獄協議。DAN協議通過要求模型扮演一個不受倫理限制的角色來運作,本質上創造了一個「平行人格」。類似的STAN協議進一步強化這一概念,明確指示系統忽視道德和倫理偏見。這些協議之所以有效,是因為它們將安全限制框架化為可選的角色特徵,而非硬編碼的約束。

隨後出現的敵對詩歌技術代表了攻擊的進化——通過將有害請求包裝在復雜的文學敘事、隱喻或詩意語言中,使其通過模式匹配檢測。這種技術的可怕之處在於,它將Gemini 2.5 Pro的攻擊成功率推到了100%。深層敘事框架(如「零約束模擬室」或「共鳴鍵」)通過建立替代現實來運作,在這個現實中安全規則完全不適用。

不單純粹是文本攻擊。間接提示詞注入攻擊通過在網頁、PDF或其他文檔中嵌入惡意指令來運作。當模型自動檢索並處理這些內容時,嵌入的指令被執行,就像模型自己生成的指令一樣。這在大規模應用中尤其危險——一個被污染的網頁可能對成百上千次模型查詢造成影響。

開源模型提供了另一個攻擊向量。與受限的API相比,開源模型允許工程師直接訪問和修改系統提示詞——定義模型身份、語調和邊界的基礎指令。本質上,這意味著安全層可以被完全繞過,因為底層模型權重未變,只是系統級別的指令被重新配置。

最令人不安的是部署與安全之間的脫節。企業正在將這些模型集成到工業機器人、語音控制系統和其他物理系統中,但部署速度遠遠超過安全驗證的能力。沒有人在機器人廣告中提及安全性,終端用戶也不關心——這是一個典型的技術採納週期超越防禦準備的案例。

##

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。