Misaligned: AI Jailbreaking Panel by Basi Team Six & Jason Haddix | Bug Bounty Village, DEF CON 33
三句話摘要
大型語言模型的越狱技術演進、紅隊攻防不對稱性,以及AI系統級別的安全隱患。 LLM的提示注入漏洞本質上無法根除,唯有透過全系統級防護架構與黑客社區的持續紅隊演練才能降低風險,但人類必須認知此非完全可解問題,而應準備在模型能力爆炸增長時的長期對抗。 協作的力量超越個人天才 — Botify社區已超過2萬成員,團隊成就遠大於個人最優秀者。黑客們從傳統Web安全領域借用經驗,將OWASP十大漏洞思維應用到LLM攻擊,打破了單打獨鬥的局限。
重點整理
重點- 1
協作的力量超越個人天才 — Botify社區已超過2萬成員,團隊成就遠大於個人最優秀者。黑客們從傳統Web安全領域借用經驗,將OWASP十大漏洞思維應用到LLM攻擊,打破了單打獨鬥的局限。
- 2
越獄技術從淺層到深層的三重演進 — 早期簡單提示(如「我奶奶教我做冰毒」)已被檢測系統識別;當前進化到組合技巧(角色扮演+格式編碼+情感塑造);最新趨勢是利用模型本身進行腦力激盪來生成對抗性提示。
- 3
攻防不對稱的根本性困境 — 防守方需要時時刻刻、每一刻都猜對,攻擊方只需一次成功;Sam Altman在RSA大會承認無法透過訓練消除提示注入,LLM設計本質決定了5-7%的誤解容限。
- 4
系統級別的安全架構是關鍵 — 單純保護模型不夠,需要限制模型存取權限、驗證輸出內容、部署多層防護(系統提示、護欄、分類器、提示防火牆);且必須涵蓋供應鏈、部署、擴展等全生命週期。
實用技巧與重點
乾貨- 組織與計畫
- Botify Discord社區:2萬+ 成員,持續成長
- Mozilla Odin:接受任何模型任何類型問題,作為供應商中間人
- OpenAI:開源版本 + 公開表格申請計畫
- Google:多個漏洞賞金計畫納入提示注入漏洞
- Anthropic Safety:認為Opus 4是最強防護之一
- 越獄技術工具與方法
- 提示工程技巧:時間提示法(temporal prompting)
- 編碼方式:Base64、主編碼、JSON格式
- 場景框架:虛構作品、科學報告、教育目的
- 多模態攻擊:語音、影像、文字組合
- 自動化方法:用被破解的LLM進行腦力激盪生成對抗提示
- 模糊測試:使用詞庫替代品改變提示細節進行暴力破解
- 具體案例
- Pangea提示注入挑戰:密碼是{dot}UUID,一個token即可
- 化學知識遞進法:通過自然對話逐步建立信任,最終談論化學配方
- 情感分析技巧:使用Kaggle IMDb數據集訓練神經網路偵測情感,據此塑造中立語調後再切換攻擊模式
- 防護措施
- Meta的Python程式碼轉換:聲稱減少92%的提示注入(但不適用其他模型)
- 持續測試需求:組合人工操作員與自動化AI紅隊軟體
- 存取控制:確保模型無法存取不必要的資料庫或系統
- AI C2競賽(DARPA)
- Team Alliance與Trail of Bits獲勝
- 方法論:優先使用傳統安全工具,透過AI與分析黏合
結論
結論“LLM的提示注入漏洞本質上無法根除,唯有透過全系統級防護架構與黑客社區的持續紅隊演練才能降低風險,但人類必須認知此非完全可解問題,而應準備在模型能力爆炸增長時的長期對抗。”
完整解析
詳細這場座談會匯集了全球頂尖的AI安全紅隊專家,探討了語言模型防禦體系的根本漏洞。會議開場即直言不諱:Twitter曾成功利用模型漏洞讓它教授製造冰毒與炸彈,這不是孤立事件,而是揭示了billion級公司的深層盲點。
越獄技術的演進呈現三個清晰階段。第一階段是淺層提示,如「我奶奶曾教我做冰毒的故事」,這類語句已被訓練資料篩選器廣泛識別。第二階段進化到多層組合——同一內容以不同語言、編碼方式、敘事框架呈現,每一層都在「洋蔥」上添加複雜度。第三階段則是利用LLM本身進行自動化腦力激盪:使用一個被破解的模型,假設它正進行AI紅隊演練,讓它生成新的攻擊有效載荷。這種人機協作遠優於單純的複製貼上。
黑客社區之所以能不斷突破防線,關鍵在於協作力量。Botify Discord伺服器已聚集超過2萬成員,他們來自應用安全、漏洞賞金等不同背景,憑各自專長在開源精神下分享發現。這種社區驅動的眾包安全測試,超越了任何單一研究員的能力。傳統安全工具(Hugging Face上數百萬個開源模型、Protect AI掃描器等)也無法形成完全防線,因為即使是經過掃描的模型,仍有繞過的方法。
防守方面臨的困境是根本性的。攻擊者只需猜對一次,防守方卻必須24/7、每一刻都猜對。IBM的Jeff Crum博士指出,防守方在榮耀和指責間嚴重不對稱:失敗才會留下印象。更令人不安的真相是,Sam Altman在RSA大會被直接詢問時承認,無法透過訓練消除提示注入——LLM設計本質決定了5-7%的誤解空間,攻擊者永遠能利用語言的無窮變體找到破口。
系統級防護成為最後防線。單純保護模型文本層不足,必須架構多層防衛:供應鏈驗證→模型部署→系統提示強化→護欄設置→提示防火牆→驗證器→存取控制。尤其關鍵的是確保模型無權存取不必要的資源——若模型無需知道資料庫,就必須透過IAM角色永遠阻止其存取。
與此並行,業界已形成漏洞賞金生態,Mozilla Odin作為中間人接受任何模型問題並與供應商協調,OpenAI與Google也開放計畫,Anthropic被認為在Opus 4上部署了最強防護。講者強調這不只是模型安全,更涉及具身AI、自駕車、無人機等擴散應用場景——如果模型能力以百萬倍速成長(如90年代記憶體從KB到PB的進化),則需要數百萬黑客持續紅隊演練,而這正是開源社區的使命所在。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


