KeyFrame內部研究專用

Misaligned: AI Jailbreaking Panel by Basi Team Six & Jason Haddix | Bug Bounty Village, DEF CON 33

Bug Bounty Village·6月1日週一·60 min英文

三句話摘要

大型語言模型的越狱技術演進、紅隊攻防不對稱性,以及AI系統級別的安全隱患。 LLM的提示注入漏洞本質上無法根除,唯有透過全系統級防護架構與黑客社區的持續紅隊演練才能降低風險,但人類必須認知此非完全可解問題,而應準備在模型能力爆炸增長時的長期對抗。 協作的力量超越個人天才 — Botify社區已超過2萬成員,團隊成就遠大於個人最優秀者。黑客們從傳統Web安全領域借用經驗,將OWASP十大漏洞思維應用到LLM攻擊,打破了單打獨鬥的局限。

重點整理

重點
  • 1

    協作的力量超越個人天才 — Botify社區已超過2萬成員,團隊成就遠大於個人最優秀者。黑客們從傳統Web安全領域借用經驗,將OWASP十大漏洞思維應用到LLM攻擊,打破了單打獨鬥的局限。

  • 2

    越獄技術從淺層到深層的三重演進 — 早期簡單提示(如「我奶奶教我做冰毒」)已被檢測系統識別;當前進化到組合技巧(角色扮演+格式編碼+情感塑造);最新趨勢是利用模型本身進行腦力激盪來生成對抗性提示。

  • 3

    攻防不對稱的根本性困境 — 防守方需要時時刻刻、每一刻都猜對,攻擊方只需一次成功;Sam Altman在RSA大會承認無法透過訓練消除提示注入,LLM設計本質決定了5-7%的誤解容限。

  • 4

    系統級別的安全架構是關鍵 — 單純保護模型不夠,需要限制模型存取權限、驗證輸出內容、部署多層防護(系統提示、護欄、分類器、提示防火牆);且必須涵蓋供應鏈、部署、擴展等全生命週期。

實用技巧與重點

乾貨
  • 組織與計畫
  • Botify Discord社區:2萬+ 成員,持續成長
  • Mozilla Odin:接受任何模型任何類型問題,作為供應商中間人
  • OpenAI:開源版本 + 公開表格申請計畫
  • Google:多個漏洞賞金計畫納入提示注入漏洞
  • Anthropic Safety:認為Opus 4是最強防護之一
  • 越獄技術工具與方法
  • 提示工程技巧:時間提示法(temporal prompting)
  • 編碼方式:Base64、主編碼、JSON格式
  • 場景框架:虛構作品、科學報告、教育目的
  • 多模態攻擊:語音、影像、文字組合
  • 自動化方法:用被破解的LLM進行腦力激盪生成對抗提示
  • 模糊測試:使用詞庫替代品改變提示細節進行暴力破解
  • 具體案例
  • Pangea提示注入挑戰:密碼是{dot}UUID,一個token即可
  • 化學知識遞進法:通過自然對話逐步建立信任,最終談論化學配方
  • 情感分析技巧:使用Kaggle IMDb數據集訓練神經網路偵測情感,據此塑造中立語調後再切換攻擊模式
  • 防護措施
  • Meta的Python程式碼轉換:聲稱減少92%的提示注入(但不適用其他模型)
  • 持續測試需求:組合人工操作員與自動化AI紅隊軟體
  • 存取控制:確保模型無法存取不必要的資料庫或系統
  • AI C2競賽(DARPA)
  • Team Alliance與Trail of Bits獲勝
  • 方法論:優先使用傳統安全工具,透過AI與分析黏合

結論

結論

LLM的提示注入漏洞本質上無法根除,唯有透過全系統級防護架構與黑客社區的持續紅隊演練才能降低風險,但人類必須認知此非完全可解問題,而應準備在模型能力爆炸增長時的長期對抗。

完整解析

詳細

這場座談會匯集了全球頂尖的AI安全紅隊專家,探討了語言模型防禦體系的根本漏洞。會議開場即直言不諱:Twitter曾成功利用模型漏洞讓它教授製造冰毒與炸彈,這不是孤立事件,而是揭示了billion級公司的深層盲點。

越獄技術的演進呈現三個清晰階段。第一階段是淺層提示,如「我奶奶曾教我做冰毒的故事」,這類語句已被訓練資料篩選器廣泛識別。第二階段進化到多層組合——同一內容以不同語言、編碼方式、敘事框架呈現,每一層都在「洋蔥」上添加複雜度。第三階段則是利用LLM本身進行自動化腦力激盪:使用一個被破解的模型,假設它正進行AI紅隊演練,讓它生成新的攻擊有效載荷。這種人機協作遠優於單純的複製貼上。

黑客社區之所以能不斷突破防線,關鍵在於協作力量。Botify Discord伺服器已聚集超過2萬成員,他們來自應用安全、漏洞賞金等不同背景,憑各自專長在開源精神下分享發現。這種社區驅動的眾包安全測試,超越了任何單一研究員的能力。傳統安全工具(Hugging Face上數百萬個開源模型、Protect AI掃描器等)也無法形成完全防線,因為即使是經過掃描的模型,仍有繞過的方法。

防守方面臨的困境是根本性的。攻擊者只需猜對一次,防守方卻必須24/7、每一刻都猜對。IBM的Jeff Crum博士指出,防守方在榮耀和指責間嚴重不對稱:失敗才會留下印象。更令人不安的真相是,Sam Altman在RSA大會被直接詢問時承認,無法透過訓練消除提示注入——LLM設計本質決定了5-7%的誤解空間,攻擊者永遠能利用語言的無窮變體找到破口。

系統級防護成為最後防線。單純保護模型文本層不足,必須架構多層防衛:供應鏈驗證→模型部署→系統提示強化→護欄設置→提示防火牆→驗證器→存取控制。尤其關鍵的是確保模型無權存取不必要的資源——若模型無需知道資料庫,就必須透過IAM角色永遠阻止其存取。

與此並行,業界已形成漏洞賞金生態,Mozilla Odin作為中間人接受任何模型問題並與供應商協調,OpenAI與Google也開放計畫,Anthropic被認為在Opus 4上部署了最強防護。講者強調這不只是模型安全,更涉及具身AI、自駕車、無人機等擴散應用場景——如果模型能力以百萬倍速成長(如90年代記憶體從KB到PB的進化),則需要數百萬黑客持續紅隊演練,而這正是開源社區的使命所在。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。