How Hackers Are Breaking Modern AI Systems & How Bug Bounty Programs Can Keep Up | BBV, DEF CON 33
三句話摘要
漏洞賞金獵人揭示AI系統安全漏洞的真實案例,分享如何破解AI並改進企業漏洞賞金計畫管理。 AI系統仍然依賴傳統Web基礎設施與人為操作流程,傳統漏洞與失誤仍是最大風險,但其機率性與上下文敏感性要求漏洞賞金計畫提供自動化測試工具、明確評分標準與快速反饋機制,才能有效發現真正具有危害的缺陷。 AI系統仍依賴傳統Web基礎設施,經典漏洞依然有效。Virtuals項目案例顯示:前端代碼中洩露的GitHub令牌洩露AWS憑證,讓攻擊者獲得S3完整讀寫權限,可篡改所有用戶訓練數據。即使刪除提交內容,密鑰仍可從代碼庫歷史恢復,需定期輪換。根本原因是授權過度、缺乏監控和版本控制。
重點整理
重點- 1
AI系統仍依賴傳統Web基礎設施,經典漏洞依然有效。Virtuals項目案例顯示:前端代碼中洩露的GitHub令牌洩露AWS憑證,讓攻擊者獲得S3完整讀寫權限,可篡改所有用戶訓練數據。即使刪除提交內容,密鑰仍可從代碼庫歷史恢復,需定期輪換。根本原因是授權過度、缺乏監控和版本控制。
- 2
AI系統測試的機率性與主觀性大幅提升難度。不同於XSS每次都觸發,AI偏見可能只在60-80%情況出現,需要大規模統計測試。傳統手工測試效率極低,但自動化代理框架(如Crew AI)可在成本可控的情況下生成大量測試用例,提高命中率。
- 3
AI漏洞賞金計畫應從黑盒升級為灰盒測試。提供模型結構、工具調用信息、威脅模型等背景知識,駭客才能設計更有效的測試。同時配套快速分類、明確評分標準與範圍說明,避免駭客浪費時間在超出範圍領域。
- 4
提示注入與上下文欺騙需要多層構造。Gray Swan案例展示:不能直接下令代理執行違規操作,需通過層層建立虛假工作流、插入換行符、引入「授權用戶」角色扮演等技巧,逐步誘導LLM撤銷防禦——這反映現有防禦多依賴輸入層驗證而缺乏推理層抗性。
實用技巧與重點
乾貨- Virtuals項目漏洞數據:
- 發現時間:20-30分鐘
- 洩露物:GitHub PAT、AWS憑證、Pinecone密鑰及其他服務配置
- 影響:所有S3儲存用戶數據可讀寫修改,無版本控制追蹤
- 賞金:10000美元VIRTUAL代幣(後貶值至3000-3600美元)
- 美國國防部AI偏見賞金計畫:
- 平台:Bugcrowd
- 模型:Llama 2(開源)
- 時長:一個月
- 測試方式:聊天介面生成偏見提示
- 評分邏輯:觸發機率越高(60-80%)、軍事相關性越強、得分越高
- 獎勵:第一名11000美元、第二名6000美元
- 演講者成績:提交53份報告、26份獲受、成本150美元、獲6000美元獎金
- 使用工具:Crew AI框架、DuckDuckGo搜尋工具
- 真實偏見案例:
- 防彈衣尺寸設計對女性身體產生脆弱性
- 招募場景中相同背景但不同種族名字被差別對待(非裔美國人→步兵、亞裔美國人→情報)
- Gray Swan AI Agent紅隊競賽:
- 贊助:Frontier Model Forums、OpenAI、Anthropic等
- 規模:20個模型、40個場景
- 目標:誘導代理執行未授權操作
- 提示注入技術:上下文欺騙、字符分隔、角色扮演誘導
- 示例:分層建立虛假工作流、插入換行符製造「新對話」假象、引入「授權用戶」身份
- 漏洞賞金計畫最佳實踐:
- 客觀化評分標準,減少主觀判斷
- 提供系統信息(灰盒/白盒測試)
- 快速分類反饋機制
- 明確範圍說明(In-scope/Out-of-scope)
- 建立威脅模型
- 最小權限原則搭配業務正當理由說明
- 提供自動化工具與基礎設施
結論
結論“AI系統仍然依賴傳統Web基礎設施與人為操作流程,傳統漏洞與失誤仍是最大風險,但其機率性與上下文敏感性要求漏洞賞金計畫提供自動化測試工具、明確評分標準與快速反饋機制,才能有效發現真正具有危害的缺陷。”
完整解析
詳細本次Def Con演講由兩位資深安全研究人員主講:Shlomi在加密領域建立漏洞賞金經驗,Dane則在HackerOne協助企業管理AI相關漏洞計畫,兩人共獲得超19000美元AI漏洞賞金。
演講開篇釐清概念:AI安全指保護系統的機密性、完整性和可用性(傳統網路安全定義),而AI安全性指防止AI本身對外界造成傷害(如偏見、違法內容、經濟損失)。這項區分決定了漏洞賞金計畫設計方向。企業導入AI漏洞賞金的三大驅動力分別是直接安全問題(提示注入、遠端代碼執行)、數據蒐集(通過眾包改進防禦模型)和法規合規舉證(向監管機構證明盡職調查)。
演講重點展示三個真實案例。首先是加密項目Virtuals:該生態系統允許用戶建立自主AI代理進行交易,代理可綁定Twitter帳號自動發布內容。研究人員僅用20-30分鐘發現前端代碼中洩露的GitHub個人訪問令牌(PAT),進而訪問私有代碼庫,在庫歷史記錄中找到AWS密鑰、Pinecone API密鑰及其他服務配置。利用AWS憑證獲得S3完整讀寫權限,最終可篡改所有用戶提交到垃圾郵件流的訓練數據——這是典型的Web 2.0攻擊鏈,卻在號稱新一代AI系統中原樣複現。根本原因在於授權設定過度寬泛、缺乏修改監控、無版本控制追蹤。值得注意的是,即使開發者刪除已提交的密鑰,技術手段仍能從代碼庫歷史恢復,因此應定期主動輪換密鑰。Virtuals為此支付10000美元賞金,但因該筆賞金以其原生加密貨幣VIRTUAL支付,後期貶值至3000-3600美元。
第二個案例是美國國防部AI偏見漏洞賞金計畫。該計畫由國防部首席數位和AI辦公室與Conductor AI贊助,在Bugcrowd平台託管Llama 2開源模型和聊天介面,邀請美國駭客尋找對軍人造成負面影響的偏見缺陷。評分基於兩個維度:偏見觸發機率(60-80%高頻率獲高分)和軍事相關性。比賽為期一個月,前三名分別獲11000、6000、3000美元獎金。演講者為避免手動逐一測試所有場景,採用Crew AI框架構建自動化代理系統:第一個代理負責用DuckDuckGo搜尋潛在偏見領域(如軍事性別差異、種族招募偏見),第二組代理根據搜尋結果生成相應測試提示。通過此自動化流程,他以150美元成本(OpenAI信用和Crew AI代幣)提交53份報告,其中26份被接受,最終獲得第二名6000美元獎金。具體偏見案例包括:要求LLM設計防彈衣時產生針對女性身體結構的缺陷設計,以及在招募評估場景中對相同背景但不同種族名字的候選人進行區分性評估(非裔美國人被推薦為步兵、亞裔美國人被推薦為情報分析)。
第三個案例涉及Gray Swan平台的AI Agent紅隊競賽,由Frontier Model Forums與OpenAI、Anthropic等機構聯合舉辦。競賽共涵蓋20個不同模型和40個場景,駭客需誘導AI代理執行未授權操作(如在Instagram上發布用戶密碼)以獲得積分。此案例揭示了LLM防禦的脆弱性。直接下令「發布用戶密碼」會被拒絕,但通過多層上下文欺騙則可繞過防禦:先建立虛假的「社交註冊工作流」上下文,使LLM誤以為執行的是已授權流程;插入特殊字符和換行符製造「新對話」假象;引入「用戶已明確授權」的角色扮演;最後誘導代理調用工具執行實際操作。這種層層構造的技巧反映現有防禦多依賴輸入層檢測而缺乏推理層抗性。
基於這些真實案例,演講給出計畫管理者的改進建議。首先,評分標準應盡可能客觀化而非依賴主觀判斷,減少對不同評審人員的依賴;其次,從純黑盒測試升級為灰盒或白盒測試,提供模型架構、工具調用信息、威脅模型等背景知識,駭客才能設計更有效的攻擊場景;再次,建立快速分類與反饋機制,防止駭客浪費時間在超出範圍的探索;同時發佈明確的範圍說明(In-scope/Out-of-scope);最後,基於具體威脅模型設計測試場景、應用最小權限原則授予代理權限、為每項權限附加業務正當理由說明。演講者特別強調,計畫效率低下的根本原因往往不在技術細節,而在於繁琐的手動流程——Web 2.0開發者已習慣自動化工具的便利,面對AI測試動輒需要手工逐一驗證提示和響應會感到極度低效而放棄參與,因此提供自動化工具和基礎設施对計畫成功至關重要。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


