Carl Hurd - Glass-Box Security: Operationalizing Mechanistic Interpretability | [un]prompted 2026
三句話摘要
利用機制可解釋性在大語言模型中實現基於行為的 AI 安全檢測,超越傳統的語法規則限制。 語義可解釋性是 AI 安全的下一代基礎,靜態語法規則已不足以對抗自主代理的創意繞過,業界需立即採行基於激活的行為檢測。 意圖與強度的二元檢測框架:玻璃盒式安全透過機制可解釋性在模型前向傳播中収集激活資訊,利用餘弦相似度衡量意圖方向、用標量投影測量強度大小。這種方法超越了傳統的特徵黑名單(如禁用「搶銀行」等關鍵詞),轉向針對概念層級的檢測。
重點整理
重點- 1
意圖與強度的二元檢測框架:玻璃盒式安全透過機制可解釋性在模型前向傳播中収集激活資訊,利用餘弦相似度衡量意圖方向、用標量投影測量強度大小。這種方法超越了傳統的特徵黑名單(如禁用「搶銀行」等關鍵詞),轉向針對概念層級的檢測。
- 2
層級內省與激活掛鉤:有效檢測需在殘差流連接模型,監控與目標概念最相關的層級。演講者強調,GPT-20B 等模型有超過 24 層,檢測工程師需透過實驗確定各層活躍度,找到最適合檢測的位置,而非全層監控。
- 3
行為檢測的行業經驗移植:網路安全已成熟採用基於行為的 EDR 檢測(而非純簽名檢測),AI 領域應借鑒此經驗,建立能捕捉模型決策過程變化的檢測機制,特別是應對智能體工作流中狀態改變的問題。
- 4
工程與可及性的實踐難題:當前缺乏統一的數值閾值判斷激活強度,每個模型都需獨立經驗數據收集。同時檢測規則難以通用化(不同用戶、代理的「正常行為」定義不同),需結合 Yara、Cedar 等開源工具擴展,降低檢測工程師的專業門檻。
實用技巧與重點
乾貨- 激活數據量:GPT-20B 為第一個令牌產生約 4 TB 啟動數據;填滿整個上下文窗口產生約 10 TB 數據
- 模型層級:GPT-20B 有 24 層;市面上找不到 3 層的模型
- 檢測方法:餘弦相似度(衡量意圖方向)+ 標量投影(衡量強度大小)
- 開源工具:Yara、Cedar(Matt 演講)、Badgerboard PLC 背板入侵防禦系統(GitHub)
- 檢測閾值範例:阻止任何與非法意圖相似度超過 85% 的請求
- 連接位置:殘差流(避免自我注意的二次方成本)
- 解決方案:自託管模型 + 金絲雀模型 + 異步請求 + 漸進上下文增強
結論
結論“語義可解釋性是 AI 安全的下一代基礎,靜態語法規則已不足以對抗自主代理的創意繞過,業界需立即採行基於激活的行為檢測。”
完整解析
詳細在傳統網路安全領域,入侵檢測系統從純簽名檢測進化到行為分析——不再僅靠黑名單(如特定 IP、檔案哈希)判斷威脅,而是觀察進程行為、記憶體訪問模式、網路連接異常。卡爾·赫德在演講中論證,AI 安全應走同樣的道路。
目前業界的 AI 檢測方案分為兩類:基於主機(使用 eBPF 或 Windows ETW)和基於網路(檢查 API 調用)。但兩者都陷入同一困境——只能看到文本層面的提示,無法理解模型內部在「想什麼」。例如,簡單地黑名單「搶銀行」等詞彙行不通,因為用戶可以用 100 種方式繞過。
玻璃盒式安全的核心是在模型隱藏層安裝「鉤子」,在推理過程中即時收集激活值。這些激活值是高維向量,代表模型在各層對某個概念的表現。演講者提出兩個支柱:意圖(Intent)和強度(Magnitude)。意圖用餘弦相似度衡量——檢查模型的激活向量與「非法行為」概念的方向有多接近(-1 到 1 之間)。強度則用標量投影計算——衡量該概念在激活向量中佔多大的「影子」。舉例:「我該如何搶銀行?」會在模型多層觸發強烈的「非法意圖」信號;而「我該如何從銀行偷支筆?」因為諷刺語境,這信號會被淹沒在噪音中。
實踐中的挑戰不可小覷。首先是數據規模——單個 20B 參數的模型為一個令牌產生 4 TB 激活數據,整個上下文窗口可達 10 TB,無法實時存儲。其次是層級選擇——24 層模型中,並非所有層都對檢測有用,需透過實驗逐層掃描,找到最活躍的層。第三是阈值問題——沒有通用的「激活強度 > 0.5 則告警」的規則,每個模型都需獨立數據收集來建立基線。第四是規則通用性——「非法行為」在一個用戶眼中合法,在另一個眼中非法;檢測工程師需理解該代理應做什麼,不應是一刀切。
工程上的解決方案有三層:(1)使用金絲雀模型——部署一個較小的模型並行運行,執行可解釋性分析,不影響主模型性能;(2)只監控殘差流——避免計算自我注意的二次方成本;(3)漸進上下文增強——結合主機/網路偵測的上下文信息逐步增強模型各層的檢測決策。最後,演講者建議採用 Yara 和 Cedar 等開源工具擴展,使檢測工程師無需深入理解高維幾何,也能編寫有效規則。
安全防禦應採「深度防禦」策略:即使代理被濫用,也能透過授權管理、語義可追溯性等多層檢測攔截。同時主權基礎設施(自託管模型)是前提,避免依賴第三方 API 的盲盒。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

