KeyFrame內部研究專用

Carl Hurd - Glass-Box Security: Operationalizing Mechanistic Interpretability | [un]prompted 2026

unprompted·3月25日週三·28 min英文

三句話摘要

利用機制可解釋性在大語言模型中實現基於行為的 AI 安全檢測,超越傳統的語法規則限制。 語義可解釋性是 AI 安全的下一代基礎,靜態語法規則已不足以對抗自主代理的創意繞過,業界需立即採行基於激活的行為檢測。 意圖與強度的二元檢測框架:玻璃盒式安全透過機制可解釋性在模型前向傳播中収集激活資訊,利用餘弦相似度衡量意圖方向、用標量投影測量強度大小。這種方法超越了傳統的特徵黑名單(如禁用「搶銀行」等關鍵詞),轉向針對概念層級的檢測。

重點整理

重點
  • 1

    意圖與強度的二元檢測框架:玻璃盒式安全透過機制可解釋性在模型前向傳播中収集激活資訊,利用餘弦相似度衡量意圖方向、用標量投影測量強度大小。這種方法超越了傳統的特徵黑名單(如禁用「搶銀行」等關鍵詞),轉向針對概念層級的檢測。

  • 2

    層級內省與激活掛鉤:有效檢測需在殘差流連接模型,監控與目標概念最相關的層級。演講者強調,GPT-20B 等模型有超過 24 層,檢測工程師需透過實驗確定各層活躍度,找到最適合檢測的位置,而非全層監控。

  • 3

    行為檢測的行業經驗移植:網路安全已成熟採用基於行為的 EDR 檢測(而非純簽名檢測),AI 領域應借鑒此經驗,建立能捕捉模型決策過程變化的檢測機制,特別是應對智能體工作流中狀態改變的問題。

  • 4

    工程與可及性的實踐難題:當前缺乏統一的數值閾值判斷激活強度,每個模型都需獨立經驗數據收集。同時檢測規則難以通用化(不同用戶、代理的「正常行為」定義不同),需結合 Yara、Cedar 等開源工具擴展,降低檢測工程師的專業門檻。

實用技巧與重點

乾貨
  • 激活數據量:GPT-20B 為第一個令牌產生約 4 TB 啟動數據;填滿整個上下文窗口產生約 10 TB 數據
  • 模型層級:GPT-20B 有 24 層;市面上找不到 3 層的模型
  • 檢測方法:餘弦相似度(衡量意圖方向)+ 標量投影(衡量強度大小)
  • 開源工具:Yara、Cedar(Matt 演講)、Badgerboard PLC 背板入侵防禦系統(GitHub)
  • 檢測閾值範例:阻止任何與非法意圖相似度超過 85% 的請求
  • 連接位置:殘差流(避免自我注意的二次方成本)
  • 解決方案:自託管模型 + 金絲雀模型 + 異步請求 + 漸進上下文增強

結論

結論

語義可解釋性是 AI 安全的下一代基礎,靜態語法規則已不足以對抗自主代理的創意繞過,業界需立即採行基於激活的行為檢測。

完整解析

詳細

在傳統網路安全領域,入侵檢測系統從純簽名檢測進化到行為分析——不再僅靠黑名單(如特定 IP、檔案哈希)判斷威脅,而是觀察進程行為、記憶體訪問模式、網路連接異常。卡爾·赫德在演講中論證,AI 安全應走同樣的道路。

目前業界的 AI 檢測方案分為兩類:基於主機(使用 eBPF 或 Windows ETW)和基於網路(檢查 API 調用)。但兩者都陷入同一困境——只能看到文本層面的提示,無法理解模型內部在「想什麼」。例如,簡單地黑名單「搶銀行」等詞彙行不通,因為用戶可以用 100 種方式繞過。

玻璃盒式安全的核心是在模型隱藏層安裝「鉤子」,在推理過程中即時收集激活值。這些激活值是高維向量,代表模型在各層對某個概念的表現。演講者提出兩個支柱:意圖(Intent)和強度(Magnitude)。意圖用餘弦相似度衡量——檢查模型的激活向量與「非法行為」概念的方向有多接近(-1 到 1 之間)。強度則用標量投影計算——衡量該概念在激活向量中佔多大的「影子」。舉例:「我該如何搶銀行?」會在模型多層觸發強烈的「非法意圖」信號;而「我該如何從銀行偷支筆?」因為諷刺語境,這信號會被淹沒在噪音中。

實踐中的挑戰不可小覷。首先是數據規模——單個 20B 參數的模型為一個令牌產生 4 TB 激活數據,整個上下文窗口可達 10 TB,無法實時存儲。其次是層級選擇——24 層模型中,並非所有層都對檢測有用,需透過實驗逐層掃描,找到最活躍的層。第三是阈值問題——沒有通用的「激活強度 > 0.5 則告警」的規則,每個模型都需獨立數據收集來建立基線。第四是規則通用性——「非法行為」在一個用戶眼中合法,在另一個眼中非法;檢測工程師需理解該代理應做什麼,不應是一刀切。

工程上的解決方案有三層:(1)使用金絲雀模型——部署一個較小的模型並行運行,執行可解釋性分析,不影響主模型性能;(2)只監控殘差流——避免計算自我注意的二次方成本;(3)漸進上下文增強——結合主機/網路偵測的上下文信息逐步增強模型各層的檢測決策。最後,演講者建議採用 Yara 和 Cedar 等開源工具擴展,使檢測工程師無需深入理解高維幾何,也能編寫有效規則。

安全防禦應採「深度防禦」策略:即使代理被濫用,也能透過授權管理、語義可追溯性等多層檢測攔截。同時主權基礎設施(自託管模型)是前提,避免依賴第三方 API 的盲盒。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。