KeyFrame內部研究專用

Mohamed Nabeel - Detecting GenAI Threats at Scale with YARA-Like Semantic Rules | [un]prompted 2026

unprompted·3月25日週三·19 min英文

三句話摘要

使用 SuperYara 庫透過語義匹配與多層防禦檢測生成式 AI 威脅 採用分層防禦與預過濾的 SuperYara 庫,可在不犧牲檢測效率的前提下,將 AI 威脅大規模檢測的成本和時間降低 99% 與小時級至分鐘級。 GenAI 威脅的核心形式是提示注入:攻擊者透過查詢參數、哈希值甚至動態瀏覽器執行來觸發提示注入,傳統防火牆無法攔截因為威脅發生在瀏覽器內部,Yara 規則難以捕捉所有變異情況。

重點整理

重點
  • 1

    GenAI 威脅的核心形式是提示注入:攻擊者透過查詢參數、哈希值甚至動態瀏覽器執行來觸發提示注入,傳統防火牆無法攔截因為威脅發生在瀏覽器內部,Yara 規則難以捕捉所有變異情況。

  • 2

    SuperYara 提供語義層級檢測能力:相比傳統 Yara 規則需要手寫所有變異型態,SuperYara 只需用自然語言描述要捕捉的內容,庫在內部進行語義匹配,自動理解「不要執行」和「禁止執行」的等效性。

  • 3

    分層防禦平衡成本與效率:透過結合 Yara 規則(快速、便宜)、語義相似度(中等成本)、分類器(較貴)、LLM 規則(最貴但最準確)的多層構架,可在不同威脅複雜度下自動選擇合適檢測方法,並將成本降低約 50%。

  • 4

    預過濾模式大幅優化大規模處理:將便宜的字串或分類器規則作為預過濾器,只將候選樣本送至昂貴的 LLM 檢測,可將處理時間從數小時縮短至數分鐘,每 10,000 個 URL 的成本從 $750 降至 $13.50。

實用技巧與重點

乾貨
  • SuperYara 規則四種類型
  • String:字串匹配(與傳統 Yara 相似)
  • Similarity:語義相似度分析
  • Classifier:二元或多類分類器(如公開的 HuggingFace 釣魚檢測器)
  • LLM:自訂 LLM 提示作為檢測引擎
  • 檢測效率數據
  • 傳統 Yara 規則檢測:50% 威脅
  • 語義相似度+分類器檢測:45-48% 額外威脅
  • 分層防禦成本降幅:約 50%
  • 預過濾成本降幅:約 99%
  • 性能指標
  • LLM 操作平均耗時:4.5 秒/請求
  • 分類器耗時:0.5 秒/請求
  • 10,000 個 URL 處理時間:從「數小時」→「數分鐘」
  • Gemini 2.5 Pro 成本:10,000 請求從 $750 → $13.50(預過濾後)
  • 支持的模型
  • 任何公開 LLM(Gemini、OpenAI)
  • 本地託管模型(如 Ollama)
  • 自訂分類器和語義相似度方法
  • 可插拔組件
  • Cleaner(清理器):移除 HTML 裝飾、冗餘資訊
  • Chunker(分塊器):按句子、段落或重疊方式分塊文檔
  • 安裝與部署
  • 開源,GitHub 可取
  • 安裝:`pip install sara`
  • 官網:sara.org(含完整範例與文檔)

結論

結論

採用分層防禦與預過濾的 SuperYara 庫,可在不犧牲檢測效率的前提下,將 AI 威脅大規模檢測的成本和時間降低 99% 與小時級至分鐘級。

完整解析

詳細

安全研究團隊面臨的傳統困境是:Yara 規則是檢測惡意軟體的金牌標準,已被廣泛應用於 Palo Alto Networks 等企業,每日檢測數百萬個樣本。但隨著生成式 AI 成為主流,新型威脅不再是二進制或腳本,而是自然語言驅動的提示注入與模型冒充攻擊。傳統 Yara 對此無能為力。

講者以新創公司 SafeIntel.ai 的案例說明問題:該公司的首席工程師試圖用 Yara 規則防止用戶透過查詢參數濫用 API。她發現規則迅速失控——操作參數數量激增,捕捉所有提示注入變異極其困難,且容易誤報和漏報。轉機出現於發現 SuperYara 庫,她只用兩行代碼就完成了同樣功能,因為庫能透過自然語言理解自動捕捉語義等效的攻擊(例如「不要執行」和「禁止執行」被視為同一威脅)。

SuperYara 的核心創新是多層檢測架構。第一層是傳統字串匹配(快速、成本低),若匹配失敗進入第二層語義相似度(中等成本),再次失敗則調用分類器,最後回退至 LLM 規則(最貴但最準確)。實驗顯示傳統規則檢測 50% 威脅,剩餘 45-48% 需靠語義和分類器檢測,但不能單獨使用 LLM(成本過高),分層架構將成本控制在約 50% 的水平。

預過濾模式進一步優化大規模檢測:用分類器(如公開的 HuggingFace 釣魚檢測器)作首輪過濾,雖然會產生誤報,但高召回率使其適合預過濾角色。只有通過預過濾的樣本才進入昂貴的 LLM 檢測。實例數據顯示,處理 10,000 個 URL 時,這一方法將耗時從數小時壓至數分鐘,成本從 $750 劇降至 $13.50(使用 Gemini 2.5 Pro)——這對日常處理數百萬 URL 的防禦團隊至關重要。

講者強調 SuperYara 的可插拔設計遵循工廠模式,每個組件(分類器、分塊器、清理器等)都可替換,用戶可將原始 HTML 透過清理器移除冗餘信息,再由分塊器按段落或重疊方式分割,而無需修改規則本身。庫支持任何公開 LLM 或本地託管模型(如 Ollama),完全開源,透過 `pip install sara` 輕鬆安裝。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性