KeyFrame內部研究專用

SecTor 2025 | What Happens When Your Digital Voice Clone Goes Rogue

Black Hat·4月17日週五·49 min英文

三句話摘要

Microsoft 資安團隊對 Windows「Speak for Me」語音複製功能進行滲透測試,揭露無法在通用 PC 上安全部署 AI 語音模型的根本困境。 AI 語音複製功能在通用 PC 上的根本安全困境不在於可修補的程式漏洞,而在於 runtime 記憶體保護與周邊硬體安全尚未成熟——在防禦技術跟上之前,暫緩發布本身就是一種工程責任。 1. 可修復漏洞不是取消原因

重點整理

重點
  • 1

    1. 可修復漏洞不是取消原因

  • 2

    後端 API 接受攻擊者自訂 reference text 參數,可用任意人的錄音訓練模型;雲端 blob storage 僅以資料夾區隔用戶、缺乏權限控制且模型加密金鑰與模型共存。這些漏洞技術上皆可修補,但修補後問題依然存在。

  • 3

    2. Runtime 保護是根本瓶頸

  • 4

    模型無論如何加密,推理時必須解密載入記憶體;任何跑在同一機器上的惡意程式都能從記憶體 dump 模型,或在浮水印機制執行前就將其禁用。VBS Enclave 可提升防護層級,但面對 kernel 層 privilege escalation 仍不夠穩固。

  • 5

    3. 聲音資產本身無法被圍住

  • 6

    即使模型保護做到位,攻擊者可繞過整個 Windows 基礎設施,直接用麥克風錄製的聲音素材(最短 15 秒)在外部開源或商業平台訓練模型,完全不受任何 Windows 端的防護機制約束。

  • 7

    4. AI 時代需要「把壞 AI 關在裡面」的新思維

  • 8

    現有 AI 安全焦點是防止外部入侵,但當 AI 功能本身強大到足以大規模冒充身分,防護思維必須轉向:確保 AI 的輸出與能力無法被濫用,有時最負責任的做法是暫緩發布。

實用技巧與重點

乾貨
  • 數字與成本
  • 模型訓練需約 1 小時(雲端)
  • 外部開源工具最少需 15 秒聲音即可訓練語音複製模型
  • VBS 技術自 2015–2016 年起存在於 Windows
  • VBS 支援最多 16 個 VTL(Virtual Trust Level)
  • VBS Enclave SDK 自 2024 年開放第三方開發者使用
  • 工具與技術名稱
  • Speak for Me:Windows 語音複製無障礙功能(已取消)
  • Custom Neural Voice (CNV):Azure 語音模型訓練服務,目前對選定客戶開放
  • Azure API Management Gateway:IP filtering、rate limiting 保護
  • Azure Blob Storage:模型雲端備份儲存
  • DPAPI:Windows 本地加密金鑰保護庫
  • VBS(Virtualization Based Security):基於 Hyper-V 的隔離執行環境
  • VBS Enclave / Trustlet:VTL 1 安全執行隔離模組
  • TPM(Trusted Platform Module):硬體金鑰封存
  • Confidential VM:依賴 Intel TDX 或 AMD SEV-SNP 的記憶體加密 VM
  • Azure Key Vault + Secure Key Release:搭配 attestation 的金鑰管理方案
  • Windows S Mode:僅允許 Windows Store 應用的鎖定版 Windows
  • Microsoft Pluton:整合於 Surface 等裝置的安全處理器
  • Personal Data Encryption (PDE) API:Windows 生物辨識保護 API
  • Windows Recall:另一個具高風險的 Windows AI 功能(已發布)
  • 漏洞清單
  • 後端 reference text 參數可注入任意文字→繞過聲音驗證
  • Azure Blob Storage 路徑穿越漏洞→存取任意用戶模型與訓練資料
  • 加密金鑰與模型存放於同一 storage
  • 浮水印機制使用固定 seed 的弱隨機數生成器
  • 無 certificate pinning(中間人攻擊風險)
  • MSIX 套件缺乏模型完整性驗證→遠端代碼執行風險
  • Windows Push Notification Service 控制權漏洞→可觸發全域 DoS
  • 無限循環建立/刪除模型帳號→造成 Microsoft 財務損失

結論

結論

AI 語音複製功能在通用 PC 上的根本安全困境不在於可修補的程式漏洞,而在於 runtime 記憶體保護與周邊硬體安全尚未成熟——在防禦技術跟上之前,暫緩發布本身就是一種工程責任。

完整解析

詳細

「Speak for Me」是 Microsoft 為漸進式失聲患者設計的 Windows 無障礙功能,允許用戶在聲音消失前錄製自己的聲音,並在之後以個人化語音模型通過鍵盤輸入發話。功能整合至 Windows 文字轉語音 SDK,可作為虛擬麥克風與 Teams 等應用無縫協作。由於這項技術同時具備強大的合法用途與被濫用的潛力,Microsoft Storm 資安研究團隊一年前對其進行了完整的滲透測試。

技術架構上,桌面客戶端透過 Azure API Management Gateway 與後端 Speak for Me 服務通訊,後端再呼叫 Custom Neural Voice 服務進行模型訓練。訓練完成的模型以加密形式下載至本地,金鑰由 DPAPI 保護,雲端則有 Azure Blob Storage 備份。產品團隊的威脅模型聚焦於防止 deepfake 濫用:本地端對模型加密並嵌入音頻浮水印,雲端則驗證用戶是否確實朗讀了系統指定的隨機文字,並要求錄製同意聲明以確認聲音所有權。

然而,研究團隊在幾乎每個元件都發現了漏洞。後端 API 接受客戶端傳入的 reference text 參數,攻擊者只需直接呼叫 API 並自行提供對應文字,即可用任何人的錄音訓練模型,完全繞過聲音驗證機制。雲端 Blob Storage 缺乏 per-user 權限控管,僅以資料夾區隔,且模型加密金鑰與模型本體共存,一旦路徑穿越漏洞被利用,攻擊者即可存取任意用戶的模型與訓練資料。浮水印機制使用固定 seed 的弱隨機數生成器,缺乏 certificate pinning,MSIX 套件亦無完整性驗證,理論上可導致數百萬台設備遭遠端代碼執行。此外,Windows Push Notification 服務控制權漏洞可觸發全域服務中斷,而模型建立/刪除循環漏洞則可被用來對 Microsoft 造成大規模財務損失。

儘管上述漏洞技術上均可修補,但研究團隊認為這不是取消功能的主因。真正無解的問題有兩個:其一,模型無論在靜態時如何加密,推理時必然以明文載入記憶體,任何在同機運行的惡意程式都能 dump 模型或在浮水印生效前將其繞過。VBS Enclave 與 TPM 可提升防護層級,Confidential VM(Intel TDX / AMD SEV-SNP)更可加密記憶體內容並支援 boot-time attestation 配合 Azure Key Vault 的 Secure Key Release,但這些技術目前僅適用於資料中心伺服器,尚未普及於個人電腦。其二,即使模型端保護做到極致,攻擊者仍可繞過整個 Windows 基礎設施,直接擷取麥克風輸入的聲音原始素材,在外部平台(最低需 15 秒)訓練獨立模型,不受任何 Windows 端防護約束。浮水印再精密,若對方的電話銀行或家人的手機沒有驗證 SDK,形同虛設。

最終,Microsoft 決定取消「Speak for Me」對通用個人電腦的發布。現有的 Custom Neural Voice 服務仍繼續為通過人工審核的特定企業客戶提供服務。演講者以此案例指出,隨著 AI 功能日益強大與自主化,安全思維必須從「把壞人擋在外面」轉向「把 AI 的危害能力關在裡面」,而有時最負責任的工程決策,正是選擇暫緩發布。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性