SecTor 2025 | What Happens When Your Digital Voice Clone Goes Rogue
三句話摘要
Microsoft 資安團隊對 Windows「Speak for Me」語音複製功能進行滲透測試,揭露無法在通用 PC 上安全部署 AI 語音模型的根本困境。 AI 語音複製功能在通用 PC 上的根本安全困境不在於可修補的程式漏洞,而在於 runtime 記憶體保護與周邊硬體安全尚未成熟——在防禦技術跟上之前,暫緩發布本身就是一種工程責任。 1. 可修復漏洞不是取消原因
重點整理
重點- 1
1. 可修復漏洞不是取消原因
- 2
後端 API 接受攻擊者自訂 reference text 參數,可用任意人的錄音訓練模型;雲端 blob storage 僅以資料夾區隔用戶、缺乏權限控制且模型加密金鑰與模型共存。這些漏洞技術上皆可修補,但修補後問題依然存在。
- 3
2. Runtime 保護是根本瓶頸
- 4
模型無論如何加密,推理時必須解密載入記憶體;任何跑在同一機器上的惡意程式都能從記憶體 dump 模型,或在浮水印機制執行前就將其禁用。VBS Enclave 可提升防護層級,但面對 kernel 層 privilege escalation 仍不夠穩固。
- 5
3. 聲音資產本身無法被圍住
- 6
即使模型保護做到位,攻擊者可繞過整個 Windows 基礎設施,直接用麥克風錄製的聲音素材(最短 15 秒)在外部開源或商業平台訓練模型,完全不受任何 Windows 端的防護機制約束。
- 7
4. AI 時代需要「把壞 AI 關在裡面」的新思維
- 8
現有 AI 安全焦點是防止外部入侵,但當 AI 功能本身強大到足以大規模冒充身分,防護思維必須轉向:確保 AI 的輸出與能力無法被濫用,有時最負責任的做法是暫緩發布。
實用技巧與重點
乾貨- 數字與成本
- 模型訓練需約 1 小時(雲端)
- 外部開源工具最少需 15 秒聲音即可訓練語音複製模型
- VBS 技術自 2015–2016 年起存在於 Windows
- VBS 支援最多 16 個 VTL(Virtual Trust Level)
- VBS Enclave SDK 自 2024 年開放第三方開發者使用
- 工具與技術名稱
- Speak for Me:Windows 語音複製無障礙功能(已取消)
- Custom Neural Voice (CNV):Azure 語音模型訓練服務,目前對選定客戶開放
- Azure API Management Gateway:IP filtering、rate limiting 保護
- Azure Blob Storage:模型雲端備份儲存
- DPAPI:Windows 本地加密金鑰保護庫
- VBS(Virtualization Based Security):基於 Hyper-V 的隔離執行環境
- VBS Enclave / Trustlet:VTL 1 安全執行隔離模組
- TPM(Trusted Platform Module):硬體金鑰封存
- Confidential VM:依賴 Intel TDX 或 AMD SEV-SNP 的記憶體加密 VM
- Azure Key Vault + Secure Key Release:搭配 attestation 的金鑰管理方案
- Windows S Mode:僅允許 Windows Store 應用的鎖定版 Windows
- Microsoft Pluton:整合於 Surface 等裝置的安全處理器
- Personal Data Encryption (PDE) API:Windows 生物辨識保護 API
- Windows Recall:另一個具高風險的 Windows AI 功能(已發布)
- 漏洞清單
- 後端 reference text 參數可注入任意文字→繞過聲音驗證
- Azure Blob Storage 路徑穿越漏洞→存取任意用戶模型與訓練資料
- 加密金鑰與模型存放於同一 storage
- 浮水印機制使用固定 seed 的弱隨機數生成器
- 無 certificate pinning(中間人攻擊風險)
- MSIX 套件缺乏模型完整性驗證→遠端代碼執行風險
- Windows Push Notification Service 控制權漏洞→可觸發全域 DoS
- 無限循環建立/刪除模型帳號→造成 Microsoft 財務損失
結論
結論“AI 語音複製功能在通用 PC 上的根本安全困境不在於可修補的程式漏洞,而在於 runtime 記憶體保護與周邊硬體安全尚未成熟——在防禦技術跟上之前,暫緩發布本身就是一種工程責任。”
完整解析
詳細「Speak for Me」是 Microsoft 為漸進式失聲患者設計的 Windows 無障礙功能,允許用戶在聲音消失前錄製自己的聲音,並在之後以個人化語音模型通過鍵盤輸入發話。功能整合至 Windows 文字轉語音 SDK,可作為虛擬麥克風與 Teams 等應用無縫協作。由於這項技術同時具備強大的合法用途與被濫用的潛力,Microsoft Storm 資安研究團隊一年前對其進行了完整的滲透測試。
技術架構上,桌面客戶端透過 Azure API Management Gateway 與後端 Speak for Me 服務通訊,後端再呼叫 Custom Neural Voice 服務進行模型訓練。訓練完成的模型以加密形式下載至本地,金鑰由 DPAPI 保護,雲端則有 Azure Blob Storage 備份。產品團隊的威脅模型聚焦於防止 deepfake 濫用:本地端對模型加密並嵌入音頻浮水印,雲端則驗證用戶是否確實朗讀了系統指定的隨機文字,並要求錄製同意聲明以確認聲音所有權。
然而,研究團隊在幾乎每個元件都發現了漏洞。後端 API 接受客戶端傳入的 reference text 參數,攻擊者只需直接呼叫 API 並自行提供對應文字,即可用任何人的錄音訓練模型,完全繞過聲音驗證機制。雲端 Blob Storage 缺乏 per-user 權限控管,僅以資料夾區隔,且模型加密金鑰與模型本體共存,一旦路徑穿越漏洞被利用,攻擊者即可存取任意用戶的模型與訓練資料。浮水印機制使用固定 seed 的弱隨機數生成器,缺乏 certificate pinning,MSIX 套件亦無完整性驗證,理論上可導致數百萬台設備遭遠端代碼執行。此外,Windows Push Notification 服務控制權漏洞可觸發全域服務中斷,而模型建立/刪除循環漏洞則可被用來對 Microsoft 造成大規模財務損失。
儘管上述漏洞技術上均可修補,但研究團隊認為這不是取消功能的主因。真正無解的問題有兩個:其一,模型無論在靜態時如何加密,推理時必然以明文載入記憶體,任何在同機運行的惡意程式都能 dump 模型或在浮水印生效前將其繞過。VBS Enclave 與 TPM 可提升防護層級,Confidential VM(Intel TDX / AMD SEV-SNP)更可加密記憶體內容並支援 boot-time attestation 配合 Azure Key Vault 的 Secure Key Release,但這些技術目前僅適用於資料中心伺服器,尚未普及於個人電腦。其二,即使模型端保護做到極致,攻擊者仍可繞過整個 Windows 基礎設施,直接擷取麥克風輸入的聲音原始素材,在外部平台(最低需 15 秒)訓練獨立模型,不受任何 Windows 端防護約束。浮水印再精密,若對方的電話銀行或家人的手機沒有驗證 SDK,形同虛設。
最終,Microsoft 決定取消「Speak for Me」對通用個人電腦的發布。現有的 Custom Neural Voice 服務仍繼續為通過人工審核的特定企業客戶提供服務。演講者以此案例指出,隨著 AI 功能日益強大與自主化,安全思維必須從「把壞人擋在外面」轉向「把 AI 的危害能力關在裡面」,而有時最負責任的工程決策,正是選擇暫緩發布。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


