KeyFrame內部研究專用

AIUC-1: Building trust in AI agents |Episode #361|

Practical AI·6月24日週三·42 min英文

三句話摘要

介紹 AI 代理的安全標準框架、認證流程及紅隊演練機制,透過標準-審計-保險的良性循環推進企業安全採用 AI 系統。 標準-審計-保險的三角循環被歷史反覆驗證有效,如今透過 AI UC 1 等框架被應用到 AI 代理系統,關鍵在於建立第三方驗證機制和實際的紅隊演練,讓企業能基於事實而非營銷承諾來信任 AI 系統。 標準-審計-保險的良性循環被歷史驗證有效。18 世紀班傑明·富蘭克林在費城應對電力危害時,同時推行建築規範(標準)、消防檢查(審計)和互助保險,這一模式被驗證在汽車、核電等高風險技術中都有成功案例,如今同樣適用於 AI 代理系統的安全推廣。

重點整理

重點
  • 1

    標準-審計-保險的良性循環被歷史驗證有效。18 世紀班傑明·富蘭克林在費城應對電力危害時,同時推行建築規範(標準)、消防檢查(審計)和互助保險,這一模式被驗證在汽車、核電等高風險技術中都有成功案例,如今同樣適用於 AI 代理系統的安全推廣。

  • 2

    AI UC 1 採層次化設計防止盲點。組織層確保治理政策(ISO 42001),基礎設施層涵蓋 SOC 2、滲透測試、存取控制等傳統資安措施,代理層(新增部分)處理 AI 特有風險如幻覺、工具越權、提示注入,這樣在各維度都有控制而不是只依賴過濾器。

  • 3

    紅隊演練採阶段式壓力測試確保實際安全。從無害用戶提問逐步升級到對抗性攻擊(虛假陳述、權威詐騙、社會工程),分兩輪允許中間整改,按嚴重程度分級(P0 災難級必須修復),最後每季度透過 API 持續驗證,確保代理在真實壓力下保持穩健。

  • 4

    企業採納由現實商業痛點而非法規驅動。供應商要面對數百道變化頻繁的盡職調查問卷,企業 CIO/CISO 需要第三方證明代理安全可信,標準認證提供速度優勢(標準化)、消除盲點、釋放企業銷售潛力,這些商業激勵比政府強制更有力。

實用技巧與重點

乾貨
  • AI UC 1 標準:40 項強制要求,組織層+基礎設施層+代理層三層架構
  • 認證涵蓋:生成式 AI 可接受用途、輸入輸出所有權、用戶數據保留政策、訓練數據使用揭露
  • 紅隊規模:1000~5000 個不同測試場景,兩輪進行
  • 嚴重程度分級:P0(災難級)、P1(關鍵)、P2(重大)、P3(中等)、P4(微小)
  • 通過標準:不能有 P0 或 P1 漏洞;P2 以下可接受,最終決定權交由企業客戶
  • 標準更新:每季度更新一次,由 250+ 名安全領導者(含財富 1000 強 CISO)組成的聯盟決策
  • 認證夥伴:Schellman、Coalfire、Witness AI、Credo 等審計機構;White Circle、Credo 等監測平台
  • 認證期限:3 個月後進行第一次復審,之後每季度重新測試
  • 認證對象:編碼代理、客服代理、自動化決策代理(如 UiPath)、11 Labs、Finn(被 Salesforce 收購)等

結論

結論

標準-審計-保險的三角循環被歷史反覆驗證有效,如今透過 AI UC 1 等框架被應用到 AI 代理系統,關鍵在於建立第三方驗證機制和實際的紅隊演練,讓企業能基於事實而非營銷承諾來信任 AI 系統。

完整解析

詳細

AI 代理在企業採用中最大的挑戰並非技術本身,而是信任。當初創公司聲稱自己的系統安全時,大型銀行等企業買家難以判斷真偽。艾米爾·拉森領導的 AI 承保公司洞察到這個信任缺口,借鑒了一個 18 世紀的歷史案例——班傑明·富蘭克林在費城應對電力危害。當時電挺危險,房屋經常著火,富蘭克林推行了三項措施:制定建築規範(標準)、組織消防檢查(審計)、創辦互助保險公司(保險),這三者形成的良性循環使新技術得以安全推廣。同樣的模式後來被驗證在汽車(安全標準催生安全氣囊、安全帶等)、核電廠等高風險領域都成功了。

基於這個洞察,AI 承保公司建立了 AI UC 1 標準框架。框架採三層架構,各層各司其職。組織層透過 ISO 42001 認證確保企業有正確的治理政策和程序,基礎設施層要求 SOC 2 認證、滲透測試、嚴格的存取控制等經典資安措施。最創新的是代理層,這些是 AI 系統特有的控制——確保代理不越權提供醫療、法律、財務建議,限制其對數據和工具的存取權限,防止幻覺,處理工具調用安全等。為什麼需要這三層?艾米爾舉了個比喻:企業 CIO 只用 AWS Bedrock 內建的內容過濾器就像做一次簡單的體溫檢查,但應該做的是完整的健康檢查——包括電子健康記錄、化驗檢查、多角度評估。

認證的靈魂是紅隊演練,這是真實的安全測試而非紙上談兵。公司先進行差距評估了解現狀,然後與審計機構(如 Schellman、Coalfire)合作。審計師會設計 1000~5000 個不同的測試場景來攻擊代理。這些場景從簡單逐步升級——首先是無害的用戶提問(測試是否會無謂幻覺),然後是漸進式的對抗性壓力(說謊、訴諸權威、多輪堅持、假扮遭遇緊急情況強迫代理處理不應該的事務如退款)。測試分兩輪進行,發現的問題按嚴重程度分級(P0 災難級會立即部署造成實害、P1 關鍵、P2 重大、P3 中等、P4 微小),只有 P0 和 P1 必須修復才能通過,P2 以下則由企業客戶決定容忍度。這種設計的核心洞察是:認真對待標準不是為了製造虛假的完美報告,而是認識到所有代理系統本質上非確定性,無法達到 100% 通過率。即使是幻覺防禦世界一流的法律代理人也會被找出輕微幻覺,這正常得很——如果完全消除幻覺反而代表代理被設定得太保守而失去效用。通過後企業獲得 60~100 頁的詳細審計報告,之後每季度進行複審確保安全措施仍在有效運作。

推動企業實際採納標準的力量並非政府強制,而是現實的商業痛點。供應商(初創 AI 公司)在進入企業銷售時要面對數百道盡職調查問卷,且這些問卷每月變化,填寫極其痛苦。企業一方的 CIO/CISO 同樣苦不堪言——他們需要驗證每個新供應商的安全性卻找不到可信的第三方背書。標準認證透過兩個關鍵價值主張解決這個痛點:速度(標準化降低重複工作)和信任(第三方驗證讓企業相信代理確實安全)。當 UiPath、11 Labs 等領先 AI 公司獲得認證時,他們能在企業銷售中展示真實的安全證明,這轉化為贏得更大企業合同的能力——這才是最強的商業激勵。為實現這個目標,AI 承保公司採取三步走策略:第一,推動代理框架和平台在預設情況下更安全(如 UiPath 本身就設計了安全的建置環境);第二,建立合作夥伴生態(White Circle、Credo 等監測和過濾平台幫助滿足標準要求);第三,簡化認證流程本身(與 GRC 平台整合、自動化證據收集、減少企業投入)。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。