KeyFrame內部研究專用

Jackson Reed - Are you thinking what I'm thinking? | [un]prompted 2026

unprompted·3月26日週四·4 min英文

三句話摘要

推理模型的思考塊雖然有加密保護,但簽名未綁定對話上下文,可被跨對話注入偽造。 推理模型的思考塊簽名設計只驗證來源但不綁定對話,允許跨對話竊取和注入,可能被用於欺騙或操縱模型行為。 推理模型的思考塊以HMAC簽名或加密blob形式受保護,但其密碼學驗證只確認塊來自官方提供商,並未將其綁定到特定的對話ID或上下文。

重點整理

重點
  • 1

    推理模型的思考塊以HMAC簽名或加密blob形式受保護,但其密碼學驗證只確認塊來自官方提供商,並未將其綁定到特定的對話ID或上下文。

  • 2

    攻擊者可在A對話中竊取任何思考塊及其簽名,然後在B對話(甚至不同API金鑰或帳戶)中重放該思考塊,欺騙模型相信自己在考慮原始問題。

  • 3

    這個漏洞源自威脅建模遺漏——Anthropic和OpenAI的驗證層只檢查「來自合法提供商」,沒有額外鎖定到對話內容;Gemini採用不同簽名機制,較不易受影響。

實用技巧與重點

乾貨
  • 涉及模型:Claude Haiku、Claude Opus、OpenAI推理模型、Gemini
  • 保護機制:HMAC簽名、加密blob、密碼學驗證
  • 演講者工具狀態:Anthropic版本已完成、OpenAI版本尚未實現
  • 攻擊跨度:同對話、跨對話、跨API key、跨帳戶都可行
  • 示例:從「Île-de-France的首都」(Paris)思考塊注入到「Occitanie的首都」(Toulouse)對話
  • 風險排序:OpenAI > Anthropic > Gemini

結論

結論

推理模型的思考塊簽名設計只驗證來源但不綁定對話,允許跨對話竊取和注入,可能被用於欺騙或操縱模型行為。

完整解析

詳細

隨著AI推理能力的進展,Anthropic和OpenAI都推出了思考塊功能。這些模型在生成最終答案前,先輸出一段特殊的思考過程文本,該文本被加密或簽名保護,旨在提供模型推理過程的上下文,幫助生成更準確的回答。表面上看起來很安全——畢竟有密碼學簽名在保護。

然而,演講者Jackson指出了這套保護機制的關鍵漏洞:簽名只驗證「這段思考塊是否真的來自Anthropic或OpenAI的模型」,而不驗證「這段思考是否屬於這個具體對話」。換句話說,簽名完全沒有綁定到對話的上下文。

這個設計缺陷導致嚴重後果。你可以在A對話中詢問Paris的首都,模型會輸出帶簽名的思考塊。複製這段帶簽名的思考塊,然後在B對話中提出關於Toulouse的問題,並將Paris的思考塊注入其中。當你問模型「你剛才在想什麼」時,模型會說它一開始考慮的是Paris——這完全是假的,模型被成功欺騙了。更糟的是,這個攻擊不局限於同一API key或帳戶,只要思考塊的簽名有效就可在跨對話、跨API key、甚至跨帳戶間使用。

演講者已開發概念驗證工具,對Anthropic模型實現了完整的注入演示。他認為這個漏洞源自威脅建模的疏漏——提供商可能只想確保思考塊格式正確且來自合法提供商,以防止格式錯亂傷害模型,卻沒有預見跨對話注入風險。相比之下,Gemini採用了完全不同的簽名方式,較不易受此影響;OpenAI的實現風險最高。演講者計劃在隨後發布詳細的技術部落格文章。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。
Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations
40 min
AI 安全英文8月18日

Black Hat Asia 2026 | IntentGuard: Securing LLM-Generated Cloud Configurations

Black Hat

  • 1. 基礎設施程式碼成為提示注入的隱形載體
  • 攻擊者可以在 CloudFormation、Terraform 等模板的註釋、環境變數預設值、引數名稱中植入指令,當 LLM 讀取這些模板生成新配置時,攻擊意圖會被隱形執行。這種攻擊能繞過傳統掃描器,因為最終輸出看似合規。
  • 2. 傳統掃描器的根本盲點:只看孤立配置,不看意圖一致性