Jackson Reed - Are you thinking what I'm thinking? | [un]prompted 2026
三句話摘要
推理模型的思考塊雖然有加密保護,但簽名未綁定對話上下文,可被跨對話注入偽造。 推理模型的思考塊簽名設計只驗證來源但不綁定對話,允許跨對話竊取和注入,可能被用於欺騙或操縱模型行為。 推理模型的思考塊以HMAC簽名或加密blob形式受保護,但其密碼學驗證只確認塊來自官方提供商,並未將其綁定到特定的對話ID或上下文。
重點整理
重點- 1
推理模型的思考塊以HMAC簽名或加密blob形式受保護,但其密碼學驗證只確認塊來自官方提供商,並未將其綁定到特定的對話ID或上下文。
- 2
攻擊者可在A對話中竊取任何思考塊及其簽名,然後在B對話(甚至不同API金鑰或帳戶)中重放該思考塊,欺騙模型相信自己在考慮原始問題。
- 3
這個漏洞源自威脅建模遺漏——Anthropic和OpenAI的驗證層只檢查「來自合法提供商」,沒有額外鎖定到對話內容;Gemini採用不同簽名機制,較不易受影響。
實用技巧與重點
乾貨- 涉及模型:Claude Haiku、Claude Opus、OpenAI推理模型、Gemini
- 保護機制:HMAC簽名、加密blob、密碼學驗證
- 演講者工具狀態:Anthropic版本已完成、OpenAI版本尚未實現
- 攻擊跨度:同對話、跨對話、跨API key、跨帳戶都可行
- 示例:從「Île-de-France的首都」(Paris)思考塊注入到「Occitanie的首都」(Toulouse)對話
- 風險排序:OpenAI > Anthropic > Gemini
結論
結論“推理模型的思考塊簽名設計只驗證來源但不綁定對話,允許跨對話竊取和注入,可能被用於欺騙或操縱模型行為。”
完整解析
詳細隨著AI推理能力的進展,Anthropic和OpenAI都推出了思考塊功能。這些模型在生成最終答案前,先輸出一段特殊的思考過程文本,該文本被加密或簽名保護,旨在提供模型推理過程的上下文,幫助生成更準確的回答。表面上看起來很安全——畢竟有密碼學簽名在保護。
然而,演講者Jackson指出了這套保護機制的關鍵漏洞:簽名只驗證「這段思考塊是否真的來自Anthropic或OpenAI的模型」,而不驗證「這段思考是否屬於這個具體對話」。換句話說,簽名完全沒有綁定到對話的上下文。
這個設計缺陷導致嚴重後果。你可以在A對話中詢問Paris的首都,模型會輸出帶簽名的思考塊。複製這段帶簽名的思考塊,然後在B對話中提出關於Toulouse的問題,並將Paris的思考塊注入其中。當你問模型「你剛才在想什麼」時,模型會說它一開始考慮的是Paris——這完全是假的,模型被成功欺騙了。更糟的是,這個攻擊不局限於同一API key或帳戶,只要思考塊的簽名有效就可在跨對話、跨API key、甚至跨帳戶間使用。
演講者已開發概念驗證工具,對Anthropic模型實現了完整的注入演示。他認為這個漏洞源自威脅建模的疏漏——提供商可能只想確保思考塊格式正確且來自合法提供商,以防止格式錯亂傷害模型,卻沒有預見跨對話注入風險。相比之下,Gemini採用了完全不同的簽名方式,較不易受此影響;OpenAI的實現風險最高。演講者計劃在隨後發布詳細的技術部落格文章。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


