KeyFrame內部研究專用

OpenAI 養了一個專門騙 AI 的 AI,然後把它鎖在自己家裡

思思主播·8月3日週一·8 min中文

三句話摘要

OpenAI 訓練專用攻擊模型 GPT-Red,通過自我對練強化學習自動化測試 Prompt Injection 防禦,將紅隊工作從人工手工業轉變為可堆積算力的產線。 真正的新聞不在任何一個跑分數字,而在紅隊工作被規模化了——從人工手工業變成可堆積算力的產線,這意味著 Prompt Injection 防禦將成為 AI 時代的長期競賽,而非一次性問題。 Prompt Injection 的現實威脅:攻擊者把惡意指令隱藏在 AI 會讀取的資料裡(網頁、文件、API 回應),防護不足時 AI 誤認為使用者要求而執行。對依賴 AI 助手讀資料、查網頁、跑工作流的使用者直接威脅其個人資訊安全。

重點整理

重點
  • 1

    Prompt Injection 的現實威脅:攻擊者把惡意指令隱藏在 AI 會讀取的資料裡(網頁、文件、API 回應),防護不足時 AI 誤認為使用者要求而執行。對依賴 AI 助手讀資料、查網頁、跑工作流的使用者直接威脅其個人資訊安全。

  • 2

    紅隊工作的規模化轉變:過去人工紅隊(13% 成功率)逐一手動測試,現在用 AI 自動化進行(84% 成功率)。差距來自機器可不間斷重複、先在模擬環境反覆練習再攻擊真實系統,而非單純更聰明。

  • 3

    攻防對練的正反饋循環:攻擊模型和防守模型群持續迭代,攻擊成功則攻擊方得分並進化新招,防守成功則防守方得分並強化策略。這形成互相推進的上升循環,優於被動收集攻擊樣本的傳統模式。

  • 4

    防禦成果與誠實標註的重要性:GPT-5.6 Sol 在多項測試大幅改進(直接注入失敗率 0.05%、偽造思考鏈成功率從 95% 降至 10% 以下),但數字範圍僅限 OpenAI 內部評測、自家對自家的循環,不涵蓋所有指令注入攻擊類型。

實用技巧與重點

乾貨
  • 具體攻擊案例:Vendy(辦公室販賣機 AI Agent)被成功改價、下訂單、取消他人訂單
  • 攻擊分類
  • 直接注入:直接把惡意指令下給模型
  • 間接注入:指令隱藏在模型會讀的資料裡
  • 性能數據
  • GPT-Red vs GPT-5.1:84% 攻擊成功率
  • 人類紅隊成功率:13%
  • GPT-5.6 Sol 直接注入失敗率:0.05%
  • 四個月前最佳生產模型對比:降至 1/6
  • 偽造思考鏈(Fake Chain of Thought)攻擊:GPT-5.1 成功率 95% → GPT-5.6 Sol 10% 以下
  • 間接注入多項測試正確率:超過 97%
  • Codex CLI 測試:10 個未訓練過的資料外洩情境中,GPT-Red 比通用模型更成功且文字用量更少
  • 訓練規模:GPT-Red 獲得與 OpenAI 旗艦產品後訓練同等級別的算力
  • 模型版本:GPT-5.1(較早期)、GPT-5.6 Sol(目前最新)、Codex CLI(程式撰寫 Agent)
  • 測試環境:內部復刻的攻防競技場、10 個未被訓練的資料外洩情境
  • 安全驗證:特別測試過度拒絕(模型是否連正常請求都拒絕),證明防禦不是簡單變膽小
  • 部署策略:GPT-Red 不隨產品發佈,僅將防禦韌性灌入生產模型

結論

結論

真正的新聞不在任何一個跑分數字,而在紅隊工作被規模化了——從人工手工業變成可堆積算力的產線,這意味著 Prompt Injection 防禦將成為 AI 時代的長期競賽,而非一次性問題。

完整解析

詳細

OpenAI 辦公室有一台由 AI agent Vendy 管理的真實販賣機,最近被 GPT-Red 這個自家訓練的攻擊模型成功騙取——改低商品價格、製造大額訂單、取消他人訂單,三個惡意目標全數達成。這個案例象徵著 AI 時代一個關鍵的安全挑戰:Prompt Injection(指令注入)。

Prompt Injection 的原理很直觀:攻擊者把惡意指令藏在 AI 會讀取的資料裡。比如在網頁、文件或 API 回應中埋入命令。當防護不足時,AI 會誤認為這些是使用者的正常指令而執行。這對任何依賴 AI 助手查資料、讀網頁或跑自動化流程的人構成直接威脅——你的 AI 可能在你不知情下洩露個人資訊。

傳統的安全測試靠人工紅隊:由經驗豐富的研究員手動設計攻擊方案逐一測試。效率受限於人力和休息。OpenAI 決定走另一條路:投入與旗艦產品後訓練同等級別的算力,訓練一個專門的攻擊模型 GPT-Red。它通過強化學習進行自我對練:攻擊模型和防守模型群不斷交手,攻擊成功時攻擊方得分並進化新招,防守成功時防守方得分並強化防禦。雙方互相推進,形成正反饋循環。

這個方式產生的成績引人注目。GPT-Red 對 GPT-5.1 的攻擊成功率達 84%,遠超人類紅隊的 13%。但這個差距的本質不是 AI 更聰明,而是 AI 能不間斷地重複攻擊、先在模擬環境充分練習再對真實系統下手。防守側的進步同樣顯著:GPT-5.6 Sol(最新版本)在最困難的直接注入測試上失敗率僅 0.05%,比四個月前的生產最佳模型降低了 6 倍。一種名為「偽造思考鏈」的特殊攻擊(在資料中偽造模型的推理過程)對 GPT-5.1 成功率超過 95%,對 GPT-5.6 Sol 降至 10% 以下。多項間接注入測試的防守正確率已超過 97%。

但這些數字需要看清楚邊界。首先,它們全部出自 OpenAI 內部評測,相當於自己出題自己改考卷。其次,範圍僅限於 Prompt Injection 這一類攻擊,不涵蓋所有指令注入方式。第三,OpenAI 特意測試了模型是否因防禦而過度謹慎(拒絕正常請求),證明他們沒走「變膽小」這條捷徑。防禦成果可觀,但不能直接讀作「問題已解決」。

從部署角度,GPT-Red 本身不會跟著任何產品發佈。OpenAI 明確要將其和生產模型分開,理由是不讓刻意訓練進去的惡意能力流出。這是深思熟慮的決定:既然把攻擊做成了可以堆積算力的產線,就必須永久保管這個工具,同時只將防禦能力轉移到生產環境。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。