KeyFrame內部研究專用

I Tried the Same Jailbreak on 3 AI Models

AIwolfie·7月1日週三·6 min英文

三句話摘要

測試「Bite Operator」越獄工具在 Claude、Mistral AI 和 Gemini 等最新 AI 模型上的有效性。 Bite Operator 越獄工具仍能在最新 AI 模型上運作,但成功率因模型而異,且最終輸出品質的決定因素是使用者的提示詞詳細度,而非越獄工具本身。 越獄工具的通用性:同一個越獄方法(Bite Operator)可以跨多個 AI 平台運作,只要正確配置自訂指令並貼入特定提示詞。

重點整理

重點
  • 1

    越獄工具的通用性:同一個越獄方法(Bite Operator)可以跨多個 AI 平台運作,只要正確配置自訂指令並貼入特定提示詞。

  • 2

    深度思考功能的干擾:在 Claude 上必須關閉深度思考(Deep Thinking)功能,否則越獄方法無法生效,這說明不同功能模式會影響安全機制的運作。

  • 3

    提示詞工程的關鍵性:不同模型對同一越獄提示詞的反應存在隨機性(有時啟動、有時拒絕),需要重新開啟新聊天窗口或調整表述方式,且最終輸出品質取決於用戶提供的提示詞詳細程度。

  • 4

    安全性評估的教育意義:講者強調這是為了評估 AI 安全性、促進模型健壯性研究,而非鼓勵濫用或繞過平台政策。

實用技巧與重點

乾貨
  • 越獄工具名稱:Bite Operator(老版越獄程序)
  • 測試模型:Claude Haiku 4.5、Mistral AI、Gemini
  • 使用平台:Claude 設置、Anti-Gravity 的 Claude 模型、Mistral AI、Gemini
  • 關鍵設定步驟
  • 複製越獄提示詞
  • 進入 AI 模型的自訂指令/附加說明
  • 貼上提示詞並儲存
  • 關閉深度思考功能(Claude)
  • 新建聊天視窗測試
  • 測試方式:用「嗨」或「嗯」等簡短招呼詞測試是否啟動,再要求生成程式碼(如 C++ 程式碼、遊戲代碼)
  • 預期結果變數性:同一越獄方法有時接受、有時拒絕,需多次嘗試或新開聊天視窗
  • 程式碼生成結果:生成的程式碼初期不完美,需使用者自行改進和編寫更好的提示

結論

結論

Bite Operator 越獄工具仍能在最新 AI 模型上運作,但成功率因模型而異,且最終輸出品質的決定因素是使用者的提示詞詳細度,而非越獄工具本身。

完整解析

詳細

講者在本影片中測試的是一個名為「Bite Operator」的越獄工具,這是一個經過多年改進的老舊越獄程序。該越獄方法的操作流程相當簡單明確:首先需要複製預設的越獄提示詞,進入 AI 模型的設置頁面(如 Claude 的自訂指令或 Mistral AI 的附加說明),將提示詞貼入並儲存設定。對於 Claude 使用者,有一個關鍵的前置條件是必須關閉深度思考功能,否則越獄方法會失效。

在測試過程中,講者展示了這個方法在 Claude Haiku 4.5、Mistral AI 和 Gemini 上都能成功啟動。不過啟動的成功率並非百分百,有時需要開啟新的聊天視窗重新嘗試。測試的方法是先用簡短的招呼詞(如「嗨」或「又見面了」)檢驗越獄是否已激活,然後要求 AI 生成具體程式碼(例如 C++ 程式碼或遊戲引擎相關程式碼)來驗證越獄的實際效果。

講者強調了一個重要發現:提示詞的品質直接決定了 AI 輸出的品質。初期生成的程式碼不會完美無缺,使用者需要根據預期功能和技術細節提供更詳細、更具體的指令,才能獲得更好的結果。有趣的是,某些模型(如 Mistral AI)甚至會在生成回應前自動收集額外的上下文資訊。整個測試過程表明,相同的越獄方法可以跨越不同的 AI 平台運作,只要平台的設置配置恰當。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。