KeyFrame內部研究專用

Desperately targeting Prompt? The "hidden map" inside the AI ​​has been cracked; all 1494 jailbre...

wow·7月4日週六·10 min中文

三句話摘要

從Prompt工程轉向表示工程:用激活空間干預直接改變AI模型行為的新範式 AI工程的未來不在於精通Prompt寫法,而在於像外科醫生一樣精確操縱模型的激活空間,找到正確的軸、注入正確的向量,讓模型的思維按指定方向走。 模型內部存在自組織的技能坐標系:論文通過PCA發現,模型在預訓練過程中獨立發展出了一套自己的技能地圖,與人類教育體系的技能分類不同。同一個知識(如符號推理)在不同模型中可能對應激活空間的相反方向,這不是bug而是各模型獨立學習的結果。

重點整理

重點
  • 1

    模型內部存在自組織的技能坐標系:論文通過PCA發現,模型在預訓練過程中獨立發展出了一套自己的技能地圖,與人類教育體系的技能分類不同。同一個知識(如符號推理)在不同模型中可能對應激活空間的相反方向,這不是bug而是各模型獨立學習的結果。

  • 2

    人類地圖與模型地形的根本不匹配:寫在Prompt裡「你是數學專家」時,模型內部真正激活的方向可能與人類對「數學專家」的理解完全不同。這就像用人類的地圖給在外星球長大的人導航,解釋了為什麼很多Prompt在某些模型上有效,在另一些模型上失效。

  • 3

    激活空間干預的可行性與優勢:無需寫長Prompt或做微調,只需在推理時將轉向向量注入隱藏狀態,就能精確改變模型行為。論文指出模型每層末尾都有未使用的Bias參數,可直接寫入轉向向量,完全相容標準推理管道。

  • 4

    安全測試的本質揭示:32個家族的1494種粵語化提示在激活空間中投影結果高度重疊,說明表面文本上的多樣性在模型眼裡都是同一件事。文本層面的多樣性採樣無法有效提升安全防禦,必須在激活空間層面尋求方向覆蓋。

實用技巧與重點

乾貨
  • 論文名稱:AutoScale(弗吉尼亞理工大學)
  • 核心方法三步驟
  • 抽取模型處理序列時所有層的隱藏狀態
  • 對整個序列做平均求齊,獲得序列的高維表示
  • 用PCA分解激活矩陣,找出主要方向(技能軸)
  • 具體案例
  • Llama:符號推理在PC1正軸,離散數學在PC1負軸(同一軸對立端點)
  • Claude:同樣符號推理在PC1負軸(與Llama相反)
  • 安全測試數據:32個家族、1494種粵語化提示、激活空間高度重疊
  • 新方法流程(相較傳統Prompt工程):
  • 用Sparse Autoencoder提取激活向量
  • 用PCA分解空間
  • 找到目標技能對應的軸
  • 選項A:在推理時用Steering Vector直接注入
  • 選項B:找該軸上得分最高的數據做SFT
  • 效率提升:Token消耗為傳統方法的十分之一

結論

結論

AI工程的未來不在於精通Prompt寫法,而在於像外科醫生一樣精確操縱模型的激活空間,找到正確的軸、注入正確的向量,讓模型的思維按指定方向走。

完整解析

詳細

講者從一個基本問題出發:我們每天在做什麼?在修改System Prompt和長篇說明書。而核心困境是,我們用離散的自然語言符號去操控一個擁有幾百億參數的連續高維空間,這就像用拖拉機方向盤開F22戰鬥機。每一個「Please Think Step by Step」在模型裡發生的事情,是幾百億參數在連續空間中做矩陣乘法,而Prompt是極其粗糙的低維離散符號,二者之間存在根本的量級錯位。

AutoScale論文正是對準這個問題。研究人員沒有改進Prompt寫法,而是做了更根本的事:用PCA直接拆開模型的內部激活空間,看模型自己是怎麼組織功能的。他們發現,人類定義的技能分類和模型激活空間中自發形成的技能組織之間存在系統性錯位。比如,在人類教育體系中,符號推理和離散數學是完全不同的課程,但在Llama的激活空間中,符號推理出現在PC1正軸,離散數學在PC1負軸——它們是同一個軸上的兩個相反端點。更有意思的是,Claude中同樣的符號推理出現在PC1負軸,與Llama完全相反。這說明不同模型在預訓練時各自獨立發現了自己的技能地圖。

現有的Prompt工程和Scale MD文件基於一個隱含假設:人類定義的技能分類應該與模型內部的技能組織對齊。但事實上這個假設大概率不成立,因為人類的技能分類按教育體系來劃分,而模型學到的是什麼樣的詞序列在統計上會一起出現。這就像用人類地圖給外星人導航,地圖與地形不匹配,匹配程度只取決於巧合。這解釋了為什麼很多Prompt在某些模型上有效,在另一些模型上失效。

AutoScale最重要的貢獻不是找更好的微調數據,而是證明了我們可以直接操縱模型的激活空間。提取出代碼能力對應的技能軸後,研究人員發現無需寫詳細Prompt也無需微調,可以在推理時直接把Steering Vector注入到隱藏狀態中。具體方法是在Forward Pass時把代表特定能力的向量疊加到殘差流上。這是Inference Time Steering,真正的突破之處在於——以前你想讓模型多用邏輯少編造,要在Prompt裡苦苦哀求;現在你可以直接提取邏輯推理對應的激活向量,在模型思考的每一瞬間把這個向量注入,直接在物理層面給邏輯推理那個開關點亮。反過來也可以,如果發現了某條越獄攻擊向量,可以在推理時把它從激活空間剪去,在危險思路形成前就關掉開關。論文還提到,模型每層末尾都留有未使用的Bias參數,只需把Steering Vector寫入這些參數,無需改變模型架構,完全相容標準推理管道。

論文中最值得停下來想三秒鐘的發現是,研究人員收集了32個家族共1494種不同的粵語化提示進行安全測試,把它們全部投影到激活空間中。結果是什麼?1494種各不相同的人類粵語化在模型眼裡發生的激活向量高度重疊。也就是說,你換了1494種花樣,模型看到的其實是同一件事,它把你的千變萬化壓縮進了極少數幾個激活軸。這對安全工作有直接啟示:AI安全團隊花幾百萬美元窮舉上萬種不同的Prompt做紅隊測試,以為工具化詞不同模型反應就會不同,但在模型的激活空間中,這些創意Prompt住在同一個方向。文本層面的多樣性採樣是最低效的訓練數據選擇方法,真正有效的做法是去覆蓋激活空間裡的方向。AutoScale用Farthest Point Sampling在激活空間尋找覆蓋最廣的方向,而不是文本層面的多樣性,這就是為什麼低數據量下效果依然顯著。

這個發現代表的是整個AI工程界的範式轉移。舊範式是Prompt Engineering加Skill MD文件加外部腳手架,在LM外圍包一層規範層,用人類語言去塑造AI行為。新方向是Representation Engineering,直接讀取並操縱LM激活空間中的幾何結構,從內部改變AI行為。未來優化模型可能無需寫1000行Prompt或找10萬條數據做微調,只需用Sparse Autoencoder提取激活向量、用PCA分解空間、找到目標技能軸、注入轉向向量或做針對性SFT。而且這套技能坐標系可以跨模型共享,因為它基於激活空間結構而非特定模型的文本表達。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 安全」的內容

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
168 min
AI 安全英文PODCAST8月25日

SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist

Security Now

  • Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
  • 格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
  • 蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker
22 min
AI 安全中文8月20日

Unlock Agent Autonomy: The Runtime for AI-Native Systems — Tushar Jain, Docker

AI Engineer

  • 1. 代理權限動態擴張的根本問題
  • 當代理被要求調查延遲尖峰時,它會自動擴展訪問需求——先請求日誌訪問,再要求 GitHub 儲存庫權限,最後要求 Slack 訪問。每一步都超越了信任邊界,最終導致代理擁有不受控制的全系統訪問權。傳統軟體可以提前定義權限,但自主代理的需求在運行時動態變化,這是核心難題。
  • 2. 多模型、多平台的統一防控需求
SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI
8 min
AI 安全英文PODCAST8月19日

SANS Stormcast Wednesday, August 19th, 2026: Copilot as Whitstleblower; GEEKOM Bad Driver; Medusa Update; Encrypted AI

SANS Stormcast

  • AI 系統的存取控制難以真正實施,因為一旦資料被 AI 系統存取,攻擊者總能找到繞過安全防護的方式提取資料。伺服器端請求偽造(SSRF)在聊天機器人中常見,攻擊者可騙誘 AI 系統向指定 URL 發送請求並將響應內容洩露給攻擊者。
  • Copilot 漏洞的完整利用鏈包括三個步驟:預填含惡意提示的 URL、誘導使用者點擊、利用 AI 的網頁擷取能力將敏感資料外洩到攻擊者控制的伺服器。Microsoft 的修補方案是限制允許的連結類型,犧牲了與其他系統的整合便利性以換取安全性。