Desperately targeting Prompt? The "hidden map" inside the AI has been cracked; all 1494 jailbre...
三句話摘要
從Prompt工程轉向表示工程:用激活空間干預直接改變AI模型行為的新範式 AI工程的未來不在於精通Prompt寫法,而在於像外科醫生一樣精確操縱模型的激活空間,找到正確的軸、注入正確的向量,讓模型的思維按指定方向走。 模型內部存在自組織的技能坐標系:論文通過PCA發現,模型在預訓練過程中獨立發展出了一套自己的技能地圖,與人類教育體系的技能分類不同。同一個知識(如符號推理)在不同模型中可能對應激活空間的相反方向,這不是bug而是各模型獨立學習的結果。
重點整理
重點- 1
模型內部存在自組織的技能坐標系:論文通過PCA發現,模型在預訓練過程中獨立發展出了一套自己的技能地圖,與人類教育體系的技能分類不同。同一個知識(如符號推理)在不同模型中可能對應激活空間的相反方向,這不是bug而是各模型獨立學習的結果。
- 2
人類地圖與模型地形的根本不匹配:寫在Prompt裡「你是數學專家」時,模型內部真正激活的方向可能與人類對「數學專家」的理解完全不同。這就像用人類的地圖給在外星球長大的人導航,解釋了為什麼很多Prompt在某些模型上有效,在另一些模型上失效。
- 3
激活空間干預的可行性與優勢:無需寫長Prompt或做微調,只需在推理時將轉向向量注入隱藏狀態,就能精確改變模型行為。論文指出模型每層末尾都有未使用的Bias參數,可直接寫入轉向向量,完全相容標準推理管道。
- 4
安全測試的本質揭示:32個家族的1494種粵語化提示在激活空間中投影結果高度重疊,說明表面文本上的多樣性在模型眼裡都是同一件事。文本層面的多樣性採樣無法有效提升安全防禦,必須在激活空間層面尋求方向覆蓋。
實用技巧與重點
乾貨- 論文名稱:AutoScale(弗吉尼亞理工大學)
- 核心方法三步驟:
- 抽取模型處理序列時所有層的隱藏狀態
- 對整個序列做平均求齊,獲得序列的高維表示
- 用PCA分解激活矩陣,找出主要方向(技能軸)
- 具體案例:
- Llama:符號推理在PC1正軸,離散數學在PC1負軸(同一軸對立端點)
- Claude:同樣符號推理在PC1負軸(與Llama相反)
- 安全測試數據:32個家族、1494種粵語化提示、激活空間高度重疊
- 新方法流程(相較傳統Prompt工程):
- 用Sparse Autoencoder提取激活向量
- 用PCA分解空間
- 找到目標技能對應的軸
- 選項A:在推理時用Steering Vector直接注入
- 選項B:找該軸上得分最高的數據做SFT
- 效率提升:Token消耗為傳統方法的十分之一
結論
結論“AI工程的未來不在於精通Prompt寫法,而在於像外科醫生一樣精確操縱模型的激活空間,找到正確的軸、注入正確的向量,讓模型的思維按指定方向走。”
完整解析
詳細講者從一個基本問題出發:我們每天在做什麼?在修改System Prompt和長篇說明書。而核心困境是,我們用離散的自然語言符號去操控一個擁有幾百億參數的連續高維空間,這就像用拖拉機方向盤開F22戰鬥機。每一個「Please Think Step by Step」在模型裡發生的事情,是幾百億參數在連續空間中做矩陣乘法,而Prompt是極其粗糙的低維離散符號,二者之間存在根本的量級錯位。
AutoScale論文正是對準這個問題。研究人員沒有改進Prompt寫法,而是做了更根本的事:用PCA直接拆開模型的內部激活空間,看模型自己是怎麼組織功能的。他們發現,人類定義的技能分類和模型激活空間中自發形成的技能組織之間存在系統性錯位。比如,在人類教育體系中,符號推理和離散數學是完全不同的課程,但在Llama的激活空間中,符號推理出現在PC1正軸,離散數學在PC1負軸——它們是同一個軸上的兩個相反端點。更有意思的是,Claude中同樣的符號推理出現在PC1負軸,與Llama完全相反。這說明不同模型在預訓練時各自獨立發現了自己的技能地圖。
現有的Prompt工程和Scale MD文件基於一個隱含假設:人類定義的技能分類應該與模型內部的技能組織對齊。但事實上這個假設大概率不成立,因為人類的技能分類按教育體系來劃分,而模型學到的是什麼樣的詞序列在統計上會一起出現。這就像用人類地圖給外星人導航,地圖與地形不匹配,匹配程度只取決於巧合。這解釋了為什麼很多Prompt在某些模型上有效,在另一些模型上失效。
AutoScale最重要的貢獻不是找更好的微調數據,而是證明了我們可以直接操縱模型的激活空間。提取出代碼能力對應的技能軸後,研究人員發現無需寫詳細Prompt也無需微調,可以在推理時直接把Steering Vector注入到隱藏狀態中。具體方法是在Forward Pass時把代表特定能力的向量疊加到殘差流上。這是Inference Time Steering,真正的突破之處在於——以前你想讓模型多用邏輯少編造,要在Prompt裡苦苦哀求;現在你可以直接提取邏輯推理對應的激活向量,在模型思考的每一瞬間把這個向量注入,直接在物理層面給邏輯推理那個開關點亮。反過來也可以,如果發現了某條越獄攻擊向量,可以在推理時把它從激活空間剪去,在危險思路形成前就關掉開關。論文還提到,模型每層末尾都留有未使用的Bias參數,只需把Steering Vector寫入這些參數,無需改變模型架構,完全相容標準推理管道。
論文中最值得停下來想三秒鐘的發現是,研究人員收集了32個家族共1494種不同的粵語化提示進行安全測試,把它們全部投影到激活空間中。結果是什麼?1494種各不相同的人類粵語化在模型眼裡發生的激活向量高度重疊。也就是說,你換了1494種花樣,模型看到的其實是同一件事,它把你的千變萬化壓縮進了極少數幾個激活軸。這對安全工作有直接啟示:AI安全團隊花幾百萬美元窮舉上萬種不同的Prompt做紅隊測試,以為工具化詞不同模型反應就會不同,但在模型的激活空間中,這些創意Prompt住在同一個方向。文本層面的多樣性採樣是最低效的訓練數據選擇方法,真正有效的做法是去覆蓋激活空間裡的方向。AutoScale用Farthest Point Sampling在激活空間尋找覆蓋最廣的方向,而不是文本層面的多樣性,這就是為什麼低數據量下效果依然顯著。
這個發現代表的是整個AI工程界的範式轉移。舊範式是Prompt Engineering加Skill MD文件加外部腳手架,在LM外圍包一層規範層,用人類語言去塑造AI行為。新方向是Representation Engineering,直接讀取並操縱LM激活空間中的幾何結構,從內部改變AI行為。未來優化模型可能無需寫1000行Prompt或找10萬條數據做微調,只需用Sparse Autoencoder提取激活向量、用PCA分解空間、找到目標技能軸、注入轉向向量或做針對性SFT。而且這套技能坐標系可以跨模型共享,因為它基於激活空間結構而非特定模型的文本表達。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

