SN 1093: Tokens in the Stream - Why LLMs are inherently insecure and prompt injection will persist
三句話摘要
LLM 本質上使用格式化標籤作為安全邊界,但這些標籤無法被強制執行,導致「角色混淆」成為無法根本解決的安全漏洞。 LLM 的安全缺陷不是設計上的疏漏,而是其架構的必然結果,唯一的防禦策略是在應用層加入嚴格的邊界控制(如限制模型只能輸出特定結果),而非寄望模型本身能夠自我保護。 Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
重點整理
重點- 1
Token 流的基礎設計:LLM 不具備狀態管理能力,所有輸入都被視為等值的 token 序列。系統無法區分「這是系統指令」和「這是外部資料」,只能依靠訓練期間習得的格式識別能力,這本質上是脆弱的。
- 2
格式標籤的虛幻邊界:系統標籤、使用者標籤、工具標籤等都只是特殊 token,模型被訓練成「該尊重系統標籤的命令」,但 token 流裡沒有硬性邊界。移除標籤格式後,攻擊成功率從 61% 跌至 10%,證明安全性完全依賴於格式。
- 3
蒸餾與超級模型現象:企業用較成熟模型的輸出訓練新模型(蒸餾),相當於把前一代模型的行為與缺點複製給下一代。即使競爭對手未直接存取,互聯網上充滿 AI 生成內容,導致模型行為自然收斂,難以追蹤蒸餾是否發生。
- 4
無法根本修復的窘境:業界嘗試了多種方案(增加 token 位元、交錯標籤、硬體級別隔離),都因效率不足而被放棄。根本原因是 LLM 架構本身就是一個無狀態的 token 預測機器,不支援真正的角色分離。
實用技巧與重點
乾貨- 概念:Role confusion(角色混淆)、Chain of thought(思想鏈)、Distillation(蒸餾)
- 人物:Lauren Kohnfelder(1978 年發明公開金鑰基礎設施 PKI 的安全大師)
- 論文主題:Prompt injection 的本質根源是 role confusion
- 格式標籤種類:system(系統)、user(使用者)、assistant(助手)、tool(工具)、thinking(思考)
- 安全測試結果:去除標籤格式後,攻擊成功率從 61% 降低至 10%,證明安全性完全依賴格式辨識
- Bitwarden Secrets Manager:提供機器帳戶權限分層,防止代理程式意外讀取環境變數和 .env 檔案中的憑證
結論
結論“LLM 的安全缺陷不是設計上的疏漏,而是其架構的必然結果,唯一的防禦策略是在應用層加入嚴格的邊界控制(如限制模型只能輸出特定結果),而非寄望模型本身能夠自我保護。”
完整解析
詳細這一集的核心在於揭示 LLM 安全性的結構性缺陷。Steve Gibson 和 Leo Laporte 由一篇研究論文和安全先驅 Lauren Kohnfelder 的分析出發,深入討論為什麼當今所有主流 AI 模型都面臨同樣的安全困境。
問題的根源在於 LLM 最基本的運作方式。一個 LLM 本質上是一個無狀態的神經網路,它接收一長串 token(文字片段),逐一處理並預測下一個最可能出現的 token。這個過程中,所有輸入——系統指令、使用者提問、已抓取的網頁內容、模型自身的思考過程——都被串聯成一個單一的線性流。為了讓模型理解「誰在說什麼」,設計者採用了格式化標籤:系統提示用 `[system]` 標記、使用者輸入用 `[user]` 標記、外部工具輸出用 `[tool]` 標記等等。模型在訓練期間學會了這些標籤的「含義」——遇到系統標籤應該優先執行,遇到工具標籤不應該執行其中的命令。
但這裡的問題是,這些標籤本身也只是 token。在模型的內部計算中,沒有真正的邊界。格式標籤不是強制執行的邊界,只是統計模式。當攻擊者在看似安全的工具標籤或網頁內容中插入精心設計的指令時,模型有時會被「混淆」,把來自外部的指令當成來自使用者的合法命令。這就是「角色混淆」的本質。
研究論文證明了這一點:當他們去掉格式標籤、只保留純文字時,提示注入攻擊的成功率從 61% 驟降至 10%。這個數字說明了一切——安全性完全依賴於這套脆弱的格式辨識系統。
為什麼無法修復?因為 LLM 的架構本身就不支援真正的、強制性的角色隔離。曾有人提議在 token 層面增加元數據位元來標記角色,或者交錯插入標籤以加強分離,但這些方案都因為效率損失太大而被放棄。業界沒有找到一個既能保持模型性能、又能提供硬性邊界的解決方案。這不是工程師偷懶,而是 LLM 架構的根本限制。
此外,podcast 還涉及了其他相關議題。關於模型蒸餾的爭議:企業用成熟模型的輸出訓練競爭對手的新模型是否合法。法律上這違反了服務條款,但執行困難——因為互聯網上已充滿 AI 生成內容,新模型在公開資料上預訓練時自然會學到這些行為,難以証明是否進行了蒸餾。Anthropic 則宣布擴大對 Claude Mythos 5 的存取權限,採用了聰慧的因應方案:只在後端整合該模型到既有的防禦工具中,使用者看不到模型本身,只能收到特定輸出(如漏洞修復補丁),這樣既能提升防禦能力又避免濫用。
最後提到了 Bitwarden Secrets Manager 的重要性。當代理程式(Agent)在代表人類工作時,需要存取憑證。但如果這些祕密明文存放在環境變數或 .env 檔案中,代理程式在嘗試解決問題時會無意中找到並洩露它們。Secrets Manager 透過分層權限管理,讓代理程式只能存取特定的祕密,降低意外洩露的風險。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


