How private LLM inference actually works
三句話摘要
私密LLM推理的技術原理與實現——利用可信執行環境確保雲端AI推理過程對服務商完全不可見。 私密推理通過硬件隔離、密碼學驗證和無狀態推理設計,將隱私從承諾轉變為可驗證的技術事實,同時在保護隱私前提下實現透明治理,為開源模型時代創造了一條新路。 密碼學驗證轉變了信任基礎:傳統雲服務要求用戶信任服務商的承諾,但私密推理通過遠程證明讓信任變成可驗證的技術事實。TEE能簽名所有運行代碼和模型權重,Tinfoil將代碼開源並在透明度日誌發佈哈希值,用戶連接時比對證明與實際值是否一致。這樣即使Tinfoil本身也無法篡改運行內容。
重點整理
重點- 1
密碼學驗證轉變了信任基礎:傳統雲服務要求用戶信任服務商的承諾,但私密推理通過遠程證明讓信任變成可驗證的技術事實。TEE能簽名所有運行代碼和模型權重,Tinfoil將代碼開源並在透明度日誌發佈哈希值,用戶連接時比對證明與實際值是否一致。這樣即使Tinfoil本身也無法篡改運行內容。
- 2
推理的無狀態特性是隱私保護的天然優勢:LLM推理每次都將整個對話發送到雲端,伺服器不需保存會話狀態。推理完成後所有敏感數據就在內存中被遺棄,無需寫入磁碟或長期儲存。這使得隱私保護只需確保內存加密隔離,比傳統應用簡單得多。
- 3
層層防禦設計堵住側信道:TLS連接直接在TEE內終止而非代理層、KV快取通過客戶端秘鑰加鹽來隔離不同用戶、網絡出口受限防止數據洩露。特別是KV快取加鹽巧妙地利用客戶端秘密建立隔離命名空間,使Tinfoil即使有心也無法透過快取命中時序推斷用戶行為。
- 4
隱私與治理不對立,而是互補:可在TEE內部署OpenAI GPT-O等安全分類器進行內容審查,分類器邏輯完全公開可驗證,這是傳統端到端加密方案(如Signal)無法實現的。隱私保護和問責治理可在同一框架內共存。
實用技巧與重點
乾貨- 性能與成本
- 推理間隔延遲增加 20-30%(實際增加數毫秒,多數場景感知不到)
- 吞吐等其他指標受影響更小;定制GPU核可將開銷降至數個百分點
- 定價比其他推理服務商高 10-15%
- 目前主要限制:難以取得足量算力,無法滿足成長需求
- 硬件與架構
- 支持硬件:最新一代Nvidia GPU(Blackwell等)的機密計算功能
- 單位配置:一個GPU必須作為整體綁定到單一TEE(無法分割成多個TEE)
- 一台機器通常8個GPU,可配置為 1-8 個 GPU 共同形成單一 TEE
- CPU 內存加密;GPU 內存通過隔離的連接路徑保護,無物理可訪問端點
- 支持的開源模型
- Llama、GLM、DeepSeek、Gemma 等公開可得模型
- 核心技術組件
- 可信執行環境(TEE/TE)與遠程證明(Remote Attestation)
- 透明度日誌發佈代碼哈希,確保位級復現性
- KV 快取加鹽(KV Cache Salting):客戶端注入秘密為快取隔離
- 遺忘HTTP(Oblivious HTTP)變體:加密請求/回應,頭部保持透明用於計費
- 隱私遮罩過濾:使用 OpenAI GPT-O 過濾搜索查詢中的敏感信息
- OpenAI SDK 相容性:自動執行所有證明驗證
- 客戶與治理
- 典型客戶:律師(應對傳票風險)、金融機構(高頻交易IP保護)、企業(內部機密保護)、屏幕分析應用
- 支持分層治理:可設定違規3次後禁用帳戶,用戶可選擇揭露記錄申訴
- 開源分類器缺口:市場上安全分類器公開實現極少,多數為閉源專有
結論
結論“私密推理通過硬件隔離、密碼學驗證和無狀態推理設計,將隱私從承諾轉變為可驗證的技術事實,同時在保護隱私前提下實現透明治理,為開源模型時代創造了一條新路。”
完整解析
詳細私密推理的出現是硬件進步和隱私需求的交匯點。過去數年,英偉達在GPU上引入機密計算能力,讓大型語言模型可在加密隔離的執行環境內運行。這不是簡單的網絡加密或虛擬機隔離,而是硬件層面的根本性保護——即使是運營服務的公司也無法訪問用戶數據。
技術的精妙之處在於其三層防禦架構。第一層是硬件加密隔離:GPU內存通過受保護的連接路徑隔離,任何試圖直接讀取的行為都被物理設計阻止。第二層是密碼學證明:TEE在啟動時生成簽名,將硬件配置、固件版本、操作系統、推理引擎代碼和模型權重全部編碼進去。Tinfoil將推理引擎完全開源,並通過透明度日誌發佈所有代碼的SHA-256哈希,用戶連接時拉取該哈希並與伺服器返回的證明比對,確保運行的代碼完全一致,無人可篡改。第三層是設計約束:推理的無狀態特性消除了長期儲存的需要。
這個無狀態特性值得深入理解。傳統Web應用在伺服器保存會話狀態,客戶端只維持用戶介面。但LLM推理完全相反——每次用戶發送消息時,整個對話歷史都上傳到雲端,模型預測下一個token,返回結果,然後所有計算中間狀態就在內存中遺棄。推理完成後,伺服器沒有對話副本,用戶端保留所有記錄。這是設計層面的隱私福利。
實現細節處理同樣重要。TLS加密會話不是在Tinfoil的代理伺服器上終止,而是直接在TEE內終止,意味著即使是Tinfoil的員工也無法看到明文請求。KV快取加速推理但帶來新的隱私風險——攻擊者可能透過測量快取命中速度推斷別人的提示詞內容。Tinfoil的解決方案創新地利用遺忘HTTP協議的思想:客戶端生成一個只有自己知道的秘密來為快取加鹽,即使Tinfoil也無法識別。這樣就創建了用戶特定的快取命名空間,時序攻擊變成無效。
在內容治理層面,傳統的端到端加密方案(如Signal)面臨兩難:要麼犧牲加密保護用戶內容進行檢查,要麼保護隱私但無法治理濫用。私密推理打破了這個困境。安全分類器(例如Anthropic的憲法AI分類器或OpenAI的GPT-O)可以直接部署在TEE內部,在推理後立即檢查輸出,同時用戶提示詞對Tinfoil完全不可見。分類器的邏輯完全公開,任何人都能審查和驗證其運作原理,實現了透明的、可驗證的治理。
面對閉源模型的競爭威脅,Tinfoil認為開源模型會長期存活。商業激勵結構決定了這一點:OpenAI、Anthropic等閉源提供商從使用者數據中提取價值,訓練更好的模型或售予第三方,他們沒有動機提供真正的隱私保護。即使提供,其商業模式也會推動他們盡可能收集數據。開源模型完全不同——沒人因開源權重的推理而獲利,因此私密推理與開源模型的激勵天然一致。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


