KeyFrame內部研究專用

Privacy-Preserving Intelligence — Steve Korshakov, Bee (acq. Amazon)

AI Engineer·7月20日週一·15 min英文

三句話摘要

Amazon AI 可穿戴設備如何透過端到端加密與多層驗證機制,在收集超敏感個人數據的同時確保用戶隱私與防止內部威脅。 對超敏感個人數據的防護,技術隔離(端到端加密、7 天密鑰過期)必須配合組織隔離(隱私團隊獨立、雙層驗證發布)與透明度(公開日誌、可審計),三者缺一不可。 數據敏感性決定防護強度:年度 1000 萬 token 的個人錄音在一週內即可洩露用戶所有機密,超越市場上任何其他設備。加入 Amazon 後需要額外防護層,不只對抗外部威脅也要防止內部員工訪問。

重點整理

重點
  • 1

    數據敏感性決定防護強度:年度 1000 萬 token 的個人錄音在一週內即可洩露用戶所有機密,超越市場上任何其他設備。加入 Amazon 後需要額外防護層,不只對抗外部威脅也要防止內部員工訪問。

  • 2

    架構從被動轉向主動:傳統 AI 系統採請求-回應模式,新系統需有狀態運行時與持久化記憶體,讓代理連續執行任務且完全自主,無依賴用戶設備在線。

  • 3

    密鑰管理的四項核心原則:(1)密鑰只在用戶手機生成與存儲;(2)所有數據強制加密無法禁用;(3)工作負載透過公開透明日誌驗證;(4)內存密鑰強制 7 天過期。

  • 4

    防止內部威脅的雙層發布控制:隱私專責團隊獨立管理簽署密鑰與透明日誌,開發團隊無法單方變更;採基礎鏡像簽署加部署驗證的二層流程,使任何未授權變更在組織內幾乎不可能實現且可被審計追蹤。

實用技巧與重點

乾貨
  • 用戶年度數據量:1000 萬 token
  • 敏感信息洩露時間:一週內
  • 密鑰存儲位置:用戶手機(iOS/Android)唯一
  • 密鑰內存過期時間:7 天
  • 過期時間選擇理由:24 小時過短(用戶可能超過 24 小時不開手機),7 天為實用性與安全平衡
  • 透明日誌平台:CT Store(可公開驗證)
  • 核心代碼規模:約 2 萬行記憶體安全語言
  • 發布流程層級:2 層(基礎鏡像 + 部署驗證)
  • 團隊分離結構:隱私團隊(獨立簽署)+ 開發團隊(無單方變更權)
  • 驗證方式:完整性驗證 + 透明日誌中的真實性確認
  • 審計對象:內部與高端外部審計公司可查所有歷史部署鏡像與數據

結論

結論

對超敏感個人數據的防護,技術隔離(端到端加密、7 天密鑰過期)必須配合組織隔離(隱私團隊獨立、雙層驗證發布)與透明度(公開日誌、可審計),三者缺一不可。

完整解析

詳細

Amazon 收購了一家 AI 可穿戴設備公司,其核心產品是一支手戴麥克風,能持續錄音並為用戶建立個人代理。這類設備的敏感性無與倫比——單個用戶年度可產生約 1000 萬個 token 的錄音,甚至在使用第一週內就能完整洩露用戶向朋友、家人講述的所有機密信息,因此成為市場上最敏感的數據收集工具。

加入 Amazon 後面臨前所未有的挑戰。雖然 Amazon 對客戶提供強大的數據保護承諾,但一旦代碼在內部運行,理論上員工可能擁有訪問權限。團隊的核心使命因此變成:建立一套系統使得 Amazon 員工(包括工程團隊本身)都無法訪問用戶數據。這種內部威脅防護要求遠高於傳統的客戶隱私保障。

系統在兩個層面進行創新。架構層面,傳統 AI 系統採用「請求-回應」模式——用戶手機發送請求至後端,後端計算後返回結果。但個人代理需要完全不同的能力:連續運行、主動執行任務、無需等待用戶觸發,同時不依賴用戶設備在線。為此構建了有狀態運行時環境搭配持久化記憶體,使代理能完全自主運行。

密鑰管理層面採取絕對隔離策略。密鑰在用戶手機上生成,永久存儲於手機內,從不傳送至任何服務器。當手機連接後端時執行複雜的證明流程,驗證工作負載的完整性與真實性,確認部署的代碼確實出現在公開透明日誌(使用 CT Store)中。內存中所有密鑰設定 7 天強制過期,這個時間選擇是精心平衡的——24 小時太短因為用戶可能一天不開手機導致關鍵功能中斷,而 7 天被視為用戶有用行為的現實時間地平線。

為了防止任何人(包括開發團隊)在不留痕跡的情況下發布惡意代碼,系統採用「雙層發布機制」配合「隱私團隊獨立」的組織設計。組織內設有獨立的隱私專責團隊,唯獨他們管理透明日誌與簽署密鑰,這些密鑰被硬編碼於所有客戶應用與後端服務中。開發團隊無法控制隱私團隊,任何變更都需要高層級授權,在 Amazon 這樣的大企業結構中幾乎不可能繞過。發布分為兩步:先構建包含基礎工具的鏡像,部署時再透過透明日誌驗證具體清單,這樣即使開發者想偷偷發布,也會被記錄在無法篡改的透明日誌中。最終的虛擬機自我驗證後簽發證書,將所有加密信息與證明文件嵌入其中。由於公開證書會污染透明日誌,採用私有認證機構;未來計畫引入代理層以標準 TLS 方式提供驗證。

這套多層防護讓內部與外部審計公司能驗證所有歷史部署的鏡像與數據,追蹤任何潛在漏洞,確保系統的可信性。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。