KeyFrame內部研究專用

Serving 2 Million Models Without Melting: Scaling the Hugging Face Hub — Arek Borucki, Hugging Face

AI Engineer·7月28日週二·21 min英文

三句話摘要

Hugging Face 如何透過架構決策與基礎設施優化,應對從 20,000 個模型快速成長至 300 萬個模型的規模挑戰。 Hugging Face 透過元資料 / 二進制分離、全文搜尋引擎升級、讀寫工作負載隔離與多層自動擴縮,在保持用戶體驗簡潔的前提下,成功應對 300 倍的規模成長。 元資料與二進制分離架構:MongoDB 只儲存模型元資料(名稱、配置、權限、計費資訊),實際模型檔案與分詞器存放於 AWS S3,允許獨立擴展每層且針對不同工作負載單獨優化,降低單點瓶頸。

重點整理

重點
  • 1

    元資料與二進制分離架構:MongoDB 只儲存模型元資料(名稱、配置、權限、計費資訊),實際模型檔案與分詞器存放於 AWS S3,允許獨立擴展每層且針對不同工作負載單獨優化,降低單點瓶頸。

  • 2

    搜尋優化的關鍵轉變:從查詢時的正規表達式改為插入時分詞化模型名稱,配合 MongoDB Atlas Search(Apache Lucene 引擎)與自動完成功能,搜尋延遲大幅改善且 P99 響應時間達要求。

  • 3

    讀寫工作負載隔離:7 節點副本集將寫入集中於主節點、讀取分散於從節點,額外隱藏節點專門處理複雜聚合與報告查詢,防止重操作阻塞生產流量並確保一致性。

  • 4

    多層自動擴縮策略:Pod 層用 HPA 基於 CPU / 內存自動調整,集群層用 Cast AI 或 KEDA 基於實際應用指標(請求隊列、事件迴圈利用率)動態增減節點,允許從 10 到 500 個 Pod 的彈性擴展。

實用技巧與重點

乾貨
  • 規模指標:
  • 用戶數:1,400 萬
  • 公共模型:300 萬(兩年成長 150 倍,從 20,000 → 300 萬)
  • 資料集:100 萬(2022 年 10,000 → 2024 年 100 萬)
  • 組織數:5 萬
  • 財富 500 強企業採用比例:>30%
  • 技術棧:
  • 元資料存儲:MongoDB Atlas(7 節點副本集)
  • 二進制存儲:AWS S3
  • 全文搜尋引擎:Apache Lucene(MongoDB Atlas Search)
  • 容器編排:Kubernetes
  • 集群自動擴縮:Cast AI、KEDA(規劃中)
  • 搜尋實作細節:
  • 分詞時機:插入時而非查詢時
  • 索引名稱:「model_search_autocomplete_v3」
  • 排序依據:趨勢分數(過去 7 天下載量 + 讚數)
  • 實例:meta-llama 模型熱度指數 33 和 14
  • Pod 擴縮範圍:
  • 規模區間:10 ~ 500 個 Pod
  • HPA 遷移方案:
  • 現況:基於 CPU / 內存指標
  • 目標:KEDA 事件驅動自動擴縮,使用 RPS、事件迴圈利用率等應用層指標

結論

結論

Hugging Face 透過元資料 / 二進制分離、全文搜尋引擎升級、讀寫工作負載隔離與多層自動擴縮,在保持用戶體驗簡潔的前提下,成功應對 300 倍的規模成長。

完整解析

詳細

Hugging Face 作為全球最快成長的開源 AI 社群平台,面臨指數級規模挑戰。短短兩年內模型數從 20,000 暴增至 300 萬、資料集從 10,000 躍升至 100 萬、用戶突破 1,400 萬大關,其中逾 30% 為財富 500 強企業。此爆發式成長直接衝擊基礎設施,尤其是搜尋功能。當模型數少於 20,000 時,即使無索引也能快速回應;但用戶規模達 1,400 萬時,同樣方案完全失效。1% 的慢搜尋用戶意味著 14 萬人的負面體驗,故優化 P99 響應時間成為重中之重。

針對搜尋瓶頸,團隊詳細介紹優化歷程。過去採用 MongoDB 的 find 方法搭配正規表達式,於查詢時進行文本匹配。隨著資料量爆炸,regex 效率問題浮現導致延遲。轉折點是導入 MongoDB Atlas Search,其底層集成 Apache Lucene 全文搜尋引擎。關鍵創新在改變分詞策略:不再於查詢時分析搜尋詞,而在模型插入時就對名稱進行分詞——例如「meta-llama/llama-3.1」被拆分成「meta」「llama」「3.1」等標籤存入陣列。查詢時直接利用 Lucene 的自動完成功能迅速定位,結合趨勢分數(過去七天下載量與讚數)排序。此優化使搜尋體驗從延遲問題徹底翻身。

平台架構另一核心決策是關注點分離。MongoDB 並不儲存實際模型檔案,只維護元資料(模型名稱、配置、權限、計費等),真實的模型工件、分詞器、配置檔案存放於 AWS S3。此分離讓 Hugging Face 獨立擴展各組件:元資料層優化查詢能力、二進制層優化存儲成本、計算層自由編排。MongoDB 副本集由 7 個節點組成,寫入操作集中於主節點(保證一致性),讀取分散於從節點(提升吞吐量),隱藏節點則隔離報告查詢、複雜聚合等重操作,防止搶佔生產流量。設計確保主節點專注高一致性操作,其他工作負載由專用機器承擔。

容器編排層,Hugging Face 採用 Kubernetes 與多層自動擴縮策略。第一層是水平 Pod 自動擴縮器(HPA),根據 CPU 與記憶體閾值自動增減 Pod 數量,使樞紐規模在 10 到 500 個 Pod 間靈活變動。第二層透過 Cast AI 進行集群自動擴縮,當 HPA 需要新 Pod 但無可用節點時,Cast AI 自動新增基礎設施節點。未來計畫遷移至 KEDA,改為基於實際應用指標(每秒請求數、事件迴圈利用率)而非單純資源使用率進行擴縮,更能對應業務波動。整體設計哲學是隱藏複雜性,讓使用者按下模型按鈕、執行搜尋或下載時一切無縫運作,背後基礎設施複雜度對終端使用者完全透明。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。