KeyFrame內部研究專用

Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai

AI Engineer·8月18日週二·16 min中文

三句話摘要

訓練大型文生圖模型 CREA2 的基礎設施與監測最佳實踐。 大規模模型訓練的成功不在演算法優化,而在於建立精細監測系統和自動化基礎設施,讓系統自我修復與自我調度。 監測是基礎設施的基石 — 大規模訓練容易出現不明崩潰(8 小時以內),無法診斷原因。投資完善的監測系統讓研究員能掌握系統狀態,決定何時移除故障 GPU 或調查跨節點通訊問題。

重點整理

重點
  • 1

    監測是基礎設施的基石 — 大規模訓練容易出現不明崩潰(8 小時以內),無法診斷原因。投資完善的監測系統讓研究員能掌握系統狀態,決定何時移除故障 GPU 或調查跨節點通訊問題。

  • 2

    GPU 利用率指標是誤導的 — 官方的 GPU 利用率顯示 100% 不代表 GPU 在做有效工作。Tensor Core 利用率才能反映真實工作效率,且隨著影像解析度擴展而動態變化。

  • 3

    Infinite Band 監測是必需的 — 訓練過程中大量跨節點通訊,Infinite Band 監測能捕捉訊息延遲、封包遺失與通訊錯誤,往往是訓練失敗的根本原因。

  • 4

    Kubernetes Taints 實現自動資源平衡 — 當訓練任務搶占所有 GPU 時,系統自動標記節點且遷移低優先級工作負載,無需人工操作,既節省成本又保證生產穩定。

實用技巧與重點

乾貨
  • 模型與平台
  • CREA2(K2):支援文生圖、pixel art、photoreal 等風格的預訓練模型
  • 開放 checkpoint(pre-trained)與加速版 Turbo(< 1 秒推理)
  • 平台:Hugging Face、GitHub、CREA.ai
  • 監測指標(必須監控)
  • GPU 溫度 > 78°C → 立即移除該 GPU
  • Tensor Core 利用率(代替 GPU 利用率)
  • Infinite Band 監測:訊息等待時間、錯誤類型、封包計數
  • NVLink 監測:單節點通訊狀態
  • 訓練解析度階段
  • Pre-training: 128 → 256 → 512 pixels
  • Mid-training 與 Post-training: 逐步擴展至 1024 pixels
  • 基礎設施
  • 檔案系統:SafeTensors(推薦,比 Safe 更可靠)
  • 排程:Kubernetes Horizontal Pod Autoscaler (HPA)
  • 虛擬 Kubelet:整合多個雲端提供商
  • Taints 系統:GPU 集群自動標記,無 GPU 時移除 Taints 允許其他 Pod 排程

結論

結論

大規模模型訓練的成功不在演算法優化,而在於建立精細監測系統和自動化基礎設施,讓系統自我修復與自我調度。

完整解析

詳細

CREA 團隊最近推出了名為 CREA2(內部代號 K2)的大型文生圖模型,這個模型是從零開始訓練的預訓練模型。與現有模型不同,CREA2 提供了多種創意應用方向,從 pixel art 風格到逼真攝影級別的影像生成都能支持。團隊開放了兩個版本:完整的 pre-trained checkpoint 供研究員進行微調,以及經過優化的 Turbo 加速版本,能在不到一秒內完成推理。

訓練這樣的大規模模型面臨巨大挑戰。Gabriel 描述初期訓練時,單個運行常常在 8 小時以內莫名其妙崩潰,研究團隊完全無法診斷根本原因。這個問題使得 GPU 利用率極低,高昂的計算成本被浪費在無效的訓練重啟上。解決方案不是調整演算法或模型架構,而是建立完善的監測系統。Gabriel 強調,監測是一切的基礎——沒有可見性,你只能盲目試錯,最終會陷入瘋狂。

監測系統揭露了幾個關鍵問題。首先是 GPU 溫度——單個溫度過高的 GPU(超過 78°C)會降頻,導致整個訓練變得不穩定。解決方式很簡單:不要嘗試修復,直接移除那個 GPU 並請提供商更換。其次是 GPU 利用率的誤導性。官方顯示的 100% 利用率實際上是謊言——它只代表 GPU 在做「某種」工作,但不能反映工作效率。真正有用的指標是 Tensor Core 利用率,它顯示張量核心真正被使用的程度。訓練時,隨著影像解析度從 128 擴展到 1024 pixels,Tensor Core 利用率會逐步上升,因為更高解析度的影像需要更多計算。

最重要但經常被忽視的是 Infinite Band 監測。在分佈式訓練中,大量 GPU 需要跨越節點邊界進行通訊。Infinite Band 是 NVIDIA 的高速互連技術,監測它能捕捉訊息等待時間、不同類型的通訊錯誤、封包遺失等細節。Gabriel 團隊發現,他們大多數訓練失敗實際上源於跨節點通訊問題。此外,NVLink 監測(節點內 GPU 通訊)能幫助識別單節點內的詭異故障——GPU 本身看起來正常,但底層通訊出錯。透過這些細粒度的監測,問題變成可診斷的:看到 NVLink 錯誤?更換 GPU。看到 Infinite Band 延遲尖峰?聯繫網路供應商。

訓練過程中還需要激進地使用檢查點機制。初期 SafeTensors 的實現不夠可靠,團隊改用更穩定的備份策略。檢查點不只是為了恢復,更是應對頻繁崩潰的現實策略——預期訓練會在各種詭異的時間點失敗,建立完整的恢復流程是必要的。

基礎設施層面,Gabriel 的團隊建構了一套基於 Kubernetes 的自動化排程系統,整合多個雲端 GPU 提供商(虛擬 Kubelet)。這個系統透過 Kubernetes 的 Taints(污點)機制實現自我修復。當大型訓練任務啟動並搶占所有 GPU 時,系統自動在節點上添加 Taints 標記,阻止其他 Pod 排程到這些節點,從而保留 GPU 給訓練使用。當訓練完成釋放 GPU 時,系統移除 Taints,低優先級的推理或生產工作負載得以重新排程到這些 GPU。整個過程完全自動化,無需人工干預。相比直接使用 noexecute Taints 直接踢出所有 Pod(會導致服務中斷),這個漸進式遷移機制保證了生產穩定性。系統使用 Kubernetes HPAs(水平 Pod 自動擴展器)和簡單的 Prometheus 監測觸發邏輯,既優雅又高效。

這套自動化系統的美妙之處在於,研究團隊不再需要手動管理 GPU 資源。他們只需提交訓練任務,系統自動處理資源分配、故障遷移、優先級平衡。推理伺服器和生產工作可以共享同一個 GPU 集群,文生圖模型甚至能容忍「壞」GPU(溫度過高、接近故障邊界)進行推理,因為推理任務對單個 GPU 故障的容錯能力遠強於訓練任務。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。