KeyFrame內部研究專用

The Future of AI Infrastructure with CoreWeave

Practical AI·7月17日週五·50 min英文

三句話摘要

AI 基礎設施正在經歷從通用雲計算到 AI 專用優化的轉變,CoreWeave 通過垂直整合的解決方案幫助企業在 AI 工程循環中做到更多更快。 AI 基礎設施正從通用雲向專用優化轉變,垂直整合平台與代理自動化將通過「AI 循環」加速迭代,最終實現 AI 工程的大眾化。 AI 工作負載的基礎設施革新

重點整理

重點
  • 1

    AI 工作負載的基礎設施革新

  • 2

    訓練與推理工作負載對基礎設施的要求截然不同於傳統雲計算。訓練需要數百到數十萬個 GPU 深度互聯、專用網絡與存儲,無法像通用雲那樣臨時擴展。CoreWeave 識別出 GPU 故障檢測(硬故障和軟故障如「掉隊」slowdown)、存儲瓶頸等隱性問題,通過專用觀測工具提升透明度。

  • 3

    AI 循環(AI Loop)與代理驅動的迭代

  • 4

    未來的 AI 應用不再是單次調用前沿模型,而是多層次的推理流:關鍵任務用大模型深度分析,簡單任務用小模型降低成本。通過生產追蹤發現性能瓶頸 → 用 Aria 代理提示優化方向(換模型、調提示詞、微調)→ 快速評估 → 部署回生產,形成持續改進循環。

  • 5

    開放與最佳化的平衡

  • 6

    CoreWeave 支持多雲策略,不追求完全鎖定客戶。提供 Sunk(Slurm on Kubernetes)等開源背景工具,目標是通過「愛的鎖定」——提供最優服務讓用戶主動選擇——而非技術綁定。即將推出 Sunk Anywhere,客戶可在其他基礎設施上部署相同服務。

  • 7

    民主化 AI 工程的責任

  • 8

    當前前沿實驗室人才稀缺,企業缺乏 AI 工程團隊。平台需要通過自動化(Aria 代理)、整合工具鏈、邊緣支持等方式,讓更多企業和研究者以更低成本做高質量的 AI 開發。

實用技巧與重點

乾貨
  • CoreWeave 核心服務與工具:
  • Weights & Biases:實驗追蹤、可視化(包含新增機器人視覺支持)
  • Aria:AI 研究與迭代代理,自動分析實驗並建議下一步
  • Sunk:Slurm on Kubernetes,整合任務調度與容器編排
  • Sunk Anywhere:跨雲部署版本
  • Mission Control + Direct to Expert:垂直領域客製化工程支援(已加入工業製造專家從併購 Monolith)
  • GPU 故障檢測:
  • GPU Straggler Detection:發現數百至數萬 GPU 集群中性能下降的單個 GPU
  • 可同時追蹤硬件故障與軟故障(如存儲加載延遲)
  • 時間預測:
  • Corey 認為 AI 工程團隊規模將在 5-7 年內超越雲工程團隊
  • 交互模式轉變:從「點擊按鈕」進化為代理引導、視覺化回應的多模態交互
  • 成本優化策略:
  • 選擇適當規模的模型而非總是用前沿大模型
  • 模型微調與強化學習減少模型體積或提升效率
  • Aria 代理建議優先調整提示詞而非昂貴微調
  • 多模型組合應用(30-50 個模型協作)比單一大模型更經濟
  • 開放源設計基礎:
  • Kubernetes、Slurm 皆為開源項目
  • CoreWeave 價值主張:優化開源工具而非創造專有技術

結論

結論

AI 基礎設施正從通用雲向專用優化轉變,垂直整合平台與代理自動化將通過「AI 循環」加速迭代,最終實現 AI 工程的大眾化。

完整解析

詳細

Corey Sanders 在微軟 20 年的經歷塑造了他對 AI 基礎設施的洞察。他指出,當前 AI 的快速發展正重演雲計算的演進路徑——從邊緣應用逐漸滲透到每一個軟件系統。但 AI 面臨一個雲計算當初沒有的根本問題:訓練工作負載的複雜性完全不同。

在傳統雲時代,通用計算資源可以靈活配置——需要更多運算能力就臨時添加伺服器。但 AI 訓練不同。數百或數千個 GPU 必須緊密互聯、共享專用網絡與存儲層,任何一個環節的故障或放緩都會拖累整個集群。加之 GPU 成本極高,任何效率損失都意味著巨大的經濟損失。因此,基礎設施必須從硬件物理配置、網絡拓撲到任務調度編排,全層面針對 AI 工作負載優化。

CoreWeave 在此洞察下,構建了垂直整合的平台。訓練端提供專用的故障檢測(例如 GPU 掉隊檢測)與性能監測;推理端則通過集成 Weights & Biases 進行實驗追蹤與可視化。但真正的創新在於引入了 Aria——一個自動分析實驗數據並建議下一步優化的代理。傳統做法是研究者手工對比六次運行的線圖,費時費力;而 Aria 可以在一夜之間自動比較、分析,並告訴你「這個參數改動帶來了 15% 的性能提升,建議接下來試試調整這個提示詞」。這樣的自動化大幅加速了「試驗-學習-改進」的循環。

Sunk(Slurm on Kubernetes)則解決了另一個痛點。Slurm 是 AI 研究領域的事實標準任務調度器,被全球研究機構廣泛使用;Kubernetes 則擅長基礎設施編排與故障恢復。兩者本應互補,但實際整合複雜且脆弱。CoreWeave 將二者無縫融合,並即將推出 Sunk Anywhere,讓客戶即使在其他雲上也能享受這套優化。

在成本民主化層面,Corey 強調多層次推理架構的重要性。不是所有任務都需要調用最強的前沿模型。基因折疊、藥物發現等專業領域可能需要定制小模型;簡單的分類或翻譯可用更小的模型;複雜分析才需要大模型。通過 Aria 代理的指導,企業可以快速識別哪些任務真正需要貴的大模型,哪些可以降級到便宜的小模型——通常調整提示詞就夠了,無需昂貴的微調。

Corey 對未來的願景更加宏大:他預測 AI 工程師團隊將在 5-7 年內成為企業的核心職能,規模超過傳統雲工程團隊。交互模式也會根本改變——從「點擊購買按鈕」這類靜態界面進化為代理引導、多模態反應的動態對話。網站、儀表板等當今「modern」的交互形式將被視為過時。就像雲計算從邊緣應用發展到驅動世界杯直播與播客記錄,AI 也將無所不在,但前提是平台必須透過代理自動化、整合工具鏈、開放多雲支援,讓非頂尖研究機構的企業也能參與 AI 創新。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。