The Future of AI Infrastructure with CoreWeave
三句話摘要
AI 基礎設施正在經歷從通用雲計算到 AI 專用優化的轉變,CoreWeave 通過垂直整合的解決方案幫助企業在 AI 工程循環中做到更多更快。 AI 基礎設施正從通用雲向專用優化轉變,垂直整合平台與代理自動化將通過「AI 循環」加速迭代,最終實現 AI 工程的大眾化。 AI 工作負載的基礎設施革新
重點整理
重點- 1
AI 工作負載的基礎設施革新
- 2
訓練與推理工作負載對基礎設施的要求截然不同於傳統雲計算。訓練需要數百到數十萬個 GPU 深度互聯、專用網絡與存儲,無法像通用雲那樣臨時擴展。CoreWeave 識別出 GPU 故障檢測(硬故障和軟故障如「掉隊」slowdown)、存儲瓶頸等隱性問題,通過專用觀測工具提升透明度。
- 3
AI 循環(AI Loop)與代理驅動的迭代
- 4
未來的 AI 應用不再是單次調用前沿模型,而是多層次的推理流:關鍵任務用大模型深度分析,簡單任務用小模型降低成本。通過生產追蹤發現性能瓶頸 → 用 Aria 代理提示優化方向(換模型、調提示詞、微調)→ 快速評估 → 部署回生產,形成持續改進循環。
- 5
開放與最佳化的平衡
- 6
CoreWeave 支持多雲策略,不追求完全鎖定客戶。提供 Sunk(Slurm on Kubernetes)等開源背景工具,目標是通過「愛的鎖定」——提供最優服務讓用戶主動選擇——而非技術綁定。即將推出 Sunk Anywhere,客戶可在其他基礎設施上部署相同服務。
- 7
民主化 AI 工程的責任
- 8
當前前沿實驗室人才稀缺,企業缺乏 AI 工程團隊。平台需要通過自動化(Aria 代理)、整合工具鏈、邊緣支持等方式,讓更多企業和研究者以更低成本做高質量的 AI 開發。
實用技巧與重點
乾貨- CoreWeave 核心服務與工具:
- Weights & Biases:實驗追蹤、可視化(包含新增機器人視覺支持)
- Aria:AI 研究與迭代代理,自動分析實驗並建議下一步
- Sunk:Slurm on Kubernetes,整合任務調度與容器編排
- Sunk Anywhere:跨雲部署版本
- Mission Control + Direct to Expert:垂直領域客製化工程支援(已加入工業製造專家從併購 Monolith)
- GPU 故障檢測:
- GPU Straggler Detection:發現數百至數萬 GPU 集群中性能下降的單個 GPU
- 可同時追蹤硬件故障與軟故障(如存儲加載延遲)
- 時間預測:
- Corey 認為 AI 工程團隊規模將在 5-7 年內超越雲工程團隊
- 交互模式轉變:從「點擊按鈕」進化為代理引導、視覺化回應的多模態交互
- 成本優化策略:
- 選擇適當規模的模型而非總是用前沿大模型
- 模型微調與強化學習減少模型體積或提升效率
- Aria 代理建議優先調整提示詞而非昂貴微調
- 多模型組合應用(30-50 個模型協作)比單一大模型更經濟
- 開放源設計基礎:
- Kubernetes、Slurm 皆為開源項目
- CoreWeave 價值主張:優化開源工具而非創造專有技術
結論
結論“AI 基礎設施正從通用雲向專用優化轉變,垂直整合平台與代理自動化將通過「AI 循環」加速迭代,最終實現 AI 工程的大眾化。”
完整解析
詳細Corey Sanders 在微軟 20 年的經歷塑造了他對 AI 基礎設施的洞察。他指出,當前 AI 的快速發展正重演雲計算的演進路徑——從邊緣應用逐漸滲透到每一個軟件系統。但 AI 面臨一個雲計算當初沒有的根本問題:訓練工作負載的複雜性完全不同。
在傳統雲時代,通用計算資源可以靈活配置——需要更多運算能力就臨時添加伺服器。但 AI 訓練不同。數百或數千個 GPU 必須緊密互聯、共享專用網絡與存儲層,任何一個環節的故障或放緩都會拖累整個集群。加之 GPU 成本極高,任何效率損失都意味著巨大的經濟損失。因此,基礎設施必須從硬件物理配置、網絡拓撲到任務調度編排,全層面針對 AI 工作負載優化。
CoreWeave 在此洞察下,構建了垂直整合的平台。訓練端提供專用的故障檢測(例如 GPU 掉隊檢測)與性能監測;推理端則通過集成 Weights & Biases 進行實驗追蹤與可視化。但真正的創新在於引入了 Aria——一個自動分析實驗數據並建議下一步優化的代理。傳統做法是研究者手工對比六次運行的線圖,費時費力;而 Aria 可以在一夜之間自動比較、分析,並告訴你「這個參數改動帶來了 15% 的性能提升,建議接下來試試調整這個提示詞」。這樣的自動化大幅加速了「試驗-學習-改進」的循環。
Sunk(Slurm on Kubernetes)則解決了另一個痛點。Slurm 是 AI 研究領域的事實標準任務調度器,被全球研究機構廣泛使用;Kubernetes 則擅長基礎設施編排與故障恢復。兩者本應互補,但實際整合複雜且脆弱。CoreWeave 將二者無縫融合,並即將推出 Sunk Anywhere,讓客戶即使在其他雲上也能享受這套優化。
在成本民主化層面,Corey 強調多層次推理架構的重要性。不是所有任務都需要調用最強的前沿模型。基因折疊、藥物發現等專業領域可能需要定制小模型;簡單的分類或翻譯可用更小的模型;複雜分析才需要大模型。通過 Aria 代理的指導,企業可以快速識別哪些任務真正需要貴的大模型,哪些可以降級到便宜的小模型——通常調整提示詞就夠了,無需昂貴的微調。
Corey 對未來的願景更加宏大:他預測 AI 工程師團隊將在 5-7 年內成為企業的核心職能,規模超過傳統雲工程團隊。交互模式也會根本改變——從「點擊購買按鈕」這類靜態界面進化為代理引導、多模態反應的動態對話。網站、儀表板等當今「modern」的交互形式將被視為過時。就像雲計算從邊緣應用發展到驅動世界杯直播與播客記錄,AI 也將無所不在,但前提是平台必須透過代理自動化、整合工具鏈、開放多雲支援,讓非頂尖研究機構的企業也能參與 AI 創新。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


