Training Krea 2: What matters in generative model training — Sangwu Lee, Krea.ai
三句話摘要
開源影像基礎模型 Create 2 的訓練方法論與數據策略。 數據質量與訓練管線設計是決定現代擴散模型性能的核心,比單純的架構創新更為關鍵。 風格多樣性 vs. 可靠性的取捨:既有模型(ChatGPT、DALL-E)傾向模式坍縮以確保一致性,會生成「最無聊的平均人類」;Create 2 改由追求快速生成和視覺探索空間,讓創意工作室能迭代多種視覺方向。
重點整理
重點- 1
風格多樣性 vs. 可靠性的取捨:既有模型(ChatGPT、DALL-E)傾向模式坍縮以確保一致性,會生成「最無聊的平均人類」;Create 2 改由追求快速生成和視覺探索空間,讓創意工作室能迭代多種視覺方向。
- 2
數據質量決定模型天花板:強調數據比程式碼更永恆,訓練後無法輕易改變,因此須在開始前投資大量篩選與去重工作(語義去重 SSCD、OCR 標籤、稀疏自編碼器過濾)。
- 3
LLM 啟發的漸進式訓練法:從低解析度學習文字-圖像對應,逐步升至高解析度學結構與細節;類似 LLM 的微調→偏好優化→強化學習三階段,用獎勵模型改進文字渲染與解剖學準確性。
- 4
提示詞擴展器的關鍵角色:訓練小型 LLM 將使用者簡短提示展開為詳細、符合訓練分佈的長提示,這在製造級擴散模型中已成必備。
實用技巧與重點
乾貨- 訓練解析度範圍:256 × 256 到 1024 × 1024 像素
- 自製過濾器數量:30-40 種客製化特徵與過濾規則
- 去重方法:P-Hash / MD5(基礎),SSCD(語義)
- 訓練管線階段:
- 低→高解析度預訓練
- 監督微調(插圖、平面設計、攝影、電影級數據)
- 偏好最佳化(成對對比)
- 強化學習(GRPO 啟發方法,用獎勵伺服器)
- 提示詞擴展器訓練
- 數據規模:2-10 億張圖像
- 知識補全:Wikipedia 前 90 百分位頁面排名概念納入
- OCR 與視覺語言模型:用 LM 生成詳細視覺描述以校正標籤準確性
- 未來研究:多專家蒸餾(攝影、文字渲染、不同能力的專家)、簡化技術棧(移除 VAE、統一 Transformer)、場景圖與邊界框條件化
結論
結論“數據質量與訓練管線設計是決定現代擴散模型性能的核心,比單純的架構創新更為關鍵。”
完整解析
詳細講者來自 Create 2 模型開發團隊,談論該模型的開源中等版本及其訓練方法論。背景問題在於既有生成模型面臨一個權衡困境:為了確保輸出穩定性,大模型傾向於「模式坍縮」——當渲染人物時,最簡單最可靠的方式是生成「最無聊的平均人類」置於畫面中心,導致多樣性喪失。ChatGPT 2、DALL-E Pro 等生產級模型雖品質高但迭代時間長(可達一分鐘),且缺乏創意調整空間。
Create 2 的設計哲學反向而行,強調快速生成與風格探索。為此,數據成為決定性因素。講者列舉了開發團隊使用的完整數據策略:從 2-10 億張圖像開始,先用 P-Hash 和 MD5 進行基礎去重,再透過 SSCD 執行語義去重檢測類似圖像。為解決標籤品質問題,團隊採用 OCR 萃取原始標籤,再透過大型視覺語言模型生成詳細描述,篩掉邊框乾物件等不良特徵。此外從 Wikipedia 萃取前 90 百分位的概念(依頁面排名),確保模型理解重要實體與知識。整體使用了 30-40 種自製客製化過濾器與特徵。
訓練管線仿效 LLM 的成熟方法。先在低解析度(256×256)進行預訓練,讓擴散模型學會「馬匹長什麼樣」等文字-圖像對應,此階段成本低效率高。後逐步升至 1024×1024 高解析度,學習結構與細節。預訓練後進入監督微調,用精選的插圖、平面設計、攝影、電影級數據「塑造」模型分佈。再用偏好最佳化(類似 RLHF)收集成對對比資料進一步打磨。隨後用強化學習(GRPO 啟發方法)透過獎勵伺服器回饋優化文字渲染與解剖學正確性。最後訓練提示詞擴展器——一個小型 LLM,將「燃燒的骷髏頭」這類簡短提示擴展為與訓練數據分佈一致的長詳細描述,從而獲得更好生成品質。
講者提及多個優化方向:稀疏自編碼器可無監督提取特徵用於過濾(如簽名、浮水印、邊界雜物);多專家蒸餾讓單一學生模型融合攝影、文字渲染等專家能力;簡化技術棧排除 VAE 與文字編碼器,統一用 Transformer。展望未來,視覺語言模型進步使邊界框與場景圖生成成本大幅下降,有望成為新型條件化方式探索。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


