KeyFrame內部研究專用

Training Krea 2: What matters in generative model training — Sangwu Lee, Krea.ai

AI Engineer·8月18日週二·21 min中文

三句話摘要

開源影像基礎模型 Create 2 的訓練方法論與數據策略。 數據質量與訓練管線設計是決定現代擴散模型性能的核心,比單純的架構創新更為關鍵。 風格多樣性 vs. 可靠性的取捨:既有模型(ChatGPT、DALL-E)傾向模式坍縮以確保一致性,會生成「最無聊的平均人類」;Create 2 改由追求快速生成和視覺探索空間,讓創意工作室能迭代多種視覺方向。

重點整理

重點
  • 1

    風格多樣性 vs. 可靠性的取捨:既有模型(ChatGPT、DALL-E)傾向模式坍縮以確保一致性,會生成「最無聊的平均人類」;Create 2 改由追求快速生成和視覺探索空間,讓創意工作室能迭代多種視覺方向。

  • 2

    數據質量決定模型天花板:強調數據比程式碼更永恆,訓練後無法輕易改變,因此須在開始前投資大量篩選與去重工作(語義去重 SSCD、OCR 標籤、稀疏自編碼器過濾)。

  • 3

    LLM 啟發的漸進式訓練法:從低解析度學習文字-圖像對應,逐步升至高解析度學結構與細節;類似 LLM 的微調→偏好優化→強化學習三階段,用獎勵模型改進文字渲染與解剖學準確性。

  • 4

    提示詞擴展器的關鍵角色:訓練小型 LLM 將使用者簡短提示展開為詳細、符合訓練分佈的長提示,這在製造級擴散模型中已成必備。

實用技巧與重點

乾貨
  • 訓練解析度範圍:256 × 256 到 1024 × 1024 像素
  • 自製過濾器數量:30-40 種客製化特徵與過濾規則
  • 去重方法:P-Hash / MD5(基礎),SSCD(語義)
  • 訓練管線階段
  • 低→高解析度預訓練
  • 監督微調(插圖、平面設計、攝影、電影級數據)
  • 偏好最佳化(成對對比)
  • 強化學習(GRPO 啟發方法,用獎勵伺服器)
  • 提示詞擴展器訓練
  • 數據規模:2-10 億張圖像
  • 知識補全:Wikipedia 前 90 百分位頁面排名概念納入
  • OCR 與視覺語言模型:用 LM 生成詳細視覺描述以校正標籤準確性
  • 未來研究:多專家蒸餾(攝影、文字渲染、不同能力的專家)、簡化技術棧(移除 VAE、統一 Transformer)、場景圖與邊界框條件化

結論

結論

數據質量與訓練管線設計是決定現代擴散模型性能的核心,比單純的架構創新更為關鍵。

完整解析

詳細

講者來自 Create 2 模型開發團隊,談論該模型的開源中等版本及其訓練方法論。背景問題在於既有生成模型面臨一個權衡困境:為了確保輸出穩定性,大模型傾向於「模式坍縮」——當渲染人物時,最簡單最可靠的方式是生成「最無聊的平均人類」置於畫面中心,導致多樣性喪失。ChatGPT 2、DALL-E Pro 等生產級模型雖品質高但迭代時間長(可達一分鐘),且缺乏創意調整空間。

Create 2 的設計哲學反向而行,強調快速生成與風格探索。為此,數據成為決定性因素。講者列舉了開發團隊使用的完整數據策略:從 2-10 億張圖像開始,先用 P-Hash 和 MD5 進行基礎去重,再透過 SSCD 執行語義去重檢測類似圖像。為解決標籤品質問題,團隊採用 OCR 萃取原始標籤,再透過大型視覺語言模型生成詳細描述,篩掉邊框乾物件等不良特徵。此外從 Wikipedia 萃取前 90 百分位的概念(依頁面排名),確保模型理解重要實體與知識。整體使用了 30-40 種自製客製化過濾器與特徵。

訓練管線仿效 LLM 的成熟方法。先在低解析度(256×256)進行預訓練,讓擴散模型學會「馬匹長什麼樣」等文字-圖像對應,此階段成本低效率高。後逐步升至 1024×1024 高解析度,學習結構與細節。預訓練後進入監督微調,用精選的插圖、平面設計、攝影、電影級數據「塑造」模型分佈。再用偏好最佳化(類似 RLHF)收集成對對比資料進一步打磨。隨後用強化學習(GRPO 啟發方法)透過獎勵伺服器回饋優化文字渲染與解剖學正確性。最後訓練提示詞擴展器——一個小型 LLM,將「燃燒的骷髏頭」這類簡短提示擴展為與訓練數據分佈一致的長詳細描述,從而獲得更好生成品質。

講者提及多個優化方向:稀疏自編碼器可無監督提取特徵用於過濾(如簽名、浮水印、邊界雜物);多專家蒸餾讓單一學生模型融合攝影、文字渲染等專家能力;簡化技術棧排除 VAE 與文字編碼器,統一用 Transformer。展望未來,視覺語言模型進步使邊界框與場景圖生成成本大幅下降,有望成為新型條件化方式探索。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。