This New Open-Source AI Model Is Changing Everything!
三句話摘要
Crayer 2 開源AI影像模型在 ComfyUI 中的完整使用指南,從基礎配置到自訓練角色LoRA。 Crayer 2 以極速、低資源耗用與完善的 LoRA 支援,成為本地 AI 影像生成的最高效選擇,特別適合需要快速迭代與角色一致性的創意工作流。 模型選擇與 VAE 替換:使用 FP8 Turbo 版而非原始版以獲得最佳速度,且必須將默認的 Quen Image VAE 替換為 one 2.1 VAE,這能顯著提升影像連貫性和清晰度。
重點整理
重點- 1
模型選擇與 VAE 替換:使用 FP8 Turbo 版而非原始版以獲得最佳速度,且必須將默認的 Quen Image VAE 替換為 one 2.1 VAE,這能顯著提升影像連貫性和清晰度。
- 2
超快速高質量生成:因為是 Turbo 模型,只需 8 個採樣步驟、CFG 尺度設為 1、Euler Simple 採樣器就能生成細節豐富的影像,速度與 VRAM 使用類似 Z Image Turbo。
- 3
解析度靈活性:直接支援 2048×2048 高解析度生成而無需外接放大,模型在高解析度下不會崩解,反而膚質更銳利、細節更清晰、手腳結構保持正確。
- 4
LoRA 與 LLM 整合:自訓練角色 LoRA 能準確捕捉面部特徵而不破壞場景配置;結合本地 Gemma 4 LLM 做視覺分析自動生成提示詞,可用使用者覆蓋功能微調細節。
實用技巧與重點
乾貨- 模型與工具:
- Crayer 2 FP8 Turbo 版本
- Quen 3 VL4 billion FP8 scaled Clip 模型
- one 2.1 VAE(替代 Quen Image VAE)
- Gemma 4 本地 LLM
- AI Toolkit(LoRA 訓練工具)
- Conditioning career(解禁 LoRA,GitHub 可取)
- 採樣參數:
- K 採樣步數:8 步
- CFG 尺度:1
- 採樣器:Euler Simple(推薦)
- 種子:固定設定(便於迭代)
- 解析度:1024×1024、2048×2048 皆支援
- LoRA 訓練配置:
- 訓練模型:Crayer 2 Turbo
- 訓練方法:Low Rank 適配,rank=4
- 總步數:500 步
- 檢查點保存:每 100 步,最多 5 個檢查點
- 優化器:Auto Magic
- 時間步類型:Sigmoid
- 訓練解析度:512/768(低 VRAM),或 1024(24GB+ VRAM)
- 採樣頻率:每 100 步
- 預計時間:1~2 小時(依 GPU 速度)
- 推薦顯卡:RTX 5090 或 L40S
- 提示詞生成工作流:
- 負面提示詞:watermark(保持輸出乾淨)
- Olima chat 節點連接參考圖片
- 系統提示詞驅動 LLM 分析參考圖片
- 使用者提示詞框覆蓋細節(髮色、眼色等)
結論
結論“Crayer 2 以極速、低資源耗用與完善的 LoRA 支援,成為本地 AI 影像生成的最高效選擇,特別適合需要快速迭代與角色一致性的創意工作流。”
完整解析
詳細Crayer 2 是 2026 年 6 月新發布的開源影像生成模型,在輕量化與生成速度上表現突出。本影片教學展示如何在 ComfyUI 中從零開始構建完整工作流,並透過本地大型語言模型和自訓練角色實現高度客製化的影像生成。
基礎設置涵蓋三個核心載入節點:擴散模型(選用 FP8 Turbo 版本獲得最佳效能)、Quen 3 VL4 Clip 編碼器、以及 VAE 解碼器。重要的是,預設的 Quen Image VAE 應替換為 one 2.1 版本,後者在多次生成中能提供更好的影像連貫性。接著連接兩個文本編碼器分別處理正面和負面提示詞,負面提示詞可簡單設為「watermark」以去除浮水印。K 採樣器是處理引擎,設定 8 步採樣、CFG 尺度 1、Euler Simple 採樣器,最後透過 VAE 解碼和預覽節點輸出可視化結果。整個流程在 1024×1024 解析度下生成速度極快,而且可無損放大至 2048×2048,模型不會在高解析度下出現常見的膚質蠟質化、手指變形或多頭現象,反而細節更清晰。
進階功能包括自訓練角色 LoRA 和本地 LLM 提示詞生成。LoRA 節點能將個人照片轉化為一致的角色表現,準確保留面部特徵、膚色與辨識度,同時不會壓倒場景其他元素。整合 Gemma 4 LLM 時,先載入參考圖片到 Olima chat 節點,由自訂系統提示詞驅動模型分析構圖與風格,自動生成針對 Crayer 2 的詳細提示詞。使用者還可在提示詞框中指定特定細節(如「火紅色肩長髮絲與綠眼」)來覆蓋 LLM 的視覺分析,實現精準控制。
LoRA 訓練透過 AI Toolkit 完成,只需 500 步、使用 rank=4 低秩適配設定。配置包括啟用低 VRAM 選項、設定採樣解析度(低 VRAM 用 512/768,高配置用 1024)、自訂觸發詞、每 100 步保存一個檢查點。訓練過程中可即時監看採樣圖片,第 200 步時已出現高度一致的效果。在 RTX 5090 或 L40S 等高端顯卡上,500 步訓練耗時約 1~2 小時,完成後下載最佳檢查點即可立即使用。整體而言,Crayer 2 相比 ideogram 4 雖在複雜場景提示詞遵守度上略遜,但速度與 VRAM 效率遠優,且 LoRA 支援完善,隨著社群訓練更多專門 LoRA,潛力無窮。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


