KeyFrame內部研究專用

This New Open-Source AI Model Is Changing Everything!

Aiconomist·6月26日週五·16 min英文

三句話摘要

Crayer 2 開源AI影像模型在 ComfyUI 中的完整使用指南,從基礎配置到自訓練角色LoRA。 Crayer 2 以極速、低資源耗用與完善的 LoRA 支援,成為本地 AI 影像生成的最高效選擇,特別適合需要快速迭代與角色一致性的創意工作流。 模型選擇與 VAE 替換:使用 FP8 Turbo 版而非原始版以獲得最佳速度,且必須將默認的 Quen Image VAE 替換為 one 2.1 VAE,這能顯著提升影像連貫性和清晰度。

重點整理

重點
  • 1

    模型選擇與 VAE 替換:使用 FP8 Turbo 版而非原始版以獲得最佳速度,且必須將默認的 Quen Image VAE 替換為 one 2.1 VAE,這能顯著提升影像連貫性和清晰度。

  • 2

    超快速高質量生成:因為是 Turbo 模型,只需 8 個採樣步驟、CFG 尺度設為 1、Euler Simple 採樣器就能生成細節豐富的影像,速度與 VRAM 使用類似 Z Image Turbo。

  • 3

    解析度靈活性:直接支援 2048×2048 高解析度生成而無需外接放大,模型在高解析度下不會崩解,反而膚質更銳利、細節更清晰、手腳結構保持正確。

  • 4

    LoRA 與 LLM 整合:自訓練角色 LoRA 能準確捕捉面部特徵而不破壞場景配置;結合本地 Gemma 4 LLM 做視覺分析自動生成提示詞,可用使用者覆蓋功能微調細節。

實用技巧與重點

乾貨
  • 模型與工具:
  • Crayer 2 FP8 Turbo 版本
  • Quen 3 VL4 billion FP8 scaled Clip 模型
  • one 2.1 VAE(替代 Quen Image VAE)
  • Gemma 4 本地 LLM
  • AI Toolkit(LoRA 訓練工具)
  • Conditioning career(解禁 LoRA,GitHub 可取)
  • 採樣參數:
  • K 採樣步數:8 步
  • CFG 尺度:1
  • 採樣器:Euler Simple(推薦)
  • 種子:固定設定(便於迭代)
  • 解析度:1024×1024、2048×2048 皆支援
  • LoRA 訓練配置:
  • 訓練模型:Crayer 2 Turbo
  • 訓練方法:Low Rank 適配,rank=4
  • 總步數:500 步
  • 檢查點保存:每 100 步,最多 5 個檢查點
  • 優化器:Auto Magic
  • 時間步類型:Sigmoid
  • 訓練解析度:512/768(低 VRAM),或 1024(24GB+ VRAM)
  • 採樣頻率:每 100 步
  • 預計時間:1~2 小時(依 GPU 速度)
  • 推薦顯卡:RTX 5090 或 L40S
  • 提示詞生成工作流:
  • 負面提示詞:watermark(保持輸出乾淨)
  • Olima chat 節點連接參考圖片
  • 系統提示詞驅動 LLM 分析參考圖片
  • 使用者提示詞框覆蓋細節(髮色、眼色等)

結論

結論

Crayer 2 以極速、低資源耗用與完善的 LoRA 支援,成為本地 AI 影像生成的最高效選擇,特別適合需要快速迭代與角色一致性的創意工作流。

完整解析

詳細

Crayer 2 是 2026 年 6 月新發布的開源影像生成模型,在輕量化與生成速度上表現突出。本影片教學展示如何在 ComfyUI 中從零開始構建完整工作流,並透過本地大型語言模型和自訓練角色實現高度客製化的影像生成。

基礎設置涵蓋三個核心載入節點:擴散模型(選用 FP8 Turbo 版本獲得最佳效能)、Quen 3 VL4 Clip 編碼器、以及 VAE 解碼器。重要的是,預設的 Quen Image VAE 應替換為 one 2.1 版本,後者在多次生成中能提供更好的影像連貫性。接著連接兩個文本編碼器分別處理正面和負面提示詞,負面提示詞可簡單設為「watermark」以去除浮水印。K 採樣器是處理引擎,設定 8 步採樣、CFG 尺度 1、Euler Simple 採樣器,最後透過 VAE 解碼和預覽節點輸出可視化結果。整個流程在 1024×1024 解析度下生成速度極快,而且可無損放大至 2048×2048,模型不會在高解析度下出現常見的膚質蠟質化、手指變形或多頭現象,反而細節更清晰。

進階功能包括自訓練角色 LoRA 和本地 LLM 提示詞生成。LoRA 節點能將個人照片轉化為一致的角色表現,準確保留面部特徵、膚色與辨識度,同時不會壓倒場景其他元素。整合 Gemma 4 LLM 時,先載入參考圖片到 Olima chat 節點,由自訂系統提示詞驅動模型分析構圖與風格,自動生成針對 Crayer 2 的詳細提示詞。使用者還可在提示詞框中指定特定細節(如「火紅色肩長髮絲與綠眼」)來覆蓋 LLM 的視覺分析,實現精準控制。

LoRA 訓練透過 AI Toolkit 完成,只需 500 步、使用 rank=4 低秩適配設定。配置包括啟用低 VRAM 選項、設定採樣解析度(低 VRAM 用 512/768,高配置用 1024)、自訂觸發詞、每 100 步保存一個檢查點。訓練過程中可即時監看採樣圖片,第 200 步時已出現高度一致的效果。在 RTX 5090 或 L40S 等高端顯卡上,500 步訓練耗時約 1~2 小時,完成後下載最佳檢查點即可立即使用。整體而言,Crayer 2 相比 ideogram 4 雖在複雜場景提示詞遵守度上略遜,但速度與 VRAM 效率遠優,且 LoRA 支援完善,隨著社群訓練更多專門 LoRA,潛力無窮。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。