Boogu-Image-0.1 ComfyUI Tutorial — Base, Turbo & Edit Walkthrough
三句話摘要
Boo-Goo Image 0.1 開源圖像生成模型的性能測試與實戰應用指南。 Boo-Goo Image 0.1 以 10 億參數實現了與大型閉源模型相當的性能,其 Edit 變體在開源模型中的圖像編輯能力領先業界水準。 參數效率突破:10 億參數超越 20-80 倍大的模型,採用統一多模態框架實現高效率。模型在同一管道內理解和生成圖像,支持中英雙語文字渲染和更好的提示詞對齐。
重點整理
重點- 1
參數效率突破:10 億參數超越 20-80 倍大的模型,採用統一多模態框架實現高效率。模型在同一管道內理解和生成圖像,支持中英雙語文字渲染和更好的提示詞對齐。
- 2
三變體應對不同場景:Base 模型質量最優(30-50 步採樣)用於高保真需求,Turbo 僅 4 步採樣實現秒級生成,Edit 專門做圖像編辑且自動保留背景區域。
- 3
Turbo 有質量權衡:多人物場景和文字海報生成中,Turbo 多樣性和準確度不如 Base(海報文字容易錯誤),但可透過雙採樣傳遞(Base→Turbo 或 Turbo 兩次)改善。
- 4
Edit 變體紋理保留能力超群:精準保留原圖的混凝土質感、磚牆紋理、衣服圖案等細節,相比 Quen Image Edit 在複雜背景編輯中表現更優。
實用技巧與重點
乾貨- 模型規格
- 名稱:Boo-Goo Image 0.1
- 參數量:10 億
- 開源協議:Apache 2.0(可商用)
- Quen Image 基準得分:53.58
- 性能對標
- 超越 Quen Image 2(20 億參數)
- 超越 Hanyuan Image 3.0(80 億參數)
- 僅次於閉源的 GPT Image 2 和 Nano Banana Pro
- 三個變體及配置
- Base:30-50 步採樣(ComfyUI 可從 20 步開始)
- Turbo:4 步採樣,H100 上 1 秒內生成,採樣方法用 LCM,調度器用 SGM uniform
- Edit:圖像編輯,自動保留非編輯區域
- 必要模型組件
- 擴散模型:base/turbo/edit 分別下載
- VAE:使用 Flux One(可復用其他模型下載的版本)
- 文字編碼器:Quen3VL(可復用)
- LoRA 模型:用於將 Base 模型降低採樣步數至 Turbo 水平
- 工作流設置
- 單步文轉圖:選用 Base 或 Turbo 直接採樣
- 雙步傳遞:第一步文轉圖,第二步圖轉圖細化(降噪值≤0.5)
- 參考圖像編輯:支持用文本或參考圖像引導 Edit 模型
- 質量對比結果
- 多人物生成:Base 準確(多種族),Turbo 單一
- 文字海報:Base 近完美,Turbo 有錯別字
- 複雜紋理編輯:Base/Edit 保留完整,優於 Quen Image Edit
結論
結論“Boo-Goo Image 0.1 以 10 億參數實現了與大型閉源模型相當的性能,其 Edit 變體在開源模型中的圖像編輯能力領先業界水準。”
完整解析
詳細Boo-Goo Image 0.1 是近期推出的開源圖像生成模型,採用 Apache 2.0 授權允許商業使用。該模型共有三個變體設計,分別針對不同應用場景。Base 模型專注高質量文本轉圖像生成,Turbo 變體透過 DMD 蒸餾技術實現了極速推理,在 NVIDIA H100 上可在 1 秒內完成圖像生成,而 Edit 變體則特別針對圖像編輯任務,支持用自然語言對現有圖像進行修改。
該模型的核心競爭力在於其參數效率。僅 10 億參數的規模卻在 Quen Image 基準測試中獲得 53.58 的得分,這個成績超越了擁有 20 億參數的 Quen Image 2 和 80 億參數的 Hanyuan Image 3.0 模型。這種參數量與性能的倒掛歸功於其採用的統一多模態框架,該框架使得模型能夠在同一管道內理解和生成圖像,從而實現更好的提示詞對齊、更協調的圖像合成,以及開箱即用的中英文雙語文字渲染能力。Turbo 變體更是只需 4 步採樣就能生成圖像,甚至可在消費級硬體上實現接近實時的生成速度。
在實測中,Base 模型在各項指標上都表現出色。其採樣步數通常在 30-50 步範圍內(ComfyUI 環境下可從 20-30 步開始),生成的圖像在細節上更加自然精緻。與之相比,Turbo 模型雖然速度快得驚人,但在某些方面有權衡。例如在多人物場景生成中,Base 模型能夠準確理解「多樣化的一群朋友」的描述,生成包含不同種族的人物,而 Turbo 模型則傾向生成單一種族。在文字海報生成中,Base 模型的文字準確度接近完美,而 Turbo 模型容易出現錯別字和拼寫混亂。對於需要多次採樣的工作流,可以採用雙步傳遞策略:第一步用 Base 或 Turbo 進行文本轉圖像,第二步進行圖像轉圖像細化,透過控制降噪值在 0.5 以下來進行溫和的細節增強。
Edit 變體展現了令人印象深刻的圖像編輯能力。它能夠自動保留非目標區域,精準保留原圖的紋理、圖案和光影細節。在移除夾克、新增人物、改變服裝等編輯任務中,該模型展現出與原圖高度一致的紋理和樣式延續性。相比之下,競品 Quen Image Edit 在處理複雜紋理(如街道混凝土、牆面磚塊紋理)時容易喪失細節。使用 Edit 模型時,使用者既可以透過文本提示新增元素,也可以用參考圖像進行指導。該模型特別擅長處理服飾和配件的編輯,同時能在多元素編輯中保持背景的紋理完整性,這對於需要保留原圖高保真細節的創意工作流而言是個顯著優勢。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


