KeyFrame內部研究專用

Boogu-Image-0.1 ComfyUI Tutorial — Base, Turbo & Edit Walkthrough

Benji’s AI Playground·6月22日週一·16 min英文

三句話摘要

Boo-Goo Image 0.1 開源圖像生成模型的性能測試與實戰應用指南。 Boo-Goo Image 0.1 以 10 億參數實現了與大型閉源模型相當的性能,其 Edit 變體在開源模型中的圖像編輯能力領先業界水準。 參數效率突破:10 億參數超越 20-80 倍大的模型,採用統一多模態框架實現高效率。模型在同一管道內理解和生成圖像,支持中英雙語文字渲染和更好的提示詞對齐。

重點整理

重點
  • 1

    參數效率突破:10 億參數超越 20-80 倍大的模型,採用統一多模態框架實現高效率。模型在同一管道內理解和生成圖像,支持中英雙語文字渲染和更好的提示詞對齐。

  • 2

    三變體應對不同場景:Base 模型質量最優(30-50 步採樣)用於高保真需求,Turbo 僅 4 步採樣實現秒級生成,Edit 專門做圖像編辑且自動保留背景區域。

  • 3

    Turbo 有質量權衡:多人物場景和文字海報生成中,Turbo 多樣性和準確度不如 Base(海報文字容易錯誤),但可透過雙採樣傳遞(Base→Turbo 或 Turbo 兩次)改善。

  • 4

    Edit 變體紋理保留能力超群:精準保留原圖的混凝土質感、磚牆紋理、衣服圖案等細節,相比 Quen Image Edit 在複雜背景編輯中表現更優。

實用技巧與重點

乾貨
  • 模型規格
  • 名稱:Boo-Goo Image 0.1
  • 參數量:10 億
  • 開源協議:Apache 2.0(可商用)
  • Quen Image 基準得分:53.58
  • 性能對標
  • 超越 Quen Image 2(20 億參數)
  • 超越 Hanyuan Image 3.0(80 億參數)
  • 僅次於閉源的 GPT Image 2 和 Nano Banana Pro
  • 三個變體及配置
  • Base:30-50 步採樣(ComfyUI 可從 20 步開始)
  • Turbo:4 步採樣,H100 上 1 秒內生成,採樣方法用 LCM,調度器用 SGM uniform
  • Edit:圖像編輯,自動保留非編輯區域
  • 必要模型組件
  • 擴散模型:base/turbo/edit 分別下載
  • VAE:使用 Flux One(可復用其他模型下載的版本)
  • 文字編碼器:Quen3VL(可復用)
  • LoRA 模型:用於將 Base 模型降低採樣步數至 Turbo 水平
  • 工作流設置
  • 單步文轉圖:選用 Base 或 Turbo 直接採樣
  • 雙步傳遞:第一步文轉圖,第二步圖轉圖細化(降噪值≤0.5)
  • 參考圖像編輯:支持用文本或參考圖像引導 Edit 模型
  • 質量對比結果
  • 多人物生成:Base 準確(多種族),Turbo 單一
  • 文字海報:Base 近完美,Turbo 有錯別字
  • 複雜紋理編輯:Base/Edit 保留完整,優於 Quen Image Edit

結論

結論

Boo-Goo Image 0.1 以 10 億參數實現了與大型閉源模型相當的性能,其 Edit 變體在開源模型中的圖像編輯能力領先業界水準。

完整解析

詳細

Boo-Goo Image 0.1 是近期推出的開源圖像生成模型,採用 Apache 2.0 授權允許商業使用。該模型共有三個變體設計,分別針對不同應用場景。Base 模型專注高質量文本轉圖像生成,Turbo 變體透過 DMD 蒸餾技術實現了極速推理,在 NVIDIA H100 上可在 1 秒內完成圖像生成,而 Edit 變體則特別針對圖像編輯任務,支持用自然語言對現有圖像進行修改。

該模型的核心競爭力在於其參數效率。僅 10 億參數的規模卻在 Quen Image 基準測試中獲得 53.58 的得分,這個成績超越了擁有 20 億參數的 Quen Image 2 和 80 億參數的 Hanyuan Image 3.0 模型。這種參數量與性能的倒掛歸功於其採用的統一多模態框架,該框架使得模型能夠在同一管道內理解和生成圖像,從而實現更好的提示詞對齊、更協調的圖像合成,以及開箱即用的中英文雙語文字渲染能力。Turbo 變體更是只需 4 步採樣就能生成圖像,甚至可在消費級硬體上實現接近實時的生成速度。

在實測中,Base 模型在各項指標上都表現出色。其採樣步數通常在 30-50 步範圍內(ComfyUI 環境下可從 20-30 步開始),生成的圖像在細節上更加自然精緻。與之相比,Turbo 模型雖然速度快得驚人,但在某些方面有權衡。例如在多人物場景生成中,Base 模型能夠準確理解「多樣化的一群朋友」的描述,生成包含不同種族的人物,而 Turbo 模型則傾向生成單一種族。在文字海報生成中,Base 模型的文字準確度接近完美,而 Turbo 模型容易出現錯別字和拼寫混亂。對於需要多次採樣的工作流,可以採用雙步傳遞策略:第一步用 Base 或 Turbo 進行文本轉圖像,第二步進行圖像轉圖像細化,透過控制降噪值在 0.5 以下來進行溫和的細節增強。

Edit 變體展現了令人印象深刻的圖像編輯能力。它能夠自動保留非目標區域,精準保留原圖的紋理、圖案和光影細節。在移除夾克、新增人物、改變服裝等編輯任務中,該模型展現出與原圖高度一致的紋理和樣式延續性。相比之下,競品 Quen Image Edit 在處理複雜紋理(如街道混凝土、牆面磚塊紋理)時容易喪失細節。使用 Edit 模型時,使用者既可以透過文本提示新增元素,也可以用參考圖像進行指導。該模型特別擅長處理服飾和配件的編輯,同時能在多元素編輯中保持背景的紋理完整性,這對於需要保留原圖高保真細節的創意工作流而言是個顯著優勢。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。