MiniMax H3 — Full ComfyUI Workflow Tutorial (Local+Free Cloud)
三句話摘要
Minimax H3 視頻生成模型的本地部署與實操教學。 Minimax H3 透過多圖像參考生成功能成為開源視頻生成領域的歷史性進展,相比前代模型實現了顯著的功能躍升與控制力提升。 Minimax H3 的參考工作流是核心創新,允許引入最多九個圖像元素、音頻與視頻作為生成參考,這是相比 LTX 2.3 最大的差異,能更精準地控制角色一致性與場景相關性。
重點整理
重點- 1
Minimax H3 的參考工作流是核心創新,允許引入最多九個圖像元素、音頻與視頻作為生成參考,這是相比 LTX 2.3 最大的差異,能更精準地控制角色一致性與場景相關性。
- 2
模型部署需下載 19.5GB 的擴散模型(H3FL2VA pruned 版本)、文本編碼器及兩種 VAE 檔案,分別放入 ComfyUI 的 diffusion_models、text_encoders、VAE 資料夾,確保 ComfyUI 版本為最新以避免錯誤。
- 3
分辨率由縮放因子控制:0.4=480p、0.9=720p、1.0 為推薦起點、2.0=1080p,用戶可根據硬體能力與生成時間需求調整,演示中使用 0.8(1216×672)已能產出良好效果。
- 4
無本地 GPU 用戶可透過 RunningHub 等雲平台快速體驗,新用戶獲得免費額度,避免本機部署門檻。
實用技巧與重點
乾貨- 工作流三種:text_to_video、image_to_video、reference_to_video (OmniReference)
- 必下載擴散模型:H3FL2VA pruned intro aid comp
- 文本編碼器:Gwin3VL32B
- VAE 檔案:H3 video VAE (FP16)、H3 audio VAE (FP32)
- 分辨率參數:0.4=480p、0.9=720p、1.0=推薦起點、2.0=1080p
- 圖像轉視頻功能:支援首幀與末幀設置(可同時指定兩個幀點)
- 參考工作流:支援最多 9 個圖像參考、多個音頻與視頻參考
- 演示規格:分辨率 0.8(1216×672)、時長 8-10 秒、硬體 RTX 5090
- 下載建議:避免 Chrome 瀏覽器(易出問題),改用其他瀏覽器
- ComfyUI 維護:必須更新至最新版本、更新所有節點、必要時安裝缺失的自定義節點
- 雲部署:RunningHub 提供免費額度(freight coins)供首次使用者試驗
結論
結論“Minimax H3 透過多圖像參考生成功能成為開源視頻生成領域的歷史性進展,相比前代模型實現了顯著的功能躍升與控制力提升。”
完整解析
詳細Minimax H3 是開源 AI 視頻生成領域的重要模型,本教學完整展示了本地部署與實操流程。講者首先介紹三種核心工作流程的用途:文本轉視頻直接從提示詞生成動畫、圖像轉視頻將靜態圖像進行動畫化、以及最具創新性的參考工作流,可同時引用多達九個圖像元素作為生成參考,這正是相比前一代 LTX 2.3 最重要的升級。
部署環節相對直觀但需謹慎。首先從官方下載三個工作流檔案至 ComfyUI,接著需要下載約 95-19.5GB 的模型權重檔案,其中擴散模型是最大的單一檔案。講者特別強調避免使用 Chrome 下載,因為容易出現中斷需要重新下載的問題。檔案下載完成後,按照指定目錄結構放置:擴散模型進入 diffusion_models 資料夾、文本編碼器進入 text_encoders 資料夾、兩個 VAE 檔案進入 VAE 資料夾。之後在 ComfyUI 介面按 R 鍵刷新工作流。若出現紅色錯誤節點,講者建議透過更新所有節點(可能需要一次更新 50 個節點)或透過管理員介面安裝缺失的自定義節點來解決,同時要確保 ComfyUI 本身已更新至最新版本。
實際使用相當簡潔。文本轉視頻工作流只需在提示詞欄輸入描述內容,設定視頻時長(以秒計)和分辨率縮放因子。分辨率因子是關鍵參數,講者詳細說明了不同數值對應的解析度:0.4=480p、0.9=720p、1.0 為推薦起始點(因為性能和質量平衡最佳)、2.0=完整 1080p。講者使用 RTX 5090 進行演示測試。圖像轉視頻工作流則添加了首幀和末幀指定功能,允許用戶同時上傳起始和結束畫面,模型據此生成過渡動畫。參考工作流進一步強化了功能,用戶可上傳多個圖像作為角色和場景參考,還可載入音頻和視頻檔案作為額外參考素材。在演示中,講者使用 LLM 輔助生成精確的參考提示詞,系統自動為模型添加了對應的參考分類標籤。
實測結果印象深刻。即使使用相對較低的分辨率設定(0.8,對應 1216×672)和短 8 秒生成時間,模型仍成功維持了角色一致性並準確响應了場景要求。講者對結果表示驚喜,認為儘管分辨率仍有上升空間,但已充分證明了模型的實用潛力,並期待社區貢獻快速推理 LoRA 或蒸餾 LoRA 來進一步加速生成。對於缺乏本地 GPU 的用戶,講者建議透過 RunningHub 等雲平台快速體驗,新用戶通常獲得足夠的免費額度進行數小時試驗,無需本機部署。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


