KeyFrame內部研究專用

MiniMax H3 — Full ComfyUI Workflow Tutorial (Local+Free Cloud)

Prompt Mastery·8月3日週一·12 min英文

三句話摘要

Minimax H3 視頻生成模型的本地部署與實操教學。 Minimax H3 透過多圖像參考生成功能成為開源視頻生成領域的歷史性進展,相比前代模型實現了顯著的功能躍升與控制力提升。 Minimax H3 的參考工作流是核心創新,允許引入最多九個圖像元素、音頻與視頻作為生成參考,這是相比 LTX 2.3 最大的差異,能更精準地控制角色一致性與場景相關性。

重點整理

重點
  • 1

    Minimax H3 的參考工作流是核心創新,允許引入最多九個圖像元素、音頻與視頻作為生成參考,這是相比 LTX 2.3 最大的差異,能更精準地控制角色一致性與場景相關性。

  • 2

    模型部署需下載 19.5GB 的擴散模型(H3FL2VA pruned 版本)、文本編碼器及兩種 VAE 檔案,分別放入 ComfyUI 的 diffusion_models、text_encoders、VAE 資料夾,確保 ComfyUI 版本為最新以避免錯誤。

  • 3

    分辨率由縮放因子控制:0.4=480p、0.9=720p、1.0 為推薦起點、2.0=1080p,用戶可根據硬體能力與生成時間需求調整,演示中使用 0.8(1216×672)已能產出良好效果。

  • 4

    無本地 GPU 用戶可透過 RunningHub 等雲平台快速體驗,新用戶獲得免費額度,避免本機部署門檻。

實用技巧與重點

乾貨
  • 工作流三種:text_to_video、image_to_video、reference_to_video (OmniReference)
  • 必下載擴散模型:H3FL2VA pruned intro aid comp
  • 文本編碼器:Gwin3VL32B
  • VAE 檔案:H3 video VAE (FP16)、H3 audio VAE (FP32)
  • 分辨率參數:0.4=480p、0.9=720p、1.0=推薦起點、2.0=1080p
  • 圖像轉視頻功能:支援首幀與末幀設置(可同時指定兩個幀點)
  • 參考工作流:支援最多 9 個圖像參考、多個音頻與視頻參考
  • 演示規格:分辨率 0.8(1216×672)、時長 8-10 秒、硬體 RTX 5090
  • 下載建議:避免 Chrome 瀏覽器(易出問題),改用其他瀏覽器
  • ComfyUI 維護:必須更新至最新版本、更新所有節點、必要時安裝缺失的自定義節點
  • 雲部署:RunningHub 提供免費額度(freight coins)供首次使用者試驗

結論

結論

Minimax H3 透過多圖像參考生成功能成為開源視頻生成領域的歷史性進展,相比前代模型實現了顯著的功能躍升與控制力提升。

完整解析

詳細

Minimax H3 是開源 AI 視頻生成領域的重要模型,本教學完整展示了本地部署與實操流程。講者首先介紹三種核心工作流程的用途:文本轉視頻直接從提示詞生成動畫、圖像轉視頻將靜態圖像進行動畫化、以及最具創新性的參考工作流,可同時引用多達九個圖像元素作為生成參考,這正是相比前一代 LTX 2.3 最重要的升級。

部署環節相對直觀但需謹慎。首先從官方下載三個工作流檔案至 ComfyUI,接著需要下載約 95-19.5GB 的模型權重檔案,其中擴散模型是最大的單一檔案。講者特別強調避免使用 Chrome 下載,因為容易出現中斷需要重新下載的問題。檔案下載完成後,按照指定目錄結構放置:擴散模型進入 diffusion_models 資料夾、文本編碼器進入 text_encoders 資料夾、兩個 VAE 檔案進入 VAE 資料夾。之後在 ComfyUI 介面按 R 鍵刷新工作流。若出現紅色錯誤節點,講者建議透過更新所有節點(可能需要一次更新 50 個節點)或透過管理員介面安裝缺失的自定義節點來解決,同時要確保 ComfyUI 本身已更新至最新版本。

實際使用相當簡潔。文本轉視頻工作流只需在提示詞欄輸入描述內容,設定視頻時長(以秒計)和分辨率縮放因子。分辨率因子是關鍵參數,講者詳細說明了不同數值對應的解析度:0.4=480p、0.9=720p、1.0 為推薦起始點(因為性能和質量平衡最佳)、2.0=完整 1080p。講者使用 RTX 5090 進行演示測試。圖像轉視頻工作流則添加了首幀和末幀指定功能,允許用戶同時上傳起始和結束畫面,模型據此生成過渡動畫。參考工作流進一步強化了功能,用戶可上傳多個圖像作為角色和場景參考,還可載入音頻和視頻檔案作為額外參考素材。在演示中,講者使用 LLM 輔助生成精確的參考提示詞,系統自動為模型添加了對應的參考分類標籤。

實測結果印象深刻。即使使用相對較低的分辨率設定(0.8,對應 1216×672)和短 8 秒生成時間,模型仍成功維持了角色一致性並準確响應了場景要求。講者對結果表示驚喜,認為儘管分辨率仍有上升空間,但已充分證明了模型的實用潛力,並期待社區貢獻快速推理 LoRA 或蒸餾 LoRA 來進一步加速生成。對於缺乏本地 GPU 的用戶,講者建議透過 RunningHub 等雲平台快速體驗,新用戶通常獲得足夠的免費額度進行數小時試驗,無需本機部署。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。