KeyFrame內部研究專用

MiniMax H3 Just Got WAY More Realistic! Full ComfyUI Tutorial

The Ai Blueprint·8月14日週五·7 min英文

三句話摘要

評測 Minimax H3 Realism People LoRA 對視頻生成中人臉寫實度與一致性的提升效果。 Minimax H3 Realism People LoRA 以最小的計算成本顯著提升人臉細節寫實感與表情一致性,是人物視頻生成的必備工具。 LoRA 透過修改共享注意力投影運作,因此能跨越所有三種視頻生成模式使用,無需針對各模式單獨訓練版本,大幅提高開發效率與通用性。

重點整理

重點
  • 1

    LoRA 透過修改共享注意力投影運作,因此能跨越所有三種視頻生成模式使用,無需針對各模式單獨訓練版本,大幅提高開發效率與通用性。

  • 2

    提示詞精確度是成敗關鍵,應按秒數逐幀規劃動作(何時拿起、何時品嚐、何時反應),模型對清晰的時間軸指令反應遠優於籠統描述。

  • 3

    在極端近景與面部離開畫面再返回的場景中,LoRA 版本保持完美的面部一致性與表情連貫性,遠勝 LTX 0.5 與 LTX 2.3,面部不會變形或轉變成不同人物。

  • 4

    LoRA 強度預設值 1.0 為最佳配置,但可根據場景美學需求調整至 0.6-0.8 以平衡效果強度,無需複雜調參。

實用技巧與重點

乾貨
  • LoRA 觸發詞:R34L1SM(必須放提示詞最前端)
  • 安裝步驟:下載 safetensors 文件 → 放入 `Comfy UI/models/loras` → 在模型加載器與採樣器間添加 Load LoRA 節點 → 強度設 1.0
  • 測試配置
  • 採樣器:Res multi-step simple
  • 步數:20 steps
  • 解析度:1.6 megapixels (約 720p HD)
  • 強度範圍:預設 1.0,可調 0.6-0.8
  • 訓練數據:176 段手工精選真人影片,涵蓋人物、肖像、工人、運動員、兒童、日常角色
  • 支持模式:Text to video、Image to video、Reference to video 全覆蓋
  • 改善項目:膚質紋理、眼睛與微表情一致性、電影風格光影、手持攝影感、肌膚毛孔細節
  • 資源位置:HuggingFace 頁面、預配置 Comfy UI workflow 文件均在視頻描述連結

結論

結論

Minimax H3 Realism People LoRA 以最小的計算成本顯著提升人臉細節寫實感與表情一致性,是人物視頻生成的必備工具。

完整解析

詳細

Minimax H3 已是目前開源視頻生成模型中最優秀的選擇,擁有出色的面部一致性、運動連貫性與整體品質。但一個名為 Minimax H3 Realism People 的輕量級 LoRA 適配器能進一步推升其人臉寫實度。本次評測在 Comfy UI 中進行實際對比測試,採用完全相同的種子、提示詞與參數設置,唯一變數就是這個小型 LoRA。

第一個測試採用參考轉視模式,解析度 1.6 百萬像素(約 720p),採樣器設為 Res multi-step simple,20 步生成。提示詞觸發字 R34L1SM 必須放在最前端,場景設定為一位女性坐在餐桌前品嚐麵碗湯底。講者強調提示詞的關鍵技巧:高度特異性至關重要,建議用 ChatGPT 或 Claude 逐秒拆解動作(何時拿起、何時品嚐、何時反應),讓模型準確把握時間軸。使用 LoRA 的結果展現出令人驚艷的膚質紋理、微表情與光影細節,看起來完全真實而非 AI 生成。相同配置的基礎模型表現也不錯,但皮膚有輕微的合成感與塑膠質感,LoRA 版本則呈現紋理感與更具電影紀錄風格的視覺效果。

LoRA 的技術優勢在於它只修改共享注意力投影,因此能跨越文轉視、圖轉視與參考轉視三種模式運作。訓練資料來自 176 段手工精選的真人影片,聚焦於人物、肖像、工人、運動員、兒童等日常角色。在壓力測試中,講者使用火山爆發場景進行更複雜的測試,要求面部表情從好奇逐漸轉變為恐懼。關鍵測試點是面部離開畫面再返回時的一致性:LoRA 版本完美保持了面部連貫性與表情穩定,不會變形或飄移,這正是相比 LTX 系列明顯的優勢所在。

安裝使用極其簡單直接:下載 safetensors 文件放入 Comfy UI 的 models/loras 資料夾,然後在模型加載器與採樣器間添加標準 Load LoRA 節點,強度預設 1.0 即為最佳配置,但可根據場景美學調整至 0.6 或 0.8。對於任何以人物為中心的 AI 視頻工作——肖像、對話場景、紀錄風格鏡頭——這個 LoRA 基本上是必備工具,它不破壞基礎模型的優勢,只是銳化了人臉寫實度這個領域。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。