KeyFrame內部研究專用

Seedance 退钱!MiniMax H3 实测感受

小天fotos·8月6日週四·11 min中文

三句話摘要

MiniMax H3 開源視頻生成模型的核心能力、生態現狀與內容創作者的機遇窗口。 H3 打開了內容創作的平權之門,但真正的勝負在於誰能最快積累經驗、建立流量、理解市場窗口的有限性,並在 Agent 時代來臨前搶佔先機。 1. 多模態統一架構打破工作流碎片化

重點整理

重點
  • 1

    1. 多模態統一架構打破工作流碎片化

  • 2

    H3 不像過往視頻模型需要文生視頻、圖生視頻分別入口、各種工作流串接,而是在同一模型內同時生成畫面和聲音。因為畫面與聲音在同一神經網絡長出來,口型、呼吸、環境音天然咬合,11 種語言對口配音也能自動匹配音色轉換。

  • 3

    2. 試錯成本驟降引發社群生態爆發

  • 4

    H3 權重完全開源,全球最聰明的工程師免費優化。短短 48 小時內出現 Sagemaker、TensorRT、EasyComfy、FluxComfy 等優化方案,生成速度翻倍;同日各芯片廠商、推理框架都宣佈適配方案。本地運行成本從高昂的 API 費用降到電費級別,降低了普通人的進入門檻。

  • 5

    3. 本地部署與生產級 API 的定位差異

  • 6

    本地能生 768P,速度快,適合大量試錯建立經驗;但 MiniMax 官方未開源 Kontax IR(雲端理解模塊,能從複雜素材推理生成結構化提示詞)和 Regenerated 2K 超分模型,導致本地 1080P 的細節提升有限。生產級內容應使用 API 的 2K 超分(4 毛/秒),質量和成本都不可比。

  • 7

    4. 內容門檻低導致注意力重新分配與窗口期

  • 8

    過去只有負擔得起高抽卡費的人掌握視頻製作技巧;H3 將成本打到電費級,試錯人數增加數量級,優質鏡頭、敘事會加速傳播。但內容數量激增也將帶來審美疲勞,最終還是回歸到內容質量與敘事能力,窗口期有限。

實用技巧與重點

乾貨
  • 模型與服務
  • MiniMax H3:開源視頻生成模型,原生 768P,最長 15 秒
  • Kontax IR:MiniMax 雲端理解模塊(未開源),生成結構化提示詞
  • Regenerated 2K 超分模型(未開源),提升至 2K 分辨率
  • MiniMax Design:官方數據平台
  • 相容框架:Sagemaker、TensorRT、EasyComfy、FluxComfy
  • 成本與性能
  • 本地部署極致速度:1088P 10 秒視頻需 24 分鐘(Pro 6000 顯卡)
  • 社群優化後生成速度翻倍(48 小時內)
  • 768P 最低價:2.3 分/條
  • API 價格:2K 超分 4 毛/秒
  • 年訂閱包:劇烈折扣,按量計費
  • 生成能力
  • 支持輸入:文字、圖片、視頻、參考音頻
  • 輸出:統一生成畫面、對白、音效、BGM
  • 對口配音:11 種語言,支持音色轉換
  • 視頻編輯:可替換素材中的人物衣著、鏡頭等元素
  • 講者的實驗數據
  • 37 條通銷抽卡任務作品,零重複、零廢片
  • 一晚上成本約百來塊人民幣,成功率與藝術表達遠超以往開源模型

結論

結論

H3 打開了內容創作的平權之門,但真正的勝負在於誰能最快積累經驗、建立流量、理解市場窗口的有限性,並在 Agent 時代來臨前搶佔先機。

完整解析

詳細

MiniMax H3 的推出代表視頻生成領域的一個關鍵轉折點。講者原本用過去的舊視頻重新用 H3 生成試試,沒想到效果如此突出,以至於他連夜將所有過往內容都重做了一遍——這反映出 H3 相比現有開源模型的質的飛躍。

H3 最重要的創新是其「統一多模態架構」。過往的視頻生成模型採用分散式入口,文生視頻走一條路、圖生視頻走另一條路,複雜需求還要串接各種工作流。而 H3 打破了這種碎片化,讓講者只需輸入文字、圖片、視頻、聲音的任意組合,模型就能一次性輸出帶有畫面、對白、音效、背景音樂的完整視頻,甚至還能自動對口配音到 11 種語言。這種設計之所以可行,是因為畫面和聲音在同一神經網絡內同步生成,所以口型、呼吸、環境音天然咬合,不會出現音畫不同步的尷尬。

講者舉了他自己的案例。他曾寫過一個名叫《未接來電》的劇本,當時因為沒有合適的生成工具,所有物料都是手工製作。如今用 H3,他把角色卡和主持人手冊餵給模型,在不到 10 分鐘內就生成了一條 768P 的宣傳片——當年的遺憾一朝補上,感慨不已。他甚至進一步試驗,給 H3 設定了一個「通銷抽卡任務」讓它自由發揮,結果一晚上生成了 37 條作品,每條都不重複、沒有廢片,各種創意層出不窮。以官方最低價 2.3 分/條計算,這一晚上也才消耗百來塊人民幣,但這樣的成功率和藝術表達在過往開源模型上從未見過。

H3 推出後,發生了一個在開源生態中罕見的現象:全球最聰明的工程師開始免費優化它。短短 48 小時內,各種優化方案層出不窮——Sagemaker、TensorRT、EasyComfy、FluxComfy 等框架都推出了針對 H3 的加速版本,生成速度直接翻倍。更令人驚訝的是,8 月 3 日 H3 開源當天,各芯片廠商和推理框架竟然同一時間宣佈了適配方案,當天就能跑。只有真正頂級的開源項目才能一夜之間引發這樣的生態響應。

然而,講者著重強調了一個常被忽視的事實:本地部署並非生產級內容的終極方案。MiniMax 官方保留了兩個關鍵模塊沒有開源。其一是 Kontax IR——一個雲端的智能理解服務,它不是單純延長提示詞長度,而是先判斷素材中什麼該保留、什麼該改變,生成結構化提示詞。其二是 Regenerated 2K 超分模型,能將 768P 提升到 2K 分辨率。講者透過實驗對比發現,用簡單提示詞編輯視頻時,衣服顏色雖然變了,但鏡頭完全走樣;用 Kontax IR 重新生成提示詞後,人物、景別、鏡頭運動都與原片保持一致。本地部署只能輸出 1080P,但細節提升遠遠達不到雲端 2K 的效果,而且 1080P 的運算時間是 768P 的三倍。

這決定了一個清晰的策略:本地部署應該用來刷經驗、試錯迭代,而非生產內容。講者現在的做法是先在本地跑 768P 試新想法、積累經驗,然後按需調用 MiniMax API 的 2K 超分功能提升質量,根據業務量決定是否購買年訂閱包。API 年訂閱包的價格是天價屠夫級別的折扣——2K 輸出僅需 4 毛/秒,相比競品毫無競爭力。

最後,講者提出了一個關於內容創作者不能忽視的大趨勢:試錯成本的大幅下降必然引發注意力的重新分配。過去只有少數負擔得起高費用的人掌握視頻製作技巧,他們的內容越來越精彩,而其他人被恐怖的成本擋在門外。如今 H3 把成本打到電費級別,試錯的人數增加了數量級,優質的鏡頭和敘事會加速傳播。但這也意味著內容數量和質量都會迅速提升,審美疲勞會隨之而來,酷炫的效果幾天就看膩了。所以最終還是會回歸到更好的鏡頭表達、更好的敘事。這個窗口期並不永恆,趕快動起來才是當下的最優策略。

展望未來,講者相信視頻生成這條路最終還是會回到 Agent 的指揮。MiniMax 既有視頻生成模型,也有 MiniMax Design 這個數據平台,他們完全有理由把導演和編劇的能力訓練到 M 系列模型中。也許幾個月或半年後,創作者就再也不需要寫提示詞了,AI 會搞定一切。在那之前,誰掌握更多注意力,誰就能被技術加速最充分。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。