KeyFrame內部研究專用

The AI Filmmaking Image Generator Everyone Is Sleeping On

Mira AI·8月4日週二·7 min英文

三句話摘要

用Midjourney V8.2預覽模式生成電影級靜態影像,再透過Higgs Field動畫化成完整電影序列。 在Midjourney V8.2的`--preview`模式、智能構圖理解和SREF random等功能加持下,結合Higgs Field的Seedance動畫化能力,即使是個人創作者也能用AI生成具有商業電影質感的完整視頻序列。 Preview模式是核心——Midjourney V8.2預設不啟用preview,必須在提示詞末尾加`--preview`才能解鎖電影級寫實效果,包括自然光影、可信相機構圖、寫實景深和微妙瑕疵,使生成圖像更接近實拍。

重點整理

重點
  • 1

    Preview模式是核心——Midjourney V8.2預設不啟用preview,必須在提示詞末尾加`--preview`才能解鎖電影級寫實效果,包括自然光影、可信相機構圖、寫實景深和微妙瑕疵,使生成圖像更接近實拍。

  • 2

    構圖理解的自動化——即使只給簡單提示詞,preview模式也能自動處理主體構圖、深度感、負空間利用,直接生成專業級別的取景角度,無需過度工程化提示詞。

  • 3

    SREF random快速探索美學方向——同一個提示詞添加`SREF random`+`--preview`,能瞬間產生4個完全不同的視覺風格變體,大幅加快視覺風格決策速度。

  • 4

    Draft mode優化反覆迭代流程——啟用draft mode(點擊提示欄的閃電圖示)可快速生成多個概念變體而非單一高質量渲染,選定最佳構圖後再進行完整渲染,大幅節省時間。

實用技巧與重點

乾貨
  • 工具與平台
  • Midjourney V8.2
  • Higgs Field
  • Seedance 2.0
  • CapCut
  • 核心命令與參數
  • `--preview`:啟用電影級寫實模式(必須明確輸入)
  • `SREF random`:隨機探索視覺風格
  • Draft mode:透過左側閃電圖示啟用
  • 寬高比:16:9(電影標準)
  • 品質設定:1080p
  • 動畫時長:6秒
  • 版本:8.1 或更新
  • 提示詞技巧
  • 使用具體攝影規格:「IMAX 65毫米」、「長焦鏡頭」、「長曝光攝影」
  • 光線描述:「溫暖日出光」、「金色光線」、「逆光」
  • 運動描述:「緩慢推進」、「穩定推拉」、「重攝影機動作」
  • 環境細節:「沙粒飄動」、「雲霧飄散」、「煙霧」
  • 工作流程步驟
  • Midjourney生成靜態影像(點Create → 輸入提示詞 + `--preview` → 生成)
  • Higgs Field視頻化(選Video → Seedance 2.0 → 上傳參考影像 → 輸入動畫提示詞 → 生成)
  • CapCut剪輯組合所有生成的視頻片段

結論

結論

在Midjourney V8.2的`--preview`模式、智能構圖理解和SREF random等功能加持下,結合Higgs Field的Seedance動畫化能力,即使是個人創作者也能用AI生成具有商業電影質感的完整視頻序列。

完整解析

詳細

這份逐字稿揭示了一套完整的AI電影製作工作流程。核心觀念是將靜態影像生成和動態視頻生成分開處理:先用Midjourney鎖定視覺美學和構圖,再用Higgs Field的Seedance模型賦予動作和層次感。

講者首先強調了Midjourney V8.2預覽模式的重要性。這個新模式必須透過在提示詞末尾明確輸入`--preview`才能啟用,否則系統使用的仍是舊版本。啟用後,生成的影像具有明顯的品質躍升:沙粒紋理變得逼真、鏡頭光暈符合物理光學、景深層次清晰、甚至包含細微的渲染瑕疵,使整個畫面讀起來像是從真實電影素材中截取,而非數位藝術作品。

在動畫化階段,講者展示了如何在Higgs Field內使用Seedance 2.0。工作流程是上傳Midjourney生成的靜態影像作為參考幀,然後用精確的運動描述詞(例如「緩慢推進向騎士,沙粒自然飄動,巨型結構保持靜止在地平線上,光線漸漸增強」)生成6秒的視頻片段。關鍵在於運動描述要具體且符合物理邏輯,這樣生成的動作才會顯得「有重量」而不浮躁。

講者特別強調了三個新特性的價值。第一個是SREF random,它讓同一個提示詞能快速探索完全不同的美學方向——無論是虎豹肖像或狼的特寫,同樣的文字提示配合SREF random能產生四個迥異的風格變體,加速視覺決策。第二個是draft mode,透過點擊提示欄的閃電圖示啟用,它能快速生成12個低成本變體而非單一高質量渲染,讓創作者先比較構圖和風格再決定最終版本,大幅縮短迭代時間。第三個改進是構圖智能化——preview模式的模型訓練使其能自動理解電影美學,即使給予簡單提示詞(如「獨自騎馬穿過沙漠日出,長焦鏡頭」),系統也能自動處理主體位置、深度層次、負空間運用等專業級取景細節。

最後,所有生成的視頻片段都下載到本地,用CapCut進行最終剪輯和組合,完成從概念到成片的全套流程。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。