KeyFrame內部研究專用

Master AI Filmmaking in 30 Minutes - Advanced AI Video Course

Dan Kieft·6月25日週四·30 min英文

三句話摘要

用 AI 工具(Sora、Claude、Open Art)製作電影級短片的系統方法論:從人物設定到聲音一致性的進階技巧。 AI 影片製作成敗不在於工具,而在於前期準備(多層參考圖)、提示詞精確度(特別是中文表達)和後期編輯功力(懂得如何拼接讓場景流暢)——這是傳統電影製作經驗與 AI 能力的結合。 角色設定的正確做法:灰色背景(非白色)加三層參考——完整角色設定、臉部特寫、細節特寫——才能在不同角度保持一致性,這對 AI 生成能給出明確視覺線索。

重點整理

重點
  • 1

    角色設定的正確做法:灰色背景(非白色)加三層參考——完整角色設定、臉部特寫、細節特寫——才能在不同角度保持一致性,這對 AI 生成能給出明確視覺線索。

  • 2

    提示詞分層策略:簡單格式夠用小場景,時間線格式適合複雜多鏡頭,關鍵是用中文提示詞因為 Sora 是中文訓練模型理解脈絡最深,Claude 可幫結構化。

  • 3

    場景連貫性的實戰方法:必須截圖前一幕作參考圖、明確列出物件與角度、用提示詞指定「保持色彩分級和構圖完全相同」,多次生成後取最佳片段拼接。

  • 4

    聲音一致性從準備開始:用好麥克風錄製參考音頻,或在提示詞精確描述角色音質(如「12 歲美式洞穴男孩嗓音」「粗沙啞女性嗓音」),Gemini 可幫你分析已有音頻的特徵。

實用技巧與重點

乾貨
  • 工具與成本
  • Sora / CDance:視頻生成主工具
  • Open Art:圖片生成(GPT Image 2)、VFX 替換背景、AI 重新打光(AI Relight Video)
  • Claude:提示詞結構化與最佳化
  • Gemini:音頻特徵分析
  • 成本:480p 測試版 840 credits;1080p 正式版 4800 credits;整部短片花費 $1000+
  • 前期製作核心參考圖
  • 角色:完整身體設定(正面)+ 臉部特寫 + 細節特寫表(頭髮、皮膚紋理)
  • 場景:建立 mood board(多角度、多光線)
  • 物件:獨立截圖,避免生成時遺漏或變形
  • 提示詞格式
  • 簡單格式:設定 → 相機 + 主體 → 動作 → 細部描述 + 標記各參考圖編號
  • 時間線格式:設定(電影風格、幀率)→ Shot 1/2/3 分段描述 → 各鏡頭參考標記
  • 中文版本:同時提供英文版和中文版,中文效果更好
  • 聲音一致性方法
  • 視頻轉視頻(Video to Video):上傳自己表演+說話的視頻,AI 複製動作和聲線
  • 音頻參考:上傳音檔,指定「說出 XXX」
  • 提示詞描述:「年輕、12 歲、美式洞穴男孩嗓音」這類細節描述
  • 動作轉移與背景替換
  • 動作轉移:錄製自己的表演視頻,提示詞寫「讓 image 1 執行 video 1 的表演和對話,複製所有手部和身體動作」
  • VFX 背景替換:遮罩角色 → 上傳新背景圖 → 生成
  • VFX 重新打光:同樣方法,選擇金色小時光(Golden Hour Glow)等效果
  • 場景連貫性具體做法
  • 添加前一幕的整幀截圖作參考
  • 截圖該幀中的場景、角色、物件細節
  • 提示詞明確寫「保持色彩分級、構圖、光線完全相同」
  • 新增物件時單獨截圖該物件並標記
  • 允許多次生成、挑選最佳片段拼接
  • 後期製作流程
  • 組織所有生成片段
  • 修剪、拼接、確保流暢性
  • 色彩分級與小效果
  • 音效設計修補(聲音不匹配時調整)
  • 遵循傳統電影編輯原則(不要直接拼 5 秒 + 5 秒)

結論

結論

AI 影片製作成敗不在於工具,而在於前期準備(多層參考圖)、提示詞精確度(特別是中文表達)和後期編輯功力(懂得如何拼接讓場景流暢)——這是傳統電影製作經驗與 AI 能力的結合。

完整解析

詳細

講者透過實際製作一部洞穴人短片,系統性展示 AI 影片製作的完整工作流。前期最關鍵是建立三層角色參考圖系統:一張全身設定圖(灰色背景,不是白色因為白色會在生成時造成曝光過度),一張臉部特寫,一張包含皮膚紋理細節的特寫表。為什麼需要三層?因為 AI 模型需要不同細節層級的視覺線索才能在各種角度和距離上保持角色一致性。同樣邏輯適用於場景(建立 mood board 參考不同角度和光線)和物件(獨立截圖確保它們不會在場景中消失或變形)。

進入製作階段後,提示詞技巧決定了生成品質。講者示範三種方法:簡單格式足夠描述單一動作(描述相機視角→主體→動作→細節→標記參考圖編號),時間線格式用於複雜多鏡頭場景(分段描述每個鏡頭的發展),中文提示詞效果最佳因為 Sora 是用中文語料訓練的模型,對中文脈絡的理解更精準。Claude 可以幫助結構化和優化提示詞。場景連貫性是新手最容易失敗的環節:每次生成新角度時必須截圖前一幕作參考圖、明確標記所有物件和角色位置、在提示詞中寫明「保持色彩分級和構圖完全相同」。實踐中會需要多次生成,因此成本管理很重要——先用 480p(840 credits)測試提示詞是否有效,確認後再用 1080p(4800 credits)正式製作。

聲音一致性有多個解決方案。最直接的是用視頻轉視頻技術:上傳自己的表演視頻(包含對話和手勢),AI 會複製動作和聲線到新角色上。如果想保留自己的聲音,可以上傳音檔作參考或直接在提示詞中詳細描述角色音質特徵(例如「年輕、12 歲、美式洞穴男孩嗓音」)。Gemini 可以分析已有音頻的特徵,幫助你寫出精確的聲音描述。動作轉移也很實用:錄一段自己的表演視頻,上傳給 AI 並寫「複製 video 1 的所有手部和身體動作」。後期製作則依賴編輯功力:組織所有片段、修剪拼接、加色彩分級和音效設計,關鍵是理解傳統電影編輯原則而非直接串接 AI 生成片段。Open Art 提供的 VFX 工具能替換背景、重新打光,這對製作複雜場景(如手機螢幕文字)特別有用。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。