Master AI Filmmaking in 30 Minutes - Advanced AI Video Course
三句話摘要
用 AI 工具(Sora、Claude、Open Art)製作電影級短片的系統方法論:從人物設定到聲音一致性的進階技巧。 AI 影片製作成敗不在於工具,而在於前期準備(多層參考圖)、提示詞精確度(特別是中文表達)和後期編輯功力(懂得如何拼接讓場景流暢)——這是傳統電影製作經驗與 AI 能力的結合。 角色設定的正確做法:灰色背景(非白色)加三層參考——完整角色設定、臉部特寫、細節特寫——才能在不同角度保持一致性,這對 AI 生成能給出明確視覺線索。
重點整理
重點- 1
角色設定的正確做法:灰色背景(非白色)加三層參考——完整角色設定、臉部特寫、細節特寫——才能在不同角度保持一致性,這對 AI 生成能給出明確視覺線索。
- 2
提示詞分層策略:簡單格式夠用小場景,時間線格式適合複雜多鏡頭,關鍵是用中文提示詞因為 Sora 是中文訓練模型理解脈絡最深,Claude 可幫結構化。
- 3
場景連貫性的實戰方法:必須截圖前一幕作參考圖、明確列出物件與角度、用提示詞指定「保持色彩分級和構圖完全相同」,多次生成後取最佳片段拼接。
- 4
聲音一致性從準備開始:用好麥克風錄製參考音頻,或在提示詞精確描述角色音質(如「12 歲美式洞穴男孩嗓音」「粗沙啞女性嗓音」),Gemini 可幫你分析已有音頻的特徵。
實用技巧與重點
乾貨- 工具與成本
- Sora / CDance:視頻生成主工具
- Open Art:圖片生成(GPT Image 2)、VFX 替換背景、AI 重新打光(AI Relight Video)
- Claude:提示詞結構化與最佳化
- Gemini:音頻特徵分析
- 成本:480p 測試版 840 credits;1080p 正式版 4800 credits;整部短片花費 $1000+
- 前期製作核心參考圖
- 角色:完整身體設定(正面)+ 臉部特寫 + 細節特寫表(頭髮、皮膚紋理)
- 場景:建立 mood board(多角度、多光線)
- 物件:獨立截圖,避免生成時遺漏或變形
- 提示詞格式
- 簡單格式:設定 → 相機 + 主體 → 動作 → 細部描述 + 標記各參考圖編號
- 時間線格式:設定(電影風格、幀率)→ Shot 1/2/3 分段描述 → 各鏡頭參考標記
- 中文版本:同時提供英文版和中文版,中文效果更好
- 聲音一致性方法
- 視頻轉視頻(Video to Video):上傳自己表演+說話的視頻,AI 複製動作和聲線
- 音頻參考:上傳音檔,指定「說出 XXX」
- 提示詞描述:「年輕、12 歲、美式洞穴男孩嗓音」這類細節描述
- 動作轉移與背景替換
- 動作轉移:錄製自己的表演視頻,提示詞寫「讓 image 1 執行 video 1 的表演和對話,複製所有手部和身體動作」
- VFX 背景替換:遮罩角色 → 上傳新背景圖 → 生成
- VFX 重新打光:同樣方法,選擇金色小時光(Golden Hour Glow)等效果
- 場景連貫性具體做法
- 添加前一幕的整幀截圖作參考
- 截圖該幀中的場景、角色、物件細節
- 提示詞明確寫「保持色彩分級、構圖、光線完全相同」
- 新增物件時單獨截圖該物件並標記
- 允許多次生成、挑選最佳片段拼接
- 後期製作流程
- 組織所有生成片段
- 修剪、拼接、確保流暢性
- 色彩分級與小效果
- 音效設計修補(聲音不匹配時調整)
- 遵循傳統電影編輯原則(不要直接拼 5 秒 + 5 秒)
結論
結論“AI 影片製作成敗不在於工具,而在於前期準備(多層參考圖)、提示詞精確度(特別是中文表達)和後期編輯功力(懂得如何拼接讓場景流暢)——這是傳統電影製作經驗與 AI 能力的結合。”
完整解析
詳細講者透過實際製作一部洞穴人短片,系統性展示 AI 影片製作的完整工作流。前期最關鍵是建立三層角色參考圖系統:一張全身設定圖(灰色背景,不是白色因為白色會在生成時造成曝光過度),一張臉部特寫,一張包含皮膚紋理細節的特寫表。為什麼需要三層?因為 AI 模型需要不同細節層級的視覺線索才能在各種角度和距離上保持角色一致性。同樣邏輯適用於場景(建立 mood board 參考不同角度和光線)和物件(獨立截圖確保它們不會在場景中消失或變形)。
進入製作階段後,提示詞技巧決定了生成品質。講者示範三種方法:簡單格式足夠描述單一動作(描述相機視角→主體→動作→細節→標記參考圖編號),時間線格式用於複雜多鏡頭場景(分段描述每個鏡頭的發展),中文提示詞效果最佳因為 Sora 是用中文語料訓練的模型,對中文脈絡的理解更精準。Claude 可以幫助結構化和優化提示詞。場景連貫性是新手最容易失敗的環節:每次生成新角度時必須截圖前一幕作參考圖、明確標記所有物件和角色位置、在提示詞中寫明「保持色彩分級和構圖完全相同」。實踐中會需要多次生成,因此成本管理很重要——先用 480p(840 credits)測試提示詞是否有效,確認後再用 1080p(4800 credits)正式製作。
聲音一致性有多個解決方案。最直接的是用視頻轉視頻技術:上傳自己的表演視頻(包含對話和手勢),AI 會複製動作和聲線到新角色上。如果想保留自己的聲音,可以上傳音檔作參考或直接在提示詞中詳細描述角色音質特徵(例如「年輕、12 歲、美式洞穴男孩嗓音」)。Gemini 可以分析已有音頻的特徵,幫助你寫出精確的聲音描述。動作轉移也很實用:錄一段自己的表演視頻,上傳給 AI 並寫「複製 video 1 的所有手部和身體動作」。後期製作則依賴編輯功力:組織所有片段、修剪拼接、加色彩分級和音效設計,關鍵是理解傳統電影編輯原則而非直接串接 AI 生成片段。Open Art 提供的 VFX 工具能替換背景、重新打光,這對製作複雜場景(如手機螢幕文字)特別有用。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


