How to Make Cinematic AI Videos (Not AI Slop)
三句話摘要
掌握光影、鏡頭、構圖、運動四大要素,用AI工具製作看起來真實而非生成的電影級影片。 從寫形容詞升級為用具體攝影術語(光源、焦距、構圖、運動方向)來指導AI,是將廉價「AI廢料」轉變為真正電影級輸出的唯一差別。 光影是真實感的基礎:模型傾向用平面的商業照明,必須主動指定光源(如暖燈+冷霓虹的對比),並控制哪側臉部曝光、哪側落入陰影。一旦有明確的光源方向,看起來就不再像廣告而像真實電影。
重點整理
重點- 1
光影是真實感的基礎:模型傾向用平面的商業照明,必須主動指定光源(如暖燈+冷霓虹的對比),並控制哪側臉部曝光、哪側落入陰影。一旦有明確的光源方向,看起來就不再像廣告而像真實電影。
- 2
焦距和景深製造層次感:具體命名85mm或50mm焦距、指定相機位置距離,背景虛化會自動產生。相比讓模型居中對焦全景,主動設定景深是區分專業和廉價AI影片的關鍵轉折。
- 3
構圖要打破對稱和中心:人物放在側邊、轉向側面、刻意保留空白空間、明確指定視線朝向(轉頭方向與眼睛看向),讓場景看起來像真實捕捉而非生成模型的自動預設。
- 4
運動需要實際重量感和邏輯:不要寫「cinematic camera movement」,要指定相機具體移動(「從4公尺推進至2公尺、步行速度」),同時詳述角色動作的物理細節(衣物移動、重心轉移),讓一切有質量感而非幽靈般漂浮。
實用技巧與重點
乾貨- 使用工具與模型
- 平台:Higgsfield(一站式AI影片製作平台)
- 圖片生成:GPT Image 2(最佳光寫實度)
- 影片生成:Seedance 2.0(單鏡頭逼真運動)、CDans 2.0(多鏡頭生成與一致性)
- 常見設定參數
- 影像品質:High;解析度:4K;寬高比:16:9
- 影片:8秒、1080p、Standard mode、16:9
- 超寬電影幅:21:9
- 鏡頭焦距運用
- 85mm:長焦壓縮背景、製造虛化、遠距離拍攝
- 50mm:標準視角、保持銳利焦點、近距離構圖
- 多鏡頭結構範例
- 4段+3個硬切;寬景無人機鏡、駕駛眼睛特寫、低角度遠焦、追蹤無人機
- 監視鏡頭:俯角無人機漸下沉、儀表板側光、錄音盤特寫、鏡子反射眼神
- 燈塔救援:複層音效(風浪 vs 冷靜聲線)、暴風雨質感、保持人物鎮靜對比
- 五大必鎖要素(多鏡頭生成)
- 明確鏡頭數量與切割點
- 為每個鏡頭指定不同焦距
- 光線始終一致
- 演員入框時已在位
- 配音與音效層次設計
結論
結論“從寫形容詞升級為用具體攝影術語(光源、焦距、構圖、運動方向)來指導AI,是將廉價「AI廢料」轉變為真正電影級輸出的唯一差別。”
完整解析
詳細大多數AI影片看起來廉價或虛假的根本原因,不在於模型能力不足,而在於創作者沒有真正控制場景。講者透過Higgsfield平台示範,從單幀圖片到多鏡頭序列的完整工作流,逐一拆解電影級別輸出的四大核心決策。
首先是光影設計的轉變。初學者常寫出「beautiful woman at a bus stop in the rain at night cinematic dramatic lighting moody 8k masterpiece」這類提示詞,但相機實際看不到「dramatic」或「moody」。講者對比生成結果:第一張用懶散提示詞生成,模型基於安全預設用平面商業照明,人物對著鏡頭完美擺姿,乍看精美卻不逼真。第二張同樣模型和設定,但明確指定光源來自一側、曝光突顯溫暖高光、讓臉部落入陰影,結果立刻看起來像電影截幀。這個轉變證明了一個看似簡單卻威力無窮的原則:必須指定光從哪裡來、照亮哪一側、讓哪一側進入暗部。
其次是鏡頭和構圖的力量。同一場景若用平凡的中心構圖加全景銳利,會顯得平板廉價;而透過指定85mm焦距、將相機放在街對面,背景會自動虛化,主體與環境分離開來,立刻變成專業質感。但焦距只是一半,另一半是主動的構圖安排:人物放在畫面側邊而非中心、身體轉向側面、明確指定視線朝向(眼睛看手機、身體姿態反映等待狀態),刻意保留大片空白空間。這些決策讓AI理解的不是「美女在公車站」這個模糊概念,而是「這是一個真實場景的精確快照」。
運動設計則要打破兩個常見陷阱。講者示範的公車站場景中,相機完全鎖定不動,所有生命力來自角色本身:手機入褲、撥開頭髮、抱緊保暖。每個動作都被細緻地描述物理細節(重外套的位移、頭髮落位、體重轉移),結果看起來完全自然。相對地,餐廳服務生場景中相機環繞她轉圈,這時先前鎖定好的景深設計就展現威力:虛化的背景和冷暖光源隨著相機運動而有機移動,製造真實三維空間感,而非簡單的平面拖拽。講者強調關鍵是「給運動實際重量感」,不要寫模糊的「cinematic camera movement」,要寫「相機在4公尺到2公尺之間用步行速度推進」。
最後是多鏡頭生成的挑戰與控制方法。CDans 2.0的強大在於能從單個提示詞生成四個不同鏡頭的連貫序列,但模型會傾向亂發揮:改變角色外觀、中途改變光線、新增多餘的切割。講者建立了四個完全不同的場景測試(賽車、監視、燈塔救援、酒吧打烊),每一個都遵循相同的五點鎖定法則:明確說出有幾個鏡頭和幾個硬切、為每個鏡頭分配不同焦距(寬景無人機、特寫、低角度遠焦、追蹤鏡等)、確保光線始終保持一致、讓所有角色在入框時已經到位(沒有空畫面讓模型亂補)、精心設計音效層次(引擎聲和駕駛呼吸、風浪聲和冷靜聲線的對比)。當這五個要素都被牢牢鎖定時,AI就不會因為自由發揮而破壞連貫性,每個場景都能維持光線、角色、空間的一致性。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


