KeyFrame內部研究專用

How to Make Cinematic AI Videos (Not AI Slop)

Roboverse·8月6日週四·13 min英文

三句話摘要

掌握光影、鏡頭、構圖、運動四大要素,用AI工具製作看起來真實而非生成的電影級影片。 從寫形容詞升級為用具體攝影術語(光源、焦距、構圖、運動方向)來指導AI,是將廉價「AI廢料」轉變為真正電影級輸出的唯一差別。 光影是真實感的基礎:模型傾向用平面的商業照明,必須主動指定光源(如暖燈+冷霓虹的對比),並控制哪側臉部曝光、哪側落入陰影。一旦有明確的光源方向,看起來就不再像廣告而像真實電影。

重點整理

重點
  • 1

    光影是真實感的基礎:模型傾向用平面的商業照明,必須主動指定光源(如暖燈+冷霓虹的對比),並控制哪側臉部曝光、哪側落入陰影。一旦有明確的光源方向,看起來就不再像廣告而像真實電影。

  • 2

    焦距和景深製造層次感:具體命名85mm或50mm焦距、指定相機位置距離,背景虛化會自動產生。相比讓模型居中對焦全景,主動設定景深是區分專業和廉價AI影片的關鍵轉折。

  • 3

    構圖要打破對稱和中心:人物放在側邊、轉向側面、刻意保留空白空間、明確指定視線朝向(轉頭方向與眼睛看向),讓場景看起來像真實捕捉而非生成模型的自動預設。

  • 4

    運動需要實際重量感和邏輯:不要寫「cinematic camera movement」,要指定相機具體移動(「從4公尺推進至2公尺、步行速度」),同時詳述角色動作的物理細節(衣物移動、重心轉移),讓一切有質量感而非幽靈般漂浮。

實用技巧與重點

乾貨
  • 使用工具與模型
  • 平台:Higgsfield(一站式AI影片製作平台)
  • 圖片生成:GPT Image 2(最佳光寫實度)
  • 影片生成:Seedance 2.0(單鏡頭逼真運動)、CDans 2.0(多鏡頭生成與一致性)
  • 常見設定參數
  • 影像品質:High;解析度:4K;寬高比:16:9
  • 影片:8秒、1080p、Standard mode、16:9
  • 超寬電影幅:21:9
  • 鏡頭焦距運用
  • 85mm:長焦壓縮背景、製造虛化、遠距離拍攝
  • 50mm:標準視角、保持銳利焦點、近距離構圖
  • 多鏡頭結構範例
  • 4段+3個硬切;寬景無人機鏡、駕駛眼睛特寫、低角度遠焦、追蹤無人機
  • 監視鏡頭:俯角無人機漸下沉、儀表板側光、錄音盤特寫、鏡子反射眼神
  • 燈塔救援:複層音效(風浪 vs 冷靜聲線)、暴風雨質感、保持人物鎮靜對比
  • 五大必鎖要素(多鏡頭生成)
  • 明確鏡頭數量與切割點
  • 為每個鏡頭指定不同焦距
  • 光線始終一致
  • 演員入框時已在位
  • 配音與音效層次設計

結論

結論

從寫形容詞升級為用具體攝影術語(光源、焦距、構圖、運動方向)來指導AI,是將廉價「AI廢料」轉變為真正電影級輸出的唯一差別。

完整解析

詳細

大多數AI影片看起來廉價或虛假的根本原因,不在於模型能力不足,而在於創作者沒有真正控制場景。講者透過Higgsfield平台示範,從單幀圖片到多鏡頭序列的完整工作流,逐一拆解電影級別輸出的四大核心決策。

首先是光影設計的轉變。初學者常寫出「beautiful woman at a bus stop in the rain at night cinematic dramatic lighting moody 8k masterpiece」這類提示詞,但相機實際看不到「dramatic」或「moody」。講者對比生成結果:第一張用懶散提示詞生成,模型基於安全預設用平面商業照明,人物對著鏡頭完美擺姿,乍看精美卻不逼真。第二張同樣模型和設定,但明確指定光源來自一側、曝光突顯溫暖高光、讓臉部落入陰影,結果立刻看起來像電影截幀。這個轉變證明了一個看似簡單卻威力無窮的原則:必須指定光從哪裡來、照亮哪一側、讓哪一側進入暗部。

其次是鏡頭和構圖的力量。同一場景若用平凡的中心構圖加全景銳利,會顯得平板廉價;而透過指定85mm焦距、將相機放在街對面,背景會自動虛化,主體與環境分離開來,立刻變成專業質感。但焦距只是一半,另一半是主動的構圖安排:人物放在畫面側邊而非中心、身體轉向側面、明確指定視線朝向(眼睛看手機、身體姿態反映等待狀態),刻意保留大片空白空間。這些決策讓AI理解的不是「美女在公車站」這個模糊概念,而是「這是一個真實場景的精確快照」。

運動設計則要打破兩個常見陷阱。講者示範的公車站場景中,相機完全鎖定不動,所有生命力來自角色本身:手機入褲、撥開頭髮、抱緊保暖。每個動作都被細緻地描述物理細節(重外套的位移、頭髮落位、體重轉移),結果看起來完全自然。相對地,餐廳服務生場景中相機環繞她轉圈,這時先前鎖定好的景深設計就展現威力:虛化的背景和冷暖光源隨著相機運動而有機移動,製造真實三維空間感,而非簡單的平面拖拽。講者強調關鍵是「給運動實際重量感」,不要寫模糊的「cinematic camera movement」,要寫「相機在4公尺到2公尺之間用步行速度推進」。

最後是多鏡頭生成的挑戰與控制方法。CDans 2.0的強大在於能從單個提示詞生成四個不同鏡頭的連貫序列,但模型會傾向亂發揮:改變角色外觀、中途改變光線、新增多餘的切割。講者建立了四個完全不同的場景測試(賽車、監視、燈塔救援、酒吧打烊),每一個都遵循相同的五點鎖定法則:明確說出有幾個鏡頭和幾個硬切、為每個鏡頭分配不同焦距(寬景無人機、特寫、低角度遠焦、追蹤鏡等)、確保光線始終保持一致、讓所有角色在入框時已經到位(沒有空畫面讓模型亂補)、精心設計音效層次(引擎聲和駕駛呼吸、風浪聲和冷靜聲線的對比)。當這五個要素都被牢牢鎖定時,AI就不會因為自由發揮而破壞連貫性,每個場景都能維持光線、角色、空間的一致性。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。