How To Make AI Videos - Prompting Guide For Beginners
三句話摘要
掌握AI視頻生成的高階提示詞技巧,避免常見錯誤,製作專業級別的短影片。 結構化的提示詞公式和時間線分解法是AI視頻製作的核心祕密,搭配角色參考板與音頻重用技巧,即可穩定產出專業級作品。 圖像轉視頻優於文字轉視頻:文字轉視頻會讓AI自由發揮,每次生成的角色和細節都不同。而圖像轉視頻透過先製作角色參考板(character board),讓AI鎖定人物外觀、面部特徵和裝扮,確保整個項目中角色保持一致。
重點整理
重點- 1
圖像轉視頻優於文字轉視頻:文字轉視頻會讓AI自由發揮,每次生成的角色和細節都不同。而圖像轉視頻透過先製作角色參考板(character board),讓AI鎖定人物外觀、面部特徵和裝扮,確保整個項目中角色保持一致。
- 2
結構化提示詞公式增強控制力:初學者常寫「小孩在城市跳舞」這類模糊描述,導致結果偏差大。使用標準結構(主角、動作、場景、鏡頭運動、視覺風格)能讓AI清楚理解意圖,生成效果大幅提升。
- 3
四大常見錯誤會毀掉視頻:一次塞入過多動作導致倉促感、沒有指定鏡頭方向失去控制、重複描述角色外觀造成開頭畫面異常,以及要求過於快速和複雜的動作會產生身體扭曲和手部融化的視覺故障。
- 4
時間線提示詞技巧控制節奏:將15秒視頻分為三個時間段(0-5秒、5-10秒、10-15秒),為每個節拍分別撰寫提示詞,使動作流暢有序,並便於精細調整某個特定秒數而不影響整體。
實用技巧與重點
乾貨- 平台與模型
- Higgs Field:整合多個AI模型的平台
- CDance 2.0:視頻生成模型,支援文字轉視頻和圖像轉視頻
- Nano Banana Pro:圖像生成模型(用於製作角色參考板)
- Claude:AI助手,用於優化和打磨提示詞
- 技術規格
- CDance視頻時長上限:約15秒
- 角色參考板構成:同一角色的正面、側面、背面三角度單一圖像
- 提示詞結構公式
- 主題 → 動作 → 設置 → 相機 → 風格
- 音頻生成三種類型
- 對白:用引號標記(如:"The city feels so right tonight")
- 音效與環境音:描述性語言(如:footstep splash、city traffic hum)
- 整體音樂氛圍:風格描述(如:upbeat and funky、tense and quiet)
- 影片參考技巧
- CDance可接受視頻作為參考輸入
- 若要保留舊視頻的音頻但更新視覺內容:用黑色實色螢幕覆蓋舊視頻,隔離音軌供新生成使用
- 在提示詞中標記各參考物件的用途
- 角色設計優化
- 減少角色配件數量可降低故障率(如背包會導致AI生成多個背包)
- 角色參考板應從不同角度展示同一人物確保一致性
結論
結論“結構化的提示詞公式和時間線分解法是AI視頻製作的核心祕密,搭配角色參考板與音頻重用技巧,即可穩定產出專業級作品。”
完整解析
詳細在生成式AI的早期,簡單的文字提示往往無法產生預期的結果。講者指出,99%的人會輸入「小孩在城市跳舞」這類模糊指令,卻得到完全不同的人物和風格。2026年的今天,問題不在工具本身,而在於我們如何與工具溝通。
講者使用Higgs Field平台和CDance 2.0模型演示了兩條不同的道路。文字轉視頻讓AI完全自由發揮,每次結果都不同;圖像轉視頻則讓使用者先行鎖定角色。後者才是專業級工作流的基礎。他首先透過Nano Banana Pro製作了一個「角色參考板」——同一個高中生從正面、側面、背面拍攝,讓AI有明確的視覺參考點。關鍵細節是簡化配件數量,避免AI產生故障(他測試過的背包版本導致角色莫名其妙多了一個背包)。
接著講者揭示了提示詞的結構化公式:主題→動作→設置→相機→風格。將「小孩在城市跳舞」改寫為「中型跟蹤鏡頭,男孩在紐約人行道上搖動身體,黃金時刻」,效果立竿見影。他甚至演示如何使用Claude AI來自動優化提示詞,形成「自己結構化想法→讓Claude精修→手工微調」的完整工作流。
講者分析了四大初學者錯誤。首先是貪心——在一個15秒的短片內塞入走路、買飲料、檢查手機、過馬路、揮手、跳舞等十項動作,導致整部影片看起來像被按下了快進鍵。其次是缺乏鏡頭指導,讓AI隨意選擇角度和運動,每次生成都不同。第三個隱形殺手是在動作提示詞中重複描述角色外觀,這會破壞角色參考板的一致性。最後是要求過於複雜和快速的動作,例如頭旋轉和翻騰會導致肢體畸形和視覺故障。
解決方案是時間線提示詞。將15秒影片分成三個時段(0-5秒、5-10秒、10-15秒),逐段描述要發生的事,使每個節拍都有時間呼吸。這樣不僅動作流暢,也便於精細調整——如果某一秒出問題,只需修改那一段而不是重新生成整個視頻。
最後,講者展示了音頻整合技巧。CDance支援直接生成對白、音效和背景氛圍。他還分享了一個巧妙的技巧:當想要重用某個視頻的音頻但更新視覺時,可以用黑色實色螢幕覆蓋舊視頻,讓AI只提取音軌。講者示範的最終成品正是影片開頭的那個角色,從0-5秒的邊走邊唱,到5-10秒踩踏水坑,再到10-15秒升高視角的優美黃金時刻舞蹈,每一個節拍都準確到位。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


