KeyFrame內部研究專用

How To Make AI Videos - Prompting Guide For Beginners

Mira AI·6月24日週三·10 min英文

三句話摘要

掌握AI視頻生成的高階提示詞技巧,避免常見錯誤,製作專業級別的短影片。 結構化的提示詞公式和時間線分解法是AI視頻製作的核心祕密,搭配角色參考板與音頻重用技巧,即可穩定產出專業級作品。 圖像轉視頻優於文字轉視頻:文字轉視頻會讓AI自由發揮,每次生成的角色和細節都不同。而圖像轉視頻透過先製作角色參考板(character board),讓AI鎖定人物外觀、面部特徵和裝扮,確保整個項目中角色保持一致。

重點整理

重點
  • 1

    圖像轉視頻優於文字轉視頻:文字轉視頻會讓AI自由發揮,每次生成的角色和細節都不同。而圖像轉視頻透過先製作角色參考板(character board),讓AI鎖定人物外觀、面部特徵和裝扮,確保整個項目中角色保持一致。

  • 2

    結構化提示詞公式增強控制力:初學者常寫「小孩在城市跳舞」這類模糊描述,導致結果偏差大。使用標準結構(主角、動作、場景、鏡頭運動、視覺風格)能讓AI清楚理解意圖,生成效果大幅提升。

  • 3

    四大常見錯誤會毀掉視頻:一次塞入過多動作導致倉促感、沒有指定鏡頭方向失去控制、重複描述角色外觀造成開頭畫面異常,以及要求過於快速和複雜的動作會產生身體扭曲和手部融化的視覺故障。

  • 4

    時間線提示詞技巧控制節奏:將15秒視頻分為三個時間段(0-5秒、5-10秒、10-15秒),為每個節拍分別撰寫提示詞,使動作流暢有序,並便於精細調整某個特定秒數而不影響整體。

實用技巧與重點

乾貨
  • 平台與模型
  • Higgs Field:整合多個AI模型的平台
  • CDance 2.0:視頻生成模型,支援文字轉視頻和圖像轉視頻
  • Nano Banana Pro:圖像生成模型(用於製作角色參考板)
  • Claude:AI助手,用於優化和打磨提示詞
  • 技術規格
  • CDance視頻時長上限:約15秒
  • 角色參考板構成:同一角色的正面、側面、背面三角度單一圖像
  • 提示詞結構公式
  • 主題 → 動作 → 設置 → 相機 → 風格
  • 音頻生成三種類型
  • 對白:用引號標記(如:"The city feels so right tonight")
  • 音效與環境音:描述性語言(如:footstep splash、city traffic hum)
  • 整體音樂氛圍:風格描述(如:upbeat and funky、tense and quiet)
  • 影片參考技巧
  • CDance可接受視頻作為參考輸入
  • 若要保留舊視頻的音頻但更新視覺內容:用黑色實色螢幕覆蓋舊視頻,隔離音軌供新生成使用
  • 在提示詞中標記各參考物件的用途
  • 角色設計優化
  • 減少角色配件數量可降低故障率(如背包會導致AI生成多個背包)
  • 角色參考板應從不同角度展示同一人物確保一致性

結論

結論

結構化的提示詞公式和時間線分解法是AI視頻製作的核心祕密,搭配角色參考板與音頻重用技巧,即可穩定產出專業級作品。

完整解析

詳細

在生成式AI的早期,簡單的文字提示往往無法產生預期的結果。講者指出,99%的人會輸入「小孩在城市跳舞」這類模糊指令,卻得到完全不同的人物和風格。2026年的今天,問題不在工具本身,而在於我們如何與工具溝通。

講者使用Higgs Field平台和CDance 2.0模型演示了兩條不同的道路。文字轉視頻讓AI完全自由發揮,每次結果都不同;圖像轉視頻則讓使用者先行鎖定角色。後者才是專業級工作流的基礎。他首先透過Nano Banana Pro製作了一個「角色參考板」——同一個高中生從正面、側面、背面拍攝,讓AI有明確的視覺參考點。關鍵細節是簡化配件數量,避免AI產生故障(他測試過的背包版本導致角色莫名其妙多了一個背包)。

接著講者揭示了提示詞的結構化公式:主題→動作→設置→相機→風格。將「小孩在城市跳舞」改寫為「中型跟蹤鏡頭,男孩在紐約人行道上搖動身體,黃金時刻」,效果立竿見影。他甚至演示如何使用Claude AI來自動優化提示詞,形成「自己結構化想法→讓Claude精修→手工微調」的完整工作流。

講者分析了四大初學者錯誤。首先是貪心——在一個15秒的短片內塞入走路、買飲料、檢查手機、過馬路、揮手、跳舞等十項動作,導致整部影片看起來像被按下了快進鍵。其次是缺乏鏡頭指導,讓AI隨意選擇角度和運動,每次生成都不同。第三個隱形殺手是在動作提示詞中重複描述角色外觀,這會破壞角色參考板的一致性。最後是要求過於複雜和快速的動作,例如頭旋轉和翻騰會導致肢體畸形和視覺故障。

解決方案是時間線提示詞。將15秒影片分成三個時段(0-5秒、5-10秒、10-15秒),逐段描述要發生的事,使每個節拍都有時間呼吸。這樣不僅動作流暢,也便於精細調整——如果某一秒出問題,只需修改那一段而不是重新生成整個視頻。

最後,講者展示了音頻整合技巧。CDance支援直接生成對白、音效和背景氛圍。他還分享了一個巧妙的技巧:當想要重用某個視頻的音頻但更新視覺時,可以用黑色實色螢幕覆蓋舊視頻,讓AI只提取音軌。講者示範的最終成品正是影片開頭的那個角色,從0-5秒的邊走邊唱,到5-10秒踩踏水坑,再到10-15秒升高視角的優美黃金時刻舞蹈,每一個節拍都準確到位。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。