KeyFrame內部研究專用

How to Make AI Videos From a Storyboard (Full Guide)

Youri van Hofwegen·6月23日週二·8 min英文

三句話摘要

用單一故事板和 AI 生成視頻的完整工作流程——在 Higgs Field 平台上快速製作多種風格的動畫視頻。 用故事板作為單一真實來源,搭配 Claude、GPT Image 2 和 CDANS 2.0,能在一個平台快速製作多種風格的 AI 視頻,避免傳統逐鏡頭生成的繁瑣和不一致。 角色表是基礎——上傳多個角度的自己照片作為參考,讓 AI 在整個視頻過程中保持人物一致性;這是大多數創作者忽略但至關重要的步驟,否則拍攝到一半角色會變樣。

重點整理

重點
  • 1

    角色表是基礎——上傳多個角度的自己照片作為參考,讓 AI 在整個視頻過程中保持人物一致性;這是大多數創作者忽略但至關重要的步驟,否則拍攝到一半角色會變樣。

  • 2

    故事板統一規劃——在生成任何動畫前,用 15 個面板預先規劃整個視頻(每個面板代表一秒),標註鏡頭類型、動作和時碼,這樣視頻模型有完整的參考資訊,無須逐鏡頭分別生成。

  • 3

    Claude 自動化提示詞——利用故事板提示生成器,只需一句話描述場景,Claude 自動產出詳細的故事板提示詞,省去手動描寫 15 個鏡頭的時間。

  • 4

    風格即參數——改變字尾的風格標籤(rubber hose / photorealistic / cell shaded 80s anime),整個視頻從卡通變寫實或變動畫,用同一個工作流創造完全不同的成品。

實用技巧與重點

乾貨
  • 平台:Higgs Field
  • 角色表製作:GPT Image 2,高保真度、2K 品質、16:9 縱橫比,上傳多角度照片
  • 風格參數:rubber hose、photorealistic、cell shaded 80s anime
  • 故事板生成:GPT Image 2,4K 品質,批次 2,包含 15 個面板(每面板 = 1 秒)
  • 視頻生成:CDANS 2.0 模型,1080p 分辨率、16:9、15 秒時長
  • 提示詞生成工具:Claude 故事板提示生成器
  • 工作流步驟:角色表 → 編寫故事板提示詞 → Claude 自動生成詳細提示 → GPT Image 2 生成故事板 → CDANS 2.0 生成動畫視頻

結論

結論

用故事板作為單一真實來源,搭配 Claude、GPT Image 2 和 CDANS 2.0,能在一個平台快速製作多種風格的 AI 視頻,避免傳統逐鏡頭生成的繁瑣和不一致。

完整解析

詳細

傳統的 AI 視頻製作方式是逐鏡頭生成再拼接,既慢又容易出現不一致。講者的改進方案是先從一張故事板出發,規劃整個視頻結構,再統一生成動畫。

第一步是製作角色表。用戶上傳自己的多角度照片(而非單張),讓 AI 有更多參考資訊來鎖定人物特徵。同時在提示詞中指定風格,例如「rubber hose」(卡通風格),這決定了整個視頻的視覺調性。生成的角色表會包含全身和臉部特寫,背景保持乾淨,避免 AI 被無關細節干擾。

接著編寫故事板。不同於傳統方式逐鏡頭描述,講者用 Claude 的故事板提示生成器自動化這一步:只需用一句話概述場景內容(例如「製作拉麵」),Claude 自動產出包含 15 個面板的結構化提示,每個面板都標註了鏡頭類型、動作和時碼。這份提示詞可直接交給 GPT Image 2 生成視覺故事板,設置 4K 品質和批次 2,得到完整的 15 格故事板圖。如果某些面板的細節不一致(例如配料數量變化),可以選擇性地編輯故事板,只修改特定元素。

故事板完成後,進入視頻生成階段。在 CDANS 2.0 模型中上傳角色表和故事板作為參考,設置 15 秒時長、1080p 分辨率、16:9 比例,打開自然音效,提示詞則保持簡單(只需說「按故事板動畫化」),因為 AI 已從視覺參考中取得所有必要的指導。最終產出的視頻節奏流暢、人物一致、每一幕都按故事板執行。

該工作流最強大的地方在於靈活性。只要改變角色表中的風格參數,同樣的故事板就能生成完全不同的視頻風格——卡通版、寫實版、80年代動畫版各自獨立,但都基於同一個邏輯框架。講者示範了三個完全不同的視頻:卡通製作拉麵、穿著鐵匠衣著的寫實版,以及衝浪的 80年代動畫風格,每一個都用同一套工作流完成,只改風格參數。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。