KeyFrame內部研究專用

AI Can Make a Full Movie Now?! Unlimited Length, Controllable Storyboards|Topview AI Tutorial

小發學姐·5月25日週一·21 min中文

三句話摘要

用故事板預先規劃影片關鍵畫面,再用Seedance生成高效AI影片的工作流。 AI影片生成的關鍵不在模型本身,而在於用故事板預先規劃視覺結構和敘事節奏,讓AI按照精準的劇本執行,才能實現高效且高質量的輸出。 傳統AI影片生成流程是直接輸入提示詞→反覆試錯→持續重新生成,浪費資源;故事板工作流先確定關鍵畫面和情感節奏,讓Seedance清楚整個故事的結構方向,大幅提升生成質量。

重點整理

重點
  • 1

    傳統AI影片生成流程是直接輸入提示詞→反覆試錯→持續重新生成,浪費資源;故事板工作流先確定關鍵畫面和情感節奏,讓Seedance清楚整個故事的結構方向,大幅提升生成質量。

  • 2

    故事板不只生成漂亮圖片,而是真實拆解故事的關鍵時刻——校園短片案例中AI自動識別出「正常日常→發現異常→角色感受→情感收尾」的完整敘事弧線,使後續生成的影片角色有演技、表情準確。

  • 3

    教程類影片(料理、製作流程)天然適合故事板,因為本身就有固定步驟節點,預先規劃分鏘圖能確保AI生成時步驟清晰、邏輯合理,還能包含"蛋糕側邊需要抹奶油、擠奶油花"這樣的細微細節。

  • 4

    V2智慧體支援片段延展和拼接,超越單個影片15秒限制,使用者可模組化地構建30秒以上的完整影片,同時點選延展按鈕繼續新增後續內容。

實用技巧與重點

乾貨
  • 工具與模型
  • 平臺:Topview(包含故事板功能和V2影片智慧體)
  • 影象模型:ChatGPT Image 2
  • 影片模型:Seedance 2.0、Happy Horse 1.0、Kling O3(可選)
  • Topview訂閱:Ultra方案提供365天無限生成(不消耗積分)
  • 分鏘圖設定引數
  • 參考圖片上傳數:最多16張
  • 場景(關鍵時刻)數量:4、9、25或更多(推薦9格)
  • 畫面比例:16:9(橫屏)或9:16(豎屏)
  • 解析度:2K(推薦用於後續影片生成)
  • 每格自動配時:可自定義(如3秒/格)
  • 影片生成引數
  • 常規生成最長時長:15秒
  • V2智慧體:支援無限時長
  • 解析度選項:最高1080P支援自動清晰化
  • 生成數量:可一次生成1-4個版本
  • 工作流步驟
  • 進入故事板操作面板
  • 上傳參考圖片(角色/場景/產品素材)
  • 描述故事或教程流程
  • 選擇分鏘圖數量(推薦9格)與畫面比例
  • 點生成分鏘,等待AI生成關鍵畫面
  • 不滿意可區域性重繪(選中元素→描述新要求→重生成)
  • 下載分鏘圖或直接點生成影片
  • 寫提示詞:「按照圖片X的N個分鏘設計生成影片」並用@引用參考圖
  • 選擇模型、設定影片時長和解析度
  • 點生成或轉到V2智慧體生成無限時長
  • 提示詞關鍵要點
  • 如不需角色講話,務必註明:「角色全程不說話,只用眼神、表情和肢體動作表現情緒」
  • 引用參考圖方式:@直接點選參考圖片1、2等
  • 案例具體資料
  • 校園短片案例:
  • 分鏘數:9格
  • 故事設定:「放學後,一位女生在校園發現時間變慢」
  • 生成效果:角色有停頓、抬頭、疑惑表情,甚至說出臺詞「誒,怎麼回事」;葉子飄起停空中表現時間變慢感;旁邊同學動作也變慢;整體情緒和構圖準確
  • 草莓蛋糕教程案例:
  • 分鏘數:9格
  • 目標時長:30秒
  • 實際時長:27秒(每格3秒,9格=27秒)
  • 分鏘內容:準備食材→打蛋攪拌→倒入模具→烤箱烘烤→蛋糕出爐→塗抹奶油→裝飾草莓→成品展示
  • 生成效果:包含蛋糕側邊抹奶油、擠奶油花等細節;V2智慧體生成完整30秒影片,包含俯拍、手部特寫、切鏡頭等多種景別和攝影機運動

結論

結論

AI影片生成的關鍵不在模型本身,而在於用故事板預先規劃視覺結構和敘事節奏,讓AI按照精準的劇本執行,才能實現高效且高質量的輸出。

完整解析

詳細

傳統AI影片生成工作流存在根本缺陷:使用者直接向Seedance輸入提示詞,然後因畫面不理想、細節不對或角色表現不穩而反覆重新生成,造成嚴重的配額和資源浪費。講者小發發現,問題的根源並不在於模型的能力,而在於使用者未能預先將影片的視覺結構和敘事流程規劃清楚。為了驗證這一想法,他測試了Topview平臺新推出的故事板功能,探索一套「先規劃分鏘→再生成影片」的新工作流。

故事板的核心價值在於它充當視覺導演的角色。使用者首先上傳最多16張參考圖片(可以是角色素材、場景素材或產品素材),然後用自然語言描述想要講的故事或製作流程。Topview會自動分析這個故事的關鍵節點,使用ChatGPT Image 2生成對應的分鏘畫面。講者建議選擇9格作為平衡點——足夠詳細地表達完整故事,但不至於讓後續控制變得複雜。為確保後續用於影片生成時細節不失真,分鏘圖解析度應設為2K。

校園短片案例充分展示了故事板相比盲生成的優勢。講者輸入「放學後,一位女生在校園發現時間變慢」這一創意後,AI生成的9格分鏘不僅僅是9張漂亮的圖片,而是真正拆解了這個故事的完整敘事弧線:前幾格展現正常的校園日常和夕陽氛圍,中間的格子開始出現異常訊號(葉子飄起停在空中),後續格子強化角色對這種異常的感知(伸手觸控),最後用開放的構圖和強烈的情緒作收尾。有了這樣清晰的分鏘藍圖,Seedance 2.0生成的影片才能真正「按照劇本演戲」——角色會停下腳步、抬頭觀察周圍、露出疑惑的表情,甚至說出「誒,怎麼回事」這樣符合情節的臺詞,而不是隻堆砌視覺效果。

教程類影片如草莓蛋糕製作演示更能體現故事板的實用價值。這類內容天然具有固定的流程節點(準備食材→打蛋攪拌→倒入模具→烤箱烘烤→出爐→塗奶油→裝飾→成品),故事板能把每個關鍵步驟精確地視覺化。使用者設定目標時長為30秒、選擇9格分鏘後,每格自動分配3秒時間。生成的分鏘不僅有畫面,還附帶文字標註清楚說明每一幕的具體步驟。當使用者轉向V2智慧體進行正式影片生成時,即使需要超過單個影片的15秒限制,也能透過片段延展功能分段拼接——講者的完整30秒教程影片甚至精確包含了「蛋糕側邊需要抹奶油和擠奶油花」這樣微觀的製作細節。

這套工作流最深層的轉變是從低效的「生成-試錯-重來」迴圈,轉向高效的「規劃-生成-微調」流程。故事板讓AI在生成正式影片前就對整體節奏、視覺構圖、故事邏輯有了清晰的認知,使Seedance能夠在理解劇本的基礎上執行,從而大幅提升生成質量和工作效率。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。