KeyFrame內部研究專用

Create LONG AI VIDEOS 🚀 Seedance 2.5 1080p Quality ✅ #ai #aivideo

Raj Photo Editing and Much More·8月17日週一·11 min英文

三句話摘要

使用 Cadence 2.5 AI 影片生成工具製作逼真短影片,用於商品展示和社群行銷 Cadence 2.5 讓任何規模的商家都能在 5-7 分鐘內用 AI 製作專業級的產品廣告,關鍵是善用參考資料保持一致性和用分段拼接技巧創作長影片。 Cadence 2.5 的更新升級了影片品質和長度能力。過去限制在 10-15 秒,現在支援 30 秒單段和 1080p 高清,皮膚紋理、肢體動作、表情都達到逼真效果,特別適合商品展示和社群行銷。

重點整理

重點
  • 1

    Cadence 2.5 的更新升級了影片品質和長度能力。過去限制在 10-15 秒,現在支援 30 秒單段和 1080p 高清,皮膚紋理、肢體動作、表情都達到逼真效果,特別適合商品展示和社群行銷。

  • 2

    角色一致性通過上傳參考資料來保證。講者上傳自己的照片、主角照片、配角照片(例如 4 個反派角色各一張)以及 15-16 秒的聲音樣本,在提示詞中標記這些資料的位置,生成的影片就會複製講者的聲調和外表特徵。

  • 3

    製作長影片的核心技巧是分段銜接。第一段製作 15 秒,第二段時上傳第一段的成品影片作為參考點,確保第二段從第一段結尾的動作和表情接續;第三段同理。即使是多段拼接,視覺上也完全連貫。

  • 4

    產品廣告製作工作流程實現了自動化。在 ChatGPT 輸入商品類型和名稱,讓 AI 生成詳細提示詞;上傳產品照片和模特照片供 ChatGPT 分析;將完整提示詞回傳到 Cadence 2.5,選擇 1080p 和 15-30 秒,一鍵生成可直接上傳社群的廣告影片。

實用技巧與重點

乾貨
  • 平台:Cadence 2.5(早期測試階段,僅在 Higgs Field 提供)
  • 影片長度選項:30 秒(需額度)、15 秒(可選無限制免費模式)、20 秒(無限制免費模式限制)
  • 品質選項:1080p 或 720p
  • 1080p 製作成本:270 額度製作 30 秒影片;目前享 30% 折扣
  • 720p 優勢:20 秒無限制免費生成(無需額度)
  • 製作時間:單支 30 秒影片 5-7 分鐘
  • 比例:16:9 寬螢幕
  • 位元率:高
  • 參考資料類型:照片(JPG/PNG)、聲音樣本(15-16 秒 MP3)、前期生成影片
  • 長影片製作單位:15 秒段落(可無限連接)
  • 提示詞生成工具:ChatGPT

結論

結論

Cadence 2.5 讓任何規模的商家都能在 5-7 分鐘內用 AI 製作專業級的產品廣告,關鍵是善用參考資料保持一致性和用分段拼接技巧創作長影片。

完整解析

詳細

Cadence 2.5 的最新版本帶來了實質的升級。從前的限制是單支影片最多 10-15 秒、解析度只有 720p,現在已經可以製作 30 秒的 1080p 高清影片。從視覺效果來看,皮膚紋理變得細緻,肢體動作和表情更加流暢自然,已經達到令人信服的逼真程度。這項升級對電商和社群媒體內容創作開啟了新的可能性。

要讓 AI 生成的影片保持角色一致性,講者展示了一套標準工作流程。首先準備所有需要的參考資料:自己的照片(作為主角或旁白者)、女主角的照片、所有配角的照片,以及一段 15-16 秒的自己聲音錄音。上傳到 Cadence 2.5 後,在提示詞中明確標記每個參考資料的用途——例如「image 1 是主角」「audio 1 是主角聲音」「image 2、3、4、5 是四個反派角色」。系統會根據這些標籤在生成過程中保持一致性,確保主角始終是你上傳的臉孔,聲音也模仿你錄製的特徵。

製作超過 30 秒的長故事影片,則需要運用分段拼接的策略。先製作第一個 15 秒的片段,完成後將這支影片下載。然後製作第二段時,關鍵步驟是把第一段生成的影片上傳作為「參考影片」,確保系統知道第二段應該從第一段結尾的動作和表情開始。第三段、第四段依此類推,每一段都參考上一段的結尾。最後在任何影片編輯軟體(例如 Adobe Premiere、DaVinci 等)中簡單地把這些片段連接起來,觀眾完全感受不到接縫。

對於需要製作產品廣告的商家,講者提供了另一條省力的路徑。做法是先在 ChatGPT 中輸入兩項信息:目標客群(例如「年輕女性」)和產品類別(例如「女裝」),讓 ChatGPT 根據這些信息生成一份詳細的影片劇本和提示詞。接著上傳產品照片和模特照片給 ChatGPT,讓它分析這些圖片的細節,進一步豐富提示詞。然後回到 Cadence 2.5,把完整的 ChatGPT 生成的提示詞和圖片上傳,選擇 1080p 品質和 15-30 秒長度,點擊生成。最終得到的廣告影片背景逼真、模特動作自然、服裝細節清晰,甚至鏡頭運動也很專業,可以直接上傳到 Instagram、TikTok 等平台。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。