KeyFrame內部研究專用

Building an Agentic Video Editor for Mass Consumer — Ekaterina Deyneka, Reelful

AI Engineer·8月18日週二·12 min中文

三句話摘要

代理式影片編輯——用 AI 代理自動理解素材、生成創意計畫並執行完整後製工作流程,讓使用者只需上傳媒體和指示就能產出專業成品。 代理式影片編輯透過將複雜的編輯判斷轉譯為程式碼邏輯與專化工作流程,讓 AI 代理能從真實素材中自動產出專業級成品,同時以行動優先和模板化設計降低使用者負擔。 代理式影片編輯相比生成式內容的根本差異在於約束條件——代理不能憑空創造,必須從既有素材中精選最佳時刻、決定取捨、組織結構,同時應付不完整或混亂的素材,最終交付專業級成品。

重點整理

重點
  • 1

    代理式影片編輯相比生成式內容的根本差異在於約束條件——代理不能憑空創造,必須從既有素材中精選最佳時刻、決定取捨、組織結構,同時應付不完整或混亂的素材,最終交付專業級成品。

  • 2

    基礎設施類似代理式應用建構工具,都採用遠端沙箱環境讓代理執行工具和技能,差異在於代理處理的物件(應用程式碼 vs. 影片合成),以及因此需要的特化驗證層。

  • 3

    將影片編輯任務轉譯為代碼(Remotion 框架)是核心策略,因為代理天生擅長撰寫程式碼,這樣做能將複雜的視覺編輯工作轉換為代理容易理解和執行的指令。

  • 4

    為了將複雜工作流程大規模交付給使用者,Realful 採取三層設計:行動優先降低進入門檻、方向性模板免除提示工程負擔、內建編輯器保留人工微調的靈活性。

實用技巧與重點

乾貨
  • 框架與技術:Remotion(開源框架,用 React 程式碼建立影片)
  • 融資:16z Speedrun
  • 核心工作流程:媒體理解 → 語音轉錄 → 創意計畫 → 使用者審核核准 → 沙箱環境啟動 → 代理執行編輯技能 → 遠端合成 → 驗證層檢查 → 成品輸出
  • 代理技能清單:剪輯規則、選擇最佳時刻、字體配對、B-roll 生成、音樂生成、旁白生成、聲音設計、照片動畫化
  • 方向性模板:說話對鏡頭、添加 B-roll、添加旁白等預設選項
  • 編輯功能:移除不適當片段、移除暫停、生成字幕、生成音樂、生成旁白、B-roll 生成、照片動畫化

結論

結論

代理式影片編輯透過將複雜的編輯判斷轉譯為程式碼邏輯與專化工作流程,讓 AI 代理能從真實素材中自動產出專業級成品,同時以行動優先和模板化設計降低使用者負擔。

完整解析

詳細

Kate 指出影片編輯是一項耗時且大多仍需手工操作的工作,導致許多人即使在會議、旅遊、活動中錄製豐富素材,也因編輯困難而從不公開分享。Realful 團隊決定從代理自動化的角度來解決這個問題。

代理式影片編輯的核心概念是:使用者只需提供媒體檔案(照片或影片)和編輯方向(例如添加字幕、音樂、旁白),代理就會自動理解素材內容、制定創意計畫、執行編輯工作、生成補充素材,最後交付一個可直接分享的成品片段。舉例來說,如果使用者錄製了一支對著鏡頭說話的影片,代理可以自動偵測並移除失敗片段和暫停,產出流暢完成的版本。

從基礎設施角度看,Realful 的架構與代理式應用建構工具類似:都採用遠端沙箱環境執行代理工作。不同之處在於,應用建構工具的代理處理程式碼庫並輸出應用預覽,而影片編輯代理則處理影片合成並輸出渲染後的影片。更重要的差異是編輯相比生成的複雜性——代理必須在既有素材的約束下做出最佳判斷,這需要專門的驗證層來確保品質。

技術實現方面,Realful 使用 Remotion(開源框架)將影片編寫成 React 程式碼。代理透過一組專化的技能執行工作:包括剪輯規則、時刻選擇、字體配對、B-roll 生成、音樂生成、旁白生成、聲音設計,以及照片動畫化。這種程式碼導向的方法充分利用了代理擅長寫程式碼的特點。工作流程從媒體理解和語音轉錄開始,隨後生成創意計畫供使用者審核核准,核准後啟動沙箱環境讓代理執行,最後通過驗證層檢查品質並迭代修正。

為了將這套複雜工作流程大規模交付給主流使用者,Realful 採取三項設計策略:行動優先,讓使用者在行走、駕駛或其他場景下編輯影片;提供方向性模板(如「對鏡頭說話」、「添加 B-roll」),免除使用者自行撰寫提示的負擔;內建傳統影片編輯器,讓使用者在代理生成成品後可進行細微調整。Kate 示範的所有範例影片都是完全由代理組裝、未經傳統編輯器觸碰的成品,並已在社群媒體上發布。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。