KeyFrame內部研究專用

How to Create High Quality AI Videos With Claude

Parker Prompts·6月29日週一·9 min英文

三句話摘要

透過 Claude 與 Higgs Field 整合使用 MCP 協議,簡化 AI 影片製作流程,一個聊天窗口內完成從概念到 4K 成片。 MCP 協議將 Claude 轉變為 AI 影片製作的中樞,配合參考幀、分階段審批和解析度分層,可在單一對話窗口內以最經濟的方式製作專業品質影片。 MCP 協議的核心價值:MCP(模型上下文協議)是 AI 工具間的通訊標準,讓 Claude 能直接呼叫 Higgs Field 的工具,無需在多個標籤頁間移動檔案,解決了傳統 AI 影片製作的低效問題。

重點整理

重點
  • 1

    MCP 協議的核心價值:MCP(模型上下文協議)是 AI 工具間的通訊標準,讓 Claude 能直接呼叫 Higgs Field 的工具,無需在多個標籤頁間移動檔案,解決了傳統 AI 影片製作的低效問題。

  • 2

    參考幀技術維持一致性:在製作任何影片前,先生成潛水員手套、手電筒、水色的獨立參考圖像,後續所有場景都以此為基準,確保角色和環境在三個 12 秒片段中保持視覺連貫。

  • 3

    分階段審批制度防止級聯失敗:將整個計畫分為參考幀→序列分解→生成三個階段,每階段後暫停等待人工批准。若無此機制,Claude 會一次完成三個世代,第一個影片出錯會導致後續全部受影響。

  • 4

    解析度分層策略降低成本:先以 720p 生成和編輯(快速且便宜),編輯完成後再用 Topaz Video AI 的 Starlight Precise 2.5 模型一次升頻到 4K,比直接生成 4K 更經濟高效。

實用技巧與重點

乾貨
  • 設定時間:2 分鐘
  • 工具整合:Higgs Field(影片生成)+ Claude + MCP 協議 + Topaz Video AI(升頻)
  • 模型名稱:SeaDance 2.0(影片生成)、Starlight Precise 2.5(升頻模型)
  • 編輯軟體:CapCut
  • 完整案例規格
  • 總長度:36 秒水下短片(第一人稱視角)
  • 構成:3 個 12 秒影片 + 5 個編號鏡頭 + 精確到秒的時間軸
  • 生成解析度:720p、16:9、SeaDance 2.0
  • 最終解析度:4K(升頻後)
  • 音訊:僅環境音(調節器呼吸聲、氣泡、水聲)+ 後期配樂
  • 影片內容結構:探索 → 追逐 → 發現(敘事一致性)
  • 參考幀元素:炭灰色手套、黃色握環手電筒、深藍綠色水體、上方光線照射
  • 設定位置:所有參數放在句子敘述中(模型、品質、解析度、寬高比)
  • 最終編輯修剪:36 秒素材通常剪到 30 秒,各片段邊緣需修剪 1-2 秒硬邊界
  • 音樂選擇分區:探索用舒緩 → 追逐用激昂 → 發現用令人不安

結論

結論

MCP 協議將 Claude 轉變為 AI 影片製作的中樞,配合參考幀、分階段審批和解析度分層,可在單一對話窗口內以最經濟的方式製作專業品質影片。

完整解析

詳細

傳統 AI 影片製作的痛點在於流程碎片化:編寫提示在一個標籤、生成在另一個標籤、下載、重新上傳、在工具間不斷移動檔案。這個案例展示了如何透過 MCP 協議將 Higgs Field 直接整合進 Claude,使整個製作流程在單一聊天窗口內進行。首先完成 2 分鐘的設定:在 Claude 設定中新增自訂連接器,貼上 Higgs Field 的連結,授權影像和影片生成工具,再精簡開啟清單至實際需用工具,避免給 Claude 過多無用選項。

製作的核心策略是建立視覺一致性層級。講者先生成參考幀——一張潛水員手持手電筒的影像,包含所有後續片段都要保持的細節:炭灰色手套、黃色握環手電筒、深藍綠色水色、上方光線。這個參考幀經過兩個版本迭代才確定(第一版有潛水錶,第二版改為手電筒光束),確保夠具體以偵測偏差、又夠簡單以保證一致。之後進入序列分解階段,Claude 為三個 12 秒影片各撰寫完整提示,每個提示都重複開頭描述(手、手套、衣袖、手電筒),確保潛水員形象在所有片段中一致,同時將每段分解為五個編號鏡頭,每個鏡頭精確標時(2 秒、3 秒等),內建剪輯邏輯。三段提示並呈給使用者一次批核,避免逐代發現問題。

生成階段採用 SeaDance 2.0 模型,720p、16:9 解析度。選擇 720p 而非 4K 是經濟考量:編輯低品質檔案更快,且只需為最終剪輯版本付費升頻一次。三個影片依序生成,每個生成後停頓讓使用者檢視,再生成下一個,避免級聯失敗。編輯階段在 CapCut 中進行:匯入三個影片及背景音樂,按劇情順序排列,修剪各片段邊界(AI 生成物邊緣通常有 1-2 秒硬邊界),根據場景選擇音樂(探索用舒緩、追逐用激昂、發現用詭異)。36 秒素材通常剪至 30 秒左右,所以應產出比目標長度更長的素材作為剪輯空間。

最後一步是升頻。將編輯完成的 720p MP4 上傳回 Claude,貼入升頻設定:Topaz Video AI、Starlight Precise 2.5 模型、目標 4K、寬高比自動(防止拉伸)。Claude 自動完成上傳、驗證、任務確認、升頻全過程,輸出完整 4K 影片。效果顯著——水紋理、粒子效果、手電筒光束在大螢幕上清晰可見。整個流程的妙處在於,使用者幾乎不離開 Claude 聊天窗口,從測試圖像到 4K 成片,所有複雜操作都透過一條連接線完成,人工只需要做手工剪輯。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。