KeyFrame內部研究專用

ComfyUI AI Video Tutorial for Beginners

Kevin Stratvert·7月6日週一·7 min英文

三句話摘要

使用 Comfy UI 在個人 PC 上免費生成 AI 影片的完整指南。 Comfy UI 透過本地運行 AI 模型,消除了訂閱費用和使用額度限制,使任何擁有相容硬體的創作者都能自由地批量生成和實驗 AI 影片內容。 Comfy UI 是免費開源應用程式,支援在個人電腦上直接運行 AI 模型,無需雲端服務或付費訂閱,提供文字轉影片、圖片轉影片、影片編輯、攝影機控制等多種功能。

重點整理

重點
  • 1

    Comfy UI 是免費開源應用程式,支援在個人電腦上直接運行 AI 模型,無需雲端服務或付費訂閱,提供文字轉影片、圖片轉影片、影片編輯、攝影機控制等多種功能。

  • 2

    軟體自動提示缺失模型並支援批量下載,Windows + Nvidia RTX 顯示卡的配置最穩定可靠,使用者只需確保足夠的磁碟空間便可進行。

  • 3

    LTX 2.3 模型具備快速生成、高品質輸出的特點,使用者只需在工作流中輸入描述性提示詞、調整寬度高度和幀率等參數,點擊 Run 即可自動生成並儲存影片。

  • 4

    Comfy UI 支援多種影片模型(WAN 2.2、Hanyuan、Kandinsky 等),進階使用者可自訂工作流、組合不同模型創作更複雜的 AI 影片內容。

實用技巧與重點

乾貨
  • 軟體與模型:
  • Comfy UI 官網:提供桌面版和雲端版本
  • 免費模型:LTX 2.3、WAN 2.2、Hanyuan、Kandinsky、SVD
  • 儲存需求:LTX 2.3 模型約 40GB
  • 推薦配置:
  • Windows PC + Nvidia RTX 顯示卡
  • 可調參數:
  • 寬度(Width)
  • 高度(Height)
  • 持續時間(Duration)
  • 幀率(Frame Rate)
  • 支援功能:
  • 文字轉影片(Text to Video)
  • 圖片轉影片(Image to Video)
  • 影片編輯、攝影機控制、修復(In-painting)、放大(Upscaling)
  • 操作流程:
  • 下載桌面版安裝程式
  • 運行安裝、啟動軟體、選擇「Local」模式
  • 從左側選擇「Video」類別
  • 篩選「Runs on: Comfy UI」及任務類型
  • 選擇模型(如 LTX 2.3)進入工作流
  • 點擊「Show Missing Models」→「Download All」
  • 輸入提示詞、調整參數
  • 點擊「Run」生成
  • 在 Assets 中預覽、保存或刪除結果

結論

結論

Comfy UI 透過本地運行 AI 模型,消除了訂閱費用和使用額度限制,使任何擁有相容硬體的創作者都能自由地批量生成和實驗 AI 影片內容。

完整解析

詳細

Comfy UI 提供了一條通往本地 AI 影片生成的途徑,徹底打破了過去對雲端服務和訂閱費用的依賴。這套開源應用程式在設計上便考慮到了易用性,使即便是首次接觸的使用者也能相對輕鬆上手。

從安裝開始,流程相當簡潔。使用者在官網選擇桌面版本,下載並執行安裝程式後,軟體會要求輸入本次安裝的名稱,並允許配置基本參數。啟動後進入主畫面,左側導航欄列出了所有支援的 AI 任務類型—圖像、影片、音訊、3D 模型和大語言模型。選擇影片功能後,系統會根據使用者的篩選條件(運行位置、任務類型)展示相應的模型清單。本教程重點聚焦在 LTX 2.3 模型上,主要原因是其生成速度快、品質優秀,且相容性廣泛,足以在各種 Nvidia RTX 顯示卡上穩定運行。

點擊模型後,使用者進入 Comfy UI 的工作流畫布。初見此介面時不免感到複雜,但實際上核心操作僅涉及少數節點。首先軟體會提示缺失的模型文件,使用者可點擊「Show Missing Models」查看需要下載的項目。以 LTX 2.3 為例,五個模型文件總計約 40GB,因此預先檢查磁碟空間至為重要。點擊「Download All」後,軟體會自動下載所有必要檔案,這一過程只需進行一次。

下載完成後,生成影片的核心步驟極為簡單。使用者在主節點中輸入對影片的描述性提示詞(例如「Kevin Cookie company blimp flying over city at golden hour」),隨後可調整寬度、高度、持續時間和幀率等參數。保留預設值亦可直接生成。點擊「Run」按鈕後,軟體利用顯示卡的運算能力進行生成,根據硬體效能需時數分鐘不等。生成的影片自動儲存到軟體內部,使用者可在 Assets 部分預覽、匯出或刪除。

除文字轉影片外,Comfy UI 也支援圖片轉影片的工作流。使用者僅需在相應工作流中匯入一張靜態圖片,輸入描述所需動畫效果的提示詞(例如「the blimp flying upward」),軟體便會為該圖片添加運動效果。隨著使用者經驗累積,更高階的應用也隨之開放—如自訂工作流、組合不同模型進行多步處理、利用影片編輯、攝影機控制或修復等功能進行專業級影片創製。整個生態保持高度的靈活性和擴展性。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。