KeyFrame內部研究專用

GPT-5.6 + Codex: A Complete Hands-on Guide to Automated Video Generation!

AI追光·7月11日週六·30 min中文

三句話摘要

如何在 ChatGPT 與 Codex 中連接 Higgsfield MCP,實現 AI 自動生成專業視頻。 透過 GPT/Codex 的 MCP 整合與 Higgsfield 的 API,視頻創作已從傳統手工剪輯進入配置化時代——用自然語言描述創意需求,AI 自動完成故事、分鏡、生成、編輯的全鏈路。 GPT 的 MCP 連接流程簡化了開發難度。在賬戶安全中啟用開發者模式後,於插件中心添加外部應用,輸入 Higgsfield 官網提供的 MCP 服務器連接鏈接即可授權使用。連接成功後,GPT 能直接調用 Higgsfield 的圖片與視頻生成能力。

重點整理

重點
  • 1

    GPT 的 MCP 連接流程簡化了開發難度。在賬戶安全中啟用開發者模式後,於插件中心添加外部應用,輸入 Higgsfield 官網提供的 MCP 服務器連接鏈接即可授權使用。連接成功後,GPT 能直接調用 Higgsfield 的圖片與視頻生成能力。

  • 2

    Codex 實現了接近全自動的視頻生成管道。用戶只需描述需求(如「每天生成 3 條 9:16 短視頻,每條 10 秒,統一人物風格」),Codex 自動編寫劇本、生成分鏡提示詞、創建參考圖、調用 Seedance 2.0 批量生成、自動拼接轉碼,甚至上傳至 YouTube。

  • 3

    AI 追光網站形成完整的免費生態閉環。提示詞生成器 → Higgsfield 生成圖片/視頻 → 免費剪輯工具編輯 → 導出。用戶無需購買昂貴軟件,即可完成專業級視頻製作。

  • 4

    當前自動化仍存在重要限制。雖然流程自動化程度已高,但每個 AI 生成的鏡頭仍需人工審核品質,無法達成 100% 全自動化,完整無人工介入的生成還需進一步發展。

實用技巧與重點

乾貨
  • GPT 連接步驟
  • 賬戶安全 → 開發者模式打開 → 左側插件 → 浏覽插件 → 加號 → 新應用
  • 應用名稱輸入「higgsfield」
  • 粘貼 Higgsfield 官網提供的 MCP 服務器連結
  • 創建 → 使用 Higgsfield 登錄 → 允許連接
  • 推薦模型與成本
  • 視頻生成:Seedance 2.0(0.125 積分/條)、Seedream 4.5
  • 圖片生成:GPT 圖像、Nano、Banana Flash、Grok GPT-4.5
  • 新用戶免費積分:100 積分(詳見講者前期視頻)
  • 視頻生成參數設置
  • 比例:21:9(推薦)、16:9、9:16
  • 解析度:480P(節省積分)、2K(高質量)
  • 時長:10-15 秒
  • 運鏡強度:中等
  • 風格:電影感、蒸氣龐克、廢土等
  • AI 追光網站功能
  • 角色設置:性別、年齡、體型、氣質、光線方向(逆光、暖金等)
  • 三視圖生成:正面特寫、側邊全身、全身
  • 提示詞自動生成與複製
  • 剪輯工具功能
  • 音頻分離、音量調整、漸變效果
  • 視頻剪切、刪除、速度控制(快進/慢動作)
  • 字幕自動識別、免版權音樂庫
  • 輸出格式:MP4、音訊、字幕,支持多種分辨率與幀率
  • Codex 自動化流程示例
  • 輸入需求:「一分鐘影片,兩個角色(男女)激烈打鬥對話,根據劇本生成提示詞、角色參考圖、場景圖,用 Seedance 2.0 製作四段 15 秒視頻(21:9、480P、好萊塢運鏡、專業音效),拼接成一分鐘成片,上傳 YouTube」
  • Codex 自動完成:
  • 生成詳細劇本與分鏡提示詞
  • 角色與場景參考圖生成
  • 四段視頻批量生成與檢查
  • 視頻下載、轉碼拼接
  • YouTube 上傳(需授權)
  • 免費資源與活動
  • APP 大賽:Higgsfield 官網 APPS 頁面,獎池 100 萬美元
  • 新用戶 100 積分免費贈送
  • AI 追光網站:www.ai-spotlight.com(講者網站,說明欄提供)

結論

結論

透過 GPT/Codex 的 MCP 整合與 Higgsfield 的 API,視頻創作已從傳統手工剪輯進入配置化時代——用自然語言描述創意需求,AI 自動完成故事、分鏡、生成、編輯的全鏈路。

完整解析

詳細

在 AI 視頻生成的實踐中,GPT 與 Codex 的 MCP 集成已經讓自動化變得可行且易用。講者透過實際操作展示了從基礎連接到完整製作的全過程。

首先是 GPT 的設置階段。用戶需要在 ChatGPT 的賬戶安全選項中找到「開發者模式」按鈕並打開——這是解鎖 MCP 插件功能的關鍵一步。隨後進入左側插件面板,點擊「浏覽插件」進入插件市場。在搜尋框旁出現的加號按鈕用於添加外部應用。選擇「新應用」,輸入應用名稱「higgsfield」,然後將從 Higgsfield 官網複製的 MCP 服務器連結粘貼到指定欄位。系統會提示這是外部 MCP 服務器的連接警告,提醒用戶審慎,但由於 Higgsfield 是官方渠道,可以安全地點擊「了解」並繼續授權。創建完成後,GPT 會執行連接握手,用戶需要登錄 Higgsfield 賬戶並允許 ChatGPT 訪問權限,連接即告成功。

連接成功後,GPT 的能力得到顯著擴展。用戶可以在對話中上傳角色參考圖片與場景圖。以講者的實驗為例,他上傳了一位女特工與男傭兵的角色設定圖,加上一張廢土地鐵站場景圖。GPT 自動分析這些視覺素材,然後生成完整的視頻製作提示詞——涵蓋人物動作、鏡頭運動、環境氛圍、光線質感等細節,最後直接調用 Higgsfield 的 Seedance 2.0 模型生成視頻。講者設定了四段各 15 秒的視頻片段,21:9 寬高比,480P 解析度(節省積分),最終 GPT 自動拼接成 60 秒完整成片。整個過程中用戶幾乎不需要手動調整,除了初始的圖片上傳和需求描述外。

Codex 則將這種自動化推向更高層次。Codex 是 GPT 的桌面應用版本,具備更強的任務編排能力。用戶可以向 Codex 提出複雜需求,例如「每天生成 3 條 9:16 的產品短視頻,每條 10 秒,統一人物和風格,每週、每月自動定時生成」,Codex 就能自動配置整個生成管道:自動編寫適應短視頻節奏的劇本與分鏡、生成角色與場景參考圖、批量調用 Seedance 2.0 生成視頻、進行品質檢查、自動下載轉碼處理不同的視頻格式、最後直接上傳到用戶授權的 YouTube 頻道並按指定時間發布。這樣的能力將視頻創作從創意工作轉變為配置工作——用戶只需定義規則和內容方向,AI 執行所有製作步驟。

支撐整個生態的還有 AI 追光網站這樣的輔助工具。該網站提供免費的角色提示詞生成器,用戶通過簡單的多選面板(性別、年齡、體型、氣質、光線方向等)就能生成結構化的提示詞。生成的圖片與視頻自動保存在用戶的 Higgsfield 賬戶中,然後用戶可以使用網站內置的免費剪輯工具進行專業級編輯。這個剪輯工具支持音頻分離、音量調整、時間軸上的漸變效果、視頻速度控制(快進變 2 倍速、慢動作等)、自動字幕識別、免版權音樂庫等功能。導出時用戶可自定義 MP4 或音訊格式、寬高比(16:9、21:9、9:16 等)、解析度、幀率、碼率等參數。這形成了一個完整的視頻製作閉環,用戶無需購買 Adobe Premiere 或其他昂貴軟件。

成本方面,新註冊 Higgsfield 用戶可獲 100 積分免費額度。其中 Seedance 2.0 模型生成成本最低,每條視頻僅消耗 0.125 積分,足以讓用戶體驗完整的工作流。講者同時強調了 100 萬美元的 APP 大賽機會,用戶可在 Higgsfield 官網 APPS 頁面參賽。

需要注意的是,當前自動化仍存在重要限制。雖然流程自動化程度已很高,但每個 AI 生成的鏡頭仍可能存在表情、口型、動作不自然等瑕疵,需要人工逐幀審核確認。因此完全無人工介入的全自動化生成在技術上還未完全成熟,仍需進一步的模型改進。但從講者的演示結果來看,當前已能生成看上去合理的視頻素材,配合適當的編輯就能產出可用內容。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。