AI Director Showdown! GPT Codex vs. Claude Cowork! Automated Video Generation!
三句話摘要
展示如何通过 MCP 功能将 Higgingface 视频生成服务连接到 GPT Codex 和 Claude CO work,让 AI 充当导演自动生成故事视频。 通过 MCP 协议将视频生成服务开放给 AI Agent,可以让简单的文字提示转变成专业级故事视频,标志着 AI 创意生产正从"对话工具"演进为"自主创作工具"。 MCP 是关键桥接:HiggingFace 的 MCP 协议让 GPT 和 Claude 都能调用其图像视频生成能力,无需在各平台重复配置。
重點整理
重點- 1
MCP 是关键桥接:HiggingFace 的 MCP 协议让 GPT 和 Claude 都能调用其图像视频生成能力,无需在各平台重复配置。
- 2
Agent 比 Chat 强大:Chat GPT 只能提建议,但 Codex 和 CO work 作为 Agent 可以付诸行动──自动上传图片、调用 API、下载合成视频。
- 3
简化的创意流程:演讲者用现成的 AI 捏脸网站生成角色、简单提示词加时长限制,两位导演就能自主编排镜头、音效、对白组成完整故事。
- 4
两个模型呈现不同风格:同样提示词下,Codex 细节逼真但遇到下载障碍,CO work 快速完成且自动合成,体现了不同大模型的优劣差异。
實用技巧與重點
乾貨- 模型版本:GPT 5.6(高级)、Claude Sonnet 5(高级)
- MCP 连接步骤:HiggingFace 官网 → 复制模型连接 → GPT 设置→打开开发者模式→插件→新增服务器
- Codex 下载:GPT 对话框→左上角 Codex 图标→下载 Windows 版
- Claude 桌面版安装:官网下载→安装→自动启动→集成 chat/CO work/code 三合一
- HiggingFace 免费额度:注册送 100 积分(需绑定信用卡,3 天内可免费取消)
- 视频成本:15 秒 45 积分,30 秒约 90 积分
- 提示词关键参数:风格(电影寂静风格)、分辨率(480P/2K)、时长(15-30 秒)、具体场景描述、镜头和音效要求
- 生成角色网站:AI 追光(aizhuguang.tech)- 提供角色三视图生成,已接入 HiggingFace MCP,注册用户可直接在网站用积分生成图片视频
- 第一个案例:火星战舰场景,15 秒,提示词包括:电影写实风格 16:9、Seedance 2.0、2048p、外星巨人细节描写、槍枝特效、运镜音效要求
- 第二个案例:姐弟故事,30 秒,两个生成的人物头像,让 AI 自主安排 4-5 个镜头段落讲述感人故事
結論
結論“通过 MCP 协议将视频生成服务开放给 AI Agent,可以让简单的文字提示转变成专业级故事视频,标志着 AI 创意生产正从"对话工具"演进为"自主创作工具"。”
完整解析
詳細演讲者通过一个完整的演示,展现了当今 AI 视频生成的能力边界。首先需要理解 MCP(Model Context Protocol)的作用:它是一套开放标准,让不同的 AI 应用能够调用同一个模型服务。HiggingFace 提供的 MCP 连接让 GPT Codex 和 Claude CO work 这两个原本只能"聊天建议"的工具,升级成能"主动行动"的 Agent。
连接流程看似复杂,但逻辑清晰。演讲者在 HiggingFace 官网复制 MCP 连接码,然后分别在 GPT 网页版和 Claude 桌面版的插件设置中添加服务器配置。关键是要启用"开发者模式"和允许插件接入,否则无法识别新的 MCP 服务。两个平台都需要用自己的账户登录验证。
核心创意在提示词的设计。演讲者没有逐帧指挥,而是给定三个约束:(1) 整体风格和技术参数(电影级别、分辨率、时长),(2) 场景描写和人物细节,(3) 创意空间("自由运用不同影视手法,自主优化")。这样既确保了内容方向,又给了 AI 足够的创作自由度。
两个案例的对比很有启发性。第一个案例是纯想象的火星战斗场景,两个 AI 都能理解"外星巨人、绿色头发、獠牙、等离子枪"这些描写,生成结果各有特点──Codex 的细节更逼真,但在后期合成时遇到了下载软件的障碍;CO work 则更快完成,直接在本地合成了最终片段。
第二个案例更有意义:演讲者先用自己的 AI 捏脸网站生成了两个虚拟角色(东亚街头潮人风格的男女主角),然后上传给两个 AI 导演,只给了 30 秒的时长限制和一句话提示——"讲一个感人淚下的故事"。结果两个 AI 都自主决策了镜头安排、对白、配乐等元素,最后生成的视频讲述了一段姐弟间的离别故事。这说明 AI 不仅能执行指令,还能理解故事逻辑、角色情感,甚至能自己配置专业级的视频制作流程。
演讲者坦诚了现状的局限:生成的视频还有小瑕疵,音乐需要后期添加,有时是模型本身的限制而非 AI 导演的问题。但他的结论是:AI 越来越接近人类思维方式,随着技术迭代,未来说一句话就能生成完整视频不再是梦想。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


