这次我们不聊单点工具,而是把 MCP、多智能体和视频创作流程串起来,做成一条能实际落地的生产流水线。
MCP 全称 Model Context Protocol,是 Anthropic 在 2024 年开源的模型上下文协议,用来统一 AI 模型与外部工具、数据源之间的调用方式。多智能体系统则是把视频创作里的选题、脚本、分镜、画面生成、配音、字幕、质检拆成多个角色,每个角色由不同 Agent 承担,再靠 Prompt 和 Workflow 协同。两者组合之后,视频创作从“人在多个软件之间来回搬运素材”变成一条可编排、可观测、可批量执行的流水线。
这套方案的门槛并没有想象中那么高。MCP 本身只是一层协议,不绑定显卡,真正的资源大头在图像生成、视频生成和语音合成这些后端工具上。所以你可以先在一台普通办公电脑上把编排流程跑通,再决定哪些环节放到本地 GPU 或云端 API。
本文会从头搭建一套基于 MCP 的多智能体视频创作流程,内容包括:核心能力速览、适用场景与边界、架构设计、环境准备、MCP Server 编写与启动、多智能体编排示例、功能测试与验证、接口 API 与批量任务、资源占用观察、常见问题排查和最佳实践。文中代码是可以直接改用的骨架,不是演示用的空壳。
适合读者主要有三类:团队里想搭 AI 视频生产流水线的技术负责人,做过 ComfyUI 或 API 集成、想继续做流程编排的开发者,以及需要批量生成短视频的内容团队。读完你能拿到一套可运行的骨架,并且清楚每个环节怎么验证、怎么发现问题。
1. 核心能力速览
先把这套方案的规格列出来。如果你是第一次接触 MCP 或多智能体,可以先通过这张表判断值不值得继续往下看。
1.1 方案规格
| 能力项 | 说明 |
|---|---|
| 方案类型 | 基于 MCP 的多智能体视频创作流水线 |
| 核心协议 | MCP(Model Context Protocol),Anthropic 开源的开放协议 |
| 链路能力 | 选题、脚本、分镜、图像生成、图生视频、配音、字幕、质检 |
| 多智能体编排 | 支持按角色拆分 Agent,通过 Workflow 串联 |
| MCP Server 扩展 | 可接入现成 Server,也可用 Python/TypeScript/Java 自研 |
| 运行环境 | Windows / Linux / macOS,流程编排可纯 CPU 运行 |
| 显存占用 | MCP 层不占显存,取决于所接的图像/视频模型 |
| 启动方式 | 命令行启动 MCP Server,客户端通过 STDIO 或 HTTP/SSE 连接 |
| 调试手段 | MCP Inspector、日志、任务 Checkpoint |
| API 能力 | 可将 MCP Server 包装成 HTTP 接口,支持批量任务队列 |
| 适合场景 | 批量短视频、教程视频、数字人视频、素材混剪 |
1.2 MCP 在流程里的位置
MCP 解决三个核心问题:发现、传输、权限边界。Agent 不需要预先把每个工具写死,而是通过 MCP Client 去读 Server 暴露的工具列表;调用时统一走协议定义的请求/响应格式;权限可以由 Server 层控制。这样工具更换、升级、扩增,都不需要改 Agent 主体代码。
视频创作场景刚好适合这套模型。视频链路里的素材库、搜索引擎、图像生成、视频生成、TTS、剪辑工具,本质是大量独立工具。用 MCP Server 包一层之后,多智能体的调度层只需要面对一套协议。接口能跑通,后面就可以把这一层接到自己的内容生产系统里。
2. 适用场景与使用边界
任何技术方案都要先画清楚边界。MCP + 多智能体视频创作流程也有一套明确的“适合”与“不适合”。
2.1 适合谁
最适合的是日更型内容生产团队。以前做一条 5 分钟口播视频,可能要经历“找选题、写稿、做分镜、找素材、录音、剪辑”十几个来回;把流程拆成多智能体后,每个 Agent 只负责一个环节,且通过 MCP 调用真实工具,进度和结果都可以追溯。
其次是工具链复杂的团队。团队里已经有素材管理数据库、知识库、内部设计系统,还有云端的图像生成和 TTS 服务;用 MCP Server 把已有系统暴露给 Agent,就不必为了接某个 Agent 去逐个写 Python SDK。Java 技术栈同样可以,社区已经有 MCP Java SDK,能在现有 Java 服务里暴露 MCP Server,让 Java 侧能力被 Agent 调用。
2.2 不适合什么
如果要的是电影级画面控制、复杂的非线性剪辑、精细音频混音,当前这套流程更适合做初稿和批量素材,不适合做最终精修。另一个不太合适的方向是“完全无人值守”,AI 视频生成仍然需要人工对成品做质量审核,尤其是人物一致性、口型、字幕切帧这些环节。
2.3 合规与安全边界
如果流程中涉及真人肖像、他人声音、受版权保护的图片/音乐/视频片段,必须提前取得合法授权。使用生成模型时,不要把未授权素材直接投入生成流程。企业内部使用时,还要注意提示词、脚本、素材数据是否包含敏感信息;MCP Server 暴露的接口应该做访问控制,不要默认监听公网。涉及用户数据和商业素材的批量任务,建议在测试环境验证清楚后再上线。
3. 架构设计:MCP 在多智能体视频创作中的角色
这一章是核心。理解清楚 MCP 的层次关系,后面写代码才不会乱。
3.1 整体架构
整个流程可以分成三层:
- 调度层:多智能体编排框架,负责把任务分给不同 Agent,记录每个环节状态。
- MCP 层:Agent 通过 MCP Client 连接各类 MCP Server,统一完成工具发现、调用和结果返回。
- 工具层:图像生成、视频生成、TTS、字幕、素材库、搜索等具体工具。
以一条口播视频为例,流程大致是:
编导 Agent -> 脚本 Agent -> 分镜 Agent -> 图像 Agent -> 视频 Agent -> 配音 Agent -> 字幕 Agent -> 质检 Agent每一环的输出会作为下一环的输入。每个 Agent 内部可以调用多个 MCP Server 工具,比如脚本 Agent 同时调用“搜索素材 MCP”和“知识库 MCP”,分镜 Agent 调用“图像生成 MCP”。
3.2 Agent 角色定义
| Agent | 职责 | 推荐 MCP Server |
|---|---|---|
| 编导 Agent | 确定主题、目标人群、视频结构 | 搜索引擎、内部选题库 |
| 脚本 Agent | 生成文案、优化语句 | 知识库、素材检索 |
| 分镜 Agent | 输出分镜文本和画面提示词 | 模板库、设计稿系统 |
| 图像 Agent | 生成封面、分镜画面 | 图像模型、素材库 |
| 视频 Agent | 图生视频、首尾帧 | 视频生成服务 |
| 配音 Agent | TTS 合成、音色选择 | TTS 服务 |
| 字幕 Agent | 字幕生成、对齐时间轴 | ASR/字幕服务 |
| 质检 Agent | 检查时长、字幕错别字、画面一致性 | 检查规则服务 |
3.3 为什么用 MCP,而不是直接写死 API
直接用代码调用各家 API 也能做多智能体流程,但当工具数量超过 10 个时,每个 Agent 都要维护一份工具接入代码,切换模型、替换供应商、增加新工具都很痛苦。MCP 把“工具接入”和“Agent 逻辑”解耦,Server 侧和 Client 侧只需要遵循同一个协议。
当前 MCP 生态已经覆盖了不少常用能力:浏览器自动化有 Playwright MCP,设计稿协作有 Figma MCP 和蓝湖相关 Server,数据库和内部系统可以自己封装,支付、办公协同等场景也有社区实现。放到视频创作里,这意味着很多工具不需要从零接入,直接用现成 Server 或改一版即可。
3.4 Agent Skill、MCP 和传统 API 的区别
Agent Skill 通常指模型侧或 Agent 侧封装的“技能”,比如“会写脚本”“会排分镜”;MCP 解决的是模型和外部工具之间的互操作协议。两者不冲突,Skill 内部也可以依赖 MCP 去调用真实工具。传统 API 接入则更原始,每个工具都要单独写适配。对应到工程上:Skill 定义 Agent 能干什么,MCP Server 定义外部系统如何被调用,调度层负责把两者按流程串起来。
4. 本地部署环境准备
开始动手前,先检查环境。由于最终用到的视频生成模型可能不同,这里给的是通用检查清单,避免走弯路。
4.1 系统与运行环境
- 操作系统:Windows 10/11、Linux(Ubuntu 22.04 或类似发行版)、macOS 均可。
- Python:建议 3.10 以上,后面的示例代码以 Python 为主。
- Node.js:如果要用现成 MCP Inspector 或 TypeScript SDK,建议 Node.js 18 以上。
- 包管理:pip、uv 或 poetry,任选一种。
- Git:用于拉取示例代码和开源工具。
4.2 模型与工具链
| 环节 | 可选工具 |
|---|---|
| LLM 生成脚本 | 通义千问、DeepSeek、Claude、GPT 等任意可调用的模型 |
| 图像生成 | ComfyUI、Stable Diffusion、即梦、可灵等 |
| 图生视频 | ComfyUI + 本地视频模型,或云端视频 API |
| TTS | 本地开源 TTS 或云端语音合成 |
| 字幕/ASR | Whisper、云端 ASR 服务 |
| 剪辑渲染 | FFmpeg、Remotion 等 |
不需要把所有环节都用同一套供应商。MCP 的价值正是“后端工具可以任意替换”。你需要确定的是每个环节通过什么方式暴露给 MCP Server,是本地进程、HTTP 服务,还是某个现成 Server。
4.3 磁盘与密钥准备
视频生成过程会产生大量中间文件。按一条 5 分钟 1080P 视频估算,素材、音频、字幕、成片加在一起可能超过 1GB,具体以实际码率为准。更稳妥的做法是提前规划目录:
videos/ inputs/ # 初始素材 scripts/ # 脚本与分镜 images/ # 生成的画面 audios/ # 配音 subtitles/ # 字幕文件 outputs/ # 成片 logs/ # 任务日志另外,多智能体流程会用到模型 API Key、图库 API Key、TTS 服务 Key。建议用环境变量或 .env 文件管理,不要硬编码到代码里,更不要提交到 Git 仓库。
5. MCP Server 编写与启动
5.1 安装 MCP Python SDK
pip install "mcp[cli]"安装完成后,可以执行下面的命令确认环境可用的工具链:
mcp --version如果mcp命令不可用,说明当前环境的安装路径未加入 PATH,或者 SDK 版本对 CLI 的封装有差异,以官方 README 说明为准。
5.2 编写一个素材检索 MCP Server
用 Python 写一个视频素材检索 Server,暴露两个工具:一个查询素材库,一个保存脚本草稿到文档系统。
from mcp.server.fastmcp import FastMCP mcp = FastMCP("video-material") @mcp.tool() def query_material_library(keyword: str, limit: int = 5) -> str: """根据关键词查询本地或云端素材库,返回素材清单。""" # 这里替换为真实素材库查询逻辑,例如数据库、对象存储、目录扫描 return f"keyword={keyword}, limit={limit}" @mcp.tool() def save