3分钟生成完整短视频:Pixelle-Video AI全自动生成实操笔记
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个 AI 短视频生成引擎:输入一个主题,它自动完成文案、配图、配音和视频合成,产出可播放的短视频文件。适合想批量产出短视频内容、又不想碰剪辑软件的人。最快跑通路径就三条:克隆仓库、配好 LLM 密钥和图像服务、在 Web 界面点生成。整个过程通常在 10 分钟内完成。
快速跑通:克隆、启动、配置两个密钥
环境只有一个硬要求:系统装好 ffmpeg(brew 或 apt 一条命令的事),Python 环境由 uv 接管,不用自己管版本。
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py跑完后浏览器自动打开 http://localhost:8501。首次运行大概率卡在装依赖上,uv 要下载全部依赖并安装,等它跑完即可,这不是报错。Windows 用户不用走这些步骤,下载官方整合包、解压、双击 start.bat,浏览器会自动打开。
首次运行前有两项必须配置,都在「系统配置」面板里:
- LLM 密钥:下拉选一个预设(通义千问、GPT、DeepSeek 都行),填入 API Key;不想花钱可以指向 Ollama 本地模型。
- 图像服务:本地有显卡就填 ComfyUI 地址(默认 127.0.0.1:8188),点「测试连接」确认通;没有显卡就填 RunningHub 的 API Key 走云端。
这两项配完就能生成,其余都是调优项。
生成流程:从主题到视频文件
输入内容前先选生成模式
左侧内容输入区有三种模式。「AI 生成内容」只填主题,LLM 负责写稿;「固定文案内容」直接粘贴现成文字,跳过 AI 写稿环节;BGM 同步在这里选,无、内置、或把 MP3 放进 bgm/ 目录自选。你可以这样调:主题较长或文案已经写好时,用固定文案模式,自己控制分镜切分;AI 生成模式会按它自己的粒度切,长主题容易切得不够细。
点生成后,四个步骤依次跑
右侧栏实时显示进度:生成文案、规划配图、逐分镜合成语音、视频合成。界面会显示「分镜 3/5 - 生成插图」这样的状态,能看出卡在哪一步。完成后自动播放视频预览,给出时长和分镜数,文件保存在 output/ 目录。5 分镜的视频一般 2~5 分钟,具体取决于图像模型速度。你可以这样调:赶时间就减少分镜数量,或换更快的图像工作流,这两个对耗时影响最大。
用模板和语音设置控制画面与声音
模板文件是 templates/ 目录下的 HTML+CSS,按命名分三类:static_ 是纯文字不生成媒体,image_ 用 AI 插图做背景,video_ 用 AI 动态视频做背景。下拉菜单按尺寸分组,1080x1920 竖屏、1920x1080 横屏、1080x1080 方形。中间栏的 TTS 工作流决定音色,上传 30 秒参考音频可做声音克隆,生成前能用「预览语音」试听。配图有两个调节点:工作流决定用哪个模型,提示词前缀(要写英文)决定整体风格,配「预览风格」按钮先试效果。你可以这样调:想让所有分镜的配图风格统一,把风格短语写进提示词前缀;模板拿不准就先点「预览模板」用自定义参数试,再决定用哪个。
两个场景:单条横屏视频与批量竖屏系列
如果你要做一条横屏解说视频
输入:主题「为什么要养成阅读习惯」,模板选 1920x1080 的 image_book.html,默认 Edge-TTS,BGM 用内置。预期输出:5~8 个分镜的横屏视频,2~5 分钟生成,落在 output/ 目录,浏览器里直接预览。调优建议:生成前先用「预览语音」试一句,音色不合适就换 TTS 工作流,这一步比生成后重跑便宜得多。
如果你想批量出一系列竖屏短视频
输入:内容输入区切到批量模式,每行一个主题,上限 100 个;模板选 1080x1920 竖屏,同时想发方形平台就换 1080x1080 模板。预期输出:每个主题一条独立视频,结果都进「历史记录」页面,可随时回看。两条注意:批量期间浏览器要开着;先拿 3~5 个主题的小批量验证风格,确认没问题再放大,避免整批返工。
避坑笔记:大概率会踩的坑
- 启动后长时间没反应、终端无输出 → uv 首次要在装大量依赖,不是卡死 → 等它跑完;确实卡死就清理 uv 缓存后重新 uv sync。
- LLM 调用直接报错 → 密钥或账户余额问题 → 先核对 Key 是否正确,再查账户余额,错误提示里通常会写明原因。
- 画面停在「生成插图」这一步 → 本地 ComfyUI 没起或工作流所需模型没下载 → 回配置面板点「测试连接」,并在 ComfyUI 里确认模型齐全。
- 语音预览正常、生成后却不对 → 所选 TTS 工作流不支持声音克隆,参考音频被忽略了 → 换成支持克隆的工作流,比如 Index-TTS。
- 关心成本 → 出图/出视频是大头,LLM 每条视频几分钱 → 全本地方案(Ollama + 本地 ComfyUI)零成本;云端方案通义千问 + RunningHub,一条视频几分到几元。
跑通之后的进阶入口
在 templates/ 里写自己的模板
现有画面不满意时可以自己写 HTML+CSS。文件放进 templates/,按 static_ / image_ / video_ 规范命名,就会出现在下拉菜单里。模板参数能控制文字位置、配色这些细节,适合做统一品牌风格。
用自己的工作流替换能力
界面里的图像、视频、TTS 工作流都是从 workflows/ 目录扫描出来的,来源有三类:selfhost 本地、runninghub 云端、api/ 开头的直连模型。哪一段不满意就换哪一段,不用动主流程代码。
把生成过程当 API 调用
仓库内置 FastAPI 服务,uv run python api/app.py 启动后,文案、配图、语音、视频合成都能程序化调用。想把它接进自己的内容生产系统时,走这条路。
如果你要做的是「主题 → 成片」这类批量产出,Pixelle-Video 能替掉中间大部分手工环节,你真正要做的只是选模板和验收。建议先用默认设置生成一条,再基于结果调语音和配图,等组合稳定后开批量模式出系列。
- 官方文档:docs/zh/user-guide/web-ui.md
- 核心源码:pixelle_video/services/
- 模板目录:templates/
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考