Pixelle-Video 完整指南:一句话主题到完整短视频只要5分钟,无需剪辑
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一款开源的 AI 全自动短视频引擎:你敲下一行主题,文案、AI 配图、配音、BGM 到最终成片全部自动产出。它解决的是普通创作者"不会剪辑、没整块时间做内容"的问题——输入主题,几分钟后拿到可直接发布的 MP4。
先算笔账:一条 60 秒的短视频,传统做法要烧掉多少工时
假设你运营一个职场效率类知识账号,每周要更新 5 条干货。按传统流程:写 5 篇口播稿、逐条找配图或做插图、录配音、再进剪辑软件对齐字幕节奏——单条 60 秒的成片,熟练也要 3 到 4 小时,一周的量要吃掉两个工作日。外包则更直接,图文加剪辑每条少则几十元。
Pixelle-Video 把这条链路压成"输入主题—等出片":不写稿、不找图、不录音、不剪片,五天的更新量可以压到一晚上。下面先看怎么拿到第一条成片,再拆开它内部到底干了什么。
拿到第一条成片:最快路径只有 3 步
最短路径是跳过一切本地环境配置。
- Windows:下载官方整合包,解压后双击
start.bat,浏览器自动打开http://localhost:8501的管理页面。 - macOS / Linux:确认已装好
uv和ffmpeg,然后在终端执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv sync && uv run streamlit run web/app.py- 页面加载后,展开「⚙️ 系统配置」,选一个 LLM 预设(通义千问、GPT-4o、DeepSeek 或本地 Ollama,选中后地址自动填好),把 API Key 填进去,保存。
接下来在「📝 内容输入」里写一个主题,比如"为什么建议每天午休散步十分钟",挑一个画面模板,点「🎬 生成视频」。右侧进度条会依次跑完写文案、生成配图、合成配音、拼接视频四个环节,2 到 5 分钟后,一支带旁白和 BGM 的 1080x1920 竖屏视频出现在预览区,文件落在output/目录。全程唯一的必备输入是一句主题,唯一的必备配置是一个密钥。
点击"生成视频"之后:数据在流水线里跑了哪四段
成片出现后,它其实替你跑完了一场四棒接力。
第一棒:LLM 写稿并切分镜。主题送进你配置的大模型,产出一整篇完整解说词,并自动切成若干分镜——60 秒左右的内容通常切成 5 个镜头左右。这一步的产出是一份纯文本。
第二棒:逐分镜生成画面。每个分镜调用一次图像生成:本地 ComfyUI 走 FLUX 工作流,无显卡就走 RunningHub 云端,也可以直连 DashScope、OpenAI、可灵等厂商 API(对应配置项都在 config.example.yaml 里能看到)。若你选了video_*.html这类模板,这一步会换成 WAN 2.1 等视频模型,背景画面是真正会动的。
第三棒:TTS 把稿子念出来。Edge-TTS 零配置即用;想用自己的声音就选 Index-TTS,上传一段参考音频做音色克隆。BGM 同步在这一步混入——选内置曲目,或把自己放在bgm/文件夹里的 MP3 用起来。
第四棒:模板渲染加最终合成。系统按你选中的 HTML 模板逐帧渲染分镜(文字、插图、版式都由模板样式表决定),再用 ffmpeg 把帧序列、旁白、BGM 拼成一只 MP4。
每一棒都可以介入:分镜文案不满意可以切换"固定文案内容"模式,直接粘贴自己的成稿,跳过第一棒。
实战走一遍:职场效率账号的一周更新,批量出片
用开头那个账号走一遍。本周 5 个选题,每行一条写进输入框:
- 5 个每天省下 30 分钟的 Excel 快捷键
- 两分钟法则:小任务为什么必须当场做
- 你的站会为什么总是超时
- 一份没人反感的周报模板
- 为什么你休完假还是更累了
模板选横屏 1920x1080 的image_film.html(适合 B 站与视频号横屏位),打开批量模式,系统逐条排队产出,每条 3 到 5 分钟,5 条总计半小时出头。批量开跑前建议先生成 1 条试跑,预览节奏与画风再放行剩下的——避免把 5 次图像调用的额度花在同一种不满意的效果上。
让成片质感上一个台阶的 4 个小改法
批量跑起来后你会发现,成片之间的差距不在工具,而在几处小配置:
- 统一配图画风:在图像配置的
prompt_prefix里写一句英文风格约束,例如 "Minimalist black-and-white matchstick figure style illustration, clean lines"。效果:同一条视频的 5 张分镜图出自同一套画风,不再"上一帧油画、下一帧 3D 渲染"。 - 固定文案按句子切分:使用自己的成稿时,分割方式选"句子"而不是"段落"。效果:一句话配一张图,镜头切换更密,节奏更抓人。
- 一段音频克隆专属音色:给 Index-TTS 上传 10 秒以上的清晰人声。效果:系列视频统一用你的声音,账号有了辨识度,也不用每次手动重录旁白。
- 整机切零成本方案:LLM 指到本地 Ollama、图像生成走 workflows/selfhost/ 里的本地 ComfyUI 工作流、TTS 用 Edge-TTS。效果:API 费用归零、数据不出本机——前提是有一张 NVIDIA 显卡。
选模板别凭文件名猜,模板效果一览 把每个模板的成片样式都摆出来了,所见即所得;真要改文字颜色或版式,模板就是 templates/ 里的普通 HTML 文件,直接改样式表即可。
上手前最常被问到的 4 个疑虑
没有显卡能跑吗?能。图像与视频生成可切到 RunningHub 云端或直连 DashScope、OpenAI、可灵等 API,按调用量付费;文案走大模型 API、配音走云端 TTS,普通笔记本就能跑。只有完全本地化那一档才要求显卡。
一条视频通常要等多久?5 个分镜、1080x1920 竖屏大约 2 到 5 分钟,取决于大模型响应速度和图像生成的排队情况;批量任务逐条排队,5 条合计半小时左右。
我的数据和成片会被传走吗?视频与全部中间文件都存在本机output/。调用云端 API 时只发送生成所需的那段文本;选完全本地方案则数据完全不出机器。
能商用吗?项目采用 Apache License 2.0 开源,可自由使用、修改和二次开发,适合个人创作者与中小团队搭自己的内容生产线。
下一步:今晚就产出第一条
把今晚留 5 分钟:装上(或解压整合包)、填一个密钥、输入你酝酿已久的那个选题。计时结束前,第一条成片应该已经躺在output/里了。剩下要做的只有一件事——换个主题,再点一次生成。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考