输入一个主题就能出片:Pixelle-Video 全自动短视频引擎上手指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你写完一串知识笔记,想剪成短视频发出去,却连剪辑软件都没打开过:文案不会写、配图不知道去哪找、配音不会录、字幕对不上口型。你看到"AI 全自动做视频"的说法,又不知道具体从哪入手、会不会卡在环境配置上。
Pixelle-Video 是一个开源的 AI 全自动短视频引擎:你输入一个主题,它自动生成解说文案、AI 配图和语音解说,再配上背景音乐合成完整视频。它替你省掉"写稿→找图→录配音→剪辑"整条流水线,没剪辑经验也能在几分钟内做出第一条能直接发的短视频。
书籍风格模板示例:AI 配图 + 自动排版文字 + 语音解说,最终合成的就是这样一个完整视频
它怎么工作:从主题到成片只分 4 步
整个流程可以压成一行:主题输入 → 文案生成 → 配图与配音 → 视频合成。
第一步,大语言模型(LLM)根据你的主题写出完整解说词,并切成若干分镜,默认 5 个。第二步,每个分镜的文案会各生成一张 AI 配图,同时由 TTS 引擎读成语音。第三步,叠加背景音乐,用 FFmpeg 把图、音频、字幕合成视频,文件落在output/目录。
每一步你都可以在 Web 界面上看到实时进度(比如"分镜 3/5 - 生成插图")。文案、配图、语音、模板都是可替换的组件——换个模型、换个模板,结果就不同,但你不需要了解底层实现,全程在下拉菜单里选。
3 步跑起来:5 分钟拿到第一条视频
最小环境要求:Python 3.11+ 和包管理器uv(Windows 用户可以直接下官方一键整合包,不用装任何环境,双击start.bat即可)。
第 1 步,克隆并启动,浏览器会自动打开http://localhost:8501:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv run streamlit run web/app.py # uv 会自动装好全部依赖第 2 步,配置 AI 服务(一次性)。展开「⚙️ 系统配置」:LLM 下拉选通义千问,粘贴你的 API Key;图像生成选 RunningHub 并填 Key(或填本地 ComfyUI 地址),点「保存配置」。
第 3 步,生成。左侧「内容输入」选 AI 生成内容,输入主题,比如"为什么要养成阅读习惯";TTS 保持默认 Edge-TTS;模板保持默认竖屏;点「🎬 生成视频」。
你会看到什么:进度条依次走过文案、配图、语音、合成四步,5 个分镜大约 2-5 分钟。完成后右侧自动播放成片,并显示时长、文件大小和分镜数——这是一条带配音、带配图、可直接上传抖音或 B 站的竖屏短视频,而不是几张散图。
值得知道的 4 个能力
固定脚本模式:不想让 AI 写稿?直接粘贴你的现成文案,选段落、行或句子三种分割方式,跳过文案生成直接出片。适合已有成熟稿子、只缺画面和配音的人。
自定义素材:上传自己的照片或视频,系统会先分析素材内容再生成匹配的脚本。适合手里有实拍素材、想"素材说话"而不想纯靠 AI 配图的人。
声音克隆:给支持克隆的工作流(如 Index-TTS)传一段参考音频,成片就用这个音色朗读。适合做个人 IP、想保持账号声音统一的创作者。
模板库:竖屏 1080x1920 有 20 多个模板,横屏 1920x1080 也有 5 个,命名即用途——static_*纯文字、image_*用 AI 配图、video_*用 AI 视频做动态背景。模板源码在 templates/,会 HTML 就能加自己的。
电影风格横屏模板:黑底居中画面 + 标题排版,适合影视解说、B 站横屏内容
LLM 和图像生成怎么选:一张表给新手
| 你的情况 | LLM 选 | 图像/视频选 | 说明 |
|---|---|---|---|
| 有 NVIDIA 显卡(约 6GB+ 显存) | Ollama 本地 | 本地 ComfyUI | 全链路 0 API 费用 |
| 无显卡、想低成本(新手默认推荐) | 通义千问 | RunningHub 云端 | 千问按量计费很低,RunningHub 无需本地部署 |
| 完全不想碰 ComfyUI | 任意云端 LLM | 直连 API 模型 | DashScope、Seedream、Seedance、Kling 等,在系统配置里填 Key 即可 |
三个默认值记住就行:LLM 用通义千问、TTS 用 Edge-TTS、模板用默认竖屏。详细的预设模型列表见 pixelle_video/llm_presets.py,工作流 JSON 在 workflows/。
适合谁,不适合谁
适合:要批量产竖屏口播类内容(知识科普、影视解说、产品介绍)的人;有现成文案、只缺配图和配音的人;想零剪辑经验起步、用 AI 模型成本换人工时间的账号主。
不适合:要求完全离线且机器没显卡的人——本地 ComfyUI 路线需要一块 NVIDIA 显卡,纯云端路线则有 API 费用;也不适合需要逐帧精剪、加复杂转场特效的场景,它是"生成"不是"剪辑",不满意的手段是换参数重新生成。项目边界和使用细节可看 官方 FAQ。
常见问题
一个视频要生成多久?5 个分镜约 2-5 分钟,取决于 LLM 和图像 API 的响应速度,进度条会实时显示当前卡在哪一步。
必须花钱吗?软件本身开源免费(Apache 2.0)。Ollama + 本地 ComfyUI 可以零 API 费用跑通全流程,但需要显卡;走云端服务则按各家的量计费。
不装 ComfyUI 能出片吗?能。可以直连 DashScope、OpenAI、Kling 等 API 模型,也可以选static_*纯文字模板,完全不生成媒体。
背景用自己的音乐行吗?行,把 MP3/WAV 放进bgm/文件夹就能选,界面上还有内置曲库可以试听。
输出尺寸有哪些?竖屏 1080x1920、横屏 1920x1080,另有 1080x1080 方形模板,对应抖音、B 站、小红书等平台。
下一步动作:克隆仓库后按上面的 3 步启动,LLM 选通义千问,输入"为什么要养成阅读习惯",5 分钟后你会在output/里看到自己的第一条视频。安装和配置细节参考安装说明与快速上手。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考