输入一个主题就能出片:Pixelle-Video 全自动短视频引擎上手指南
2026/9/8 21:07:34 网站建设 项目流程

输入一个主题就能出片:Pixelle-Video 全自动短视频引擎上手指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

你写完一串知识笔记,想剪成短视频发出去,却连剪辑软件都没打开过:文案不会写、配图不知道去哪找、配音不会录、字幕对不上口型。你看到"AI 全自动做视频"的说法,又不知道具体从哪入手、会不会卡在环境配置上。

Pixelle-Video 是一个开源的 AI 全自动短视频引擎:你输入一个主题,它自动生成解说文案、AI 配图和语音解说,再配上背景音乐合成完整视频。它替你省掉"写稿→找图→录配音→剪辑"整条流水线,没剪辑经验也能在几分钟内做出第一条能直接发的短视频。

书籍风格模板示例:AI 配图 + 自动排版文字 + 语音解说,最终合成的就是这样一个完整视频

它怎么工作:从主题到成片只分 4 步

整个流程可以压成一行:主题输入 → 文案生成 → 配图与配音 → 视频合成

第一步,大语言模型(LLM)根据你的主题写出完整解说词,并切成若干分镜,默认 5 个。第二步,每个分镜的文案会各生成一张 AI 配图,同时由 TTS 引擎读成语音。第三步,叠加背景音乐,用 FFmpeg 把图、音频、字幕合成视频,文件落在output/目录。

每一步你都可以在 Web 界面上看到实时进度(比如"分镜 3/5 - 生成插图")。文案、配图、语音、模板都是可替换的组件——换个模型、换个模板,结果就不同,但你不需要了解底层实现,全程在下拉菜单里选。

3 步跑起来:5 分钟拿到第一条视频

最小环境要求:Python 3.11+ 和包管理器uv(Windows 用户可以直接下官方一键整合包,不用装任何环境,双击start.bat即可)。

第 1 步,克隆并启动,浏览器会自动打开http://localhost:8501

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv run streamlit run web/app.py # uv 会自动装好全部依赖

第 2 步,配置 AI 服务(一次性)。展开「⚙️ 系统配置」:LLM 下拉选通义千问,粘贴你的 API Key;图像生成选 RunningHub 并填 Key(或填本地 ComfyUI 地址),点「保存配置」。

第 3 步,生成。左侧「内容输入」选 AI 生成内容,输入主题,比如"为什么要养成阅读习惯";TTS 保持默认 Edge-TTS;模板保持默认竖屏;点「🎬 生成视频」。

你会看到什么:进度条依次走过文案、配图、语音、合成四步,5 个分镜大约 2-5 分钟。完成后右侧自动播放成片,并显示时长、文件大小和分镜数——这是一条带配音、带配图、可直接上传抖音或 B 站的竖屏短视频,而不是几张散图。

值得知道的 4 个能力

固定脚本模式:不想让 AI 写稿?直接粘贴你的现成文案,选段落、行或句子三种分割方式,跳过文案生成直接出片。适合已有成熟稿子、只缺画面和配音的人。

自定义素材:上传自己的照片或视频,系统会先分析素材内容再生成匹配的脚本。适合手里有实拍素材、想"素材说话"而不想纯靠 AI 配图的人。

声音克隆:给支持克隆的工作流(如 Index-TTS)传一段参考音频,成片就用这个音色朗读。适合做个人 IP、想保持账号声音统一的创作者。

模板库:竖屏 1080x1920 有 20 多个模板,横屏 1920x1080 也有 5 个,命名即用途——static_*纯文字、image_*用 AI 配图、video_*用 AI 视频做动态背景。模板源码在 templates/,会 HTML 就能加自己的。

电影风格横屏模板:黑底居中画面 + 标题排版,适合影视解说、B 站横屏内容

LLM 和图像生成怎么选:一张表给新手

你的情况LLM 选图像/视频选说明
有 NVIDIA 显卡(约 6GB+ 显存)Ollama 本地本地 ComfyUI全链路 0 API 费用
无显卡、想低成本(新手默认推荐通义千问RunningHub 云端千问按量计费很低,RunningHub 无需本地部署
完全不想碰 ComfyUI任意云端 LLM直连 API 模型DashScope、Seedream、Seedance、Kling 等,在系统配置里填 Key 即可

三个默认值记住就行:LLM 用通义千问、TTS 用 Edge-TTS、模板用默认竖屏。详细的预设模型列表见 pixelle_video/llm_presets.py,工作流 JSON 在 workflows/。

适合谁,不适合谁

适合:要批量产竖屏口播类内容(知识科普、影视解说、产品介绍)的人;有现成文案、只缺配图和配音的人;想零剪辑经验起步、用 AI 模型成本换人工时间的账号主。

不适合:要求完全离线且机器没显卡的人——本地 ComfyUI 路线需要一块 NVIDIA 显卡,纯云端路线则有 API 费用;也不适合需要逐帧精剪、加复杂转场特效的场景,它是"生成"不是"剪辑",不满意的手段是换参数重新生成。项目边界和使用细节可看 官方 FAQ。

常见问题

一个视频要生成多久?5 个分镜约 2-5 分钟,取决于 LLM 和图像 API 的响应速度,进度条会实时显示当前卡在哪一步。

必须花钱吗?软件本身开源免费(Apache 2.0)。Ollama + 本地 ComfyUI 可以零 API 费用跑通全流程,但需要显卡;走云端服务则按各家的量计费。

不装 ComfyUI 能出片吗?能。可以直连 DashScope、OpenAI、Kling 等 API 模型,也可以选static_*纯文字模板,完全不生成媒体。

背景用自己的音乐行吗?行,把 MP3/WAV 放进bgm/文件夹就能选,界面上还有内置曲库可以试听。

输出尺寸有哪些?竖屏 1080x1920、横屏 1920x1080,另有 1080x1080 方形模板,对应抖音、B 站、小红书等平台。


下一步动作:克隆仓库后按上面的 3 步启动,LLM 选通义千问,输入"为什么要养成阅读习惯",5 分钟后你会在output/里看到自己的第一条视频。安装和配置细节参考安装说明与快速上手。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询