Open-Sora-Plan 入门实战:文生视频,3 步跑出你的第一条 AI 视频
【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan
Open-Sora-Plan 是一个复现 Sora 的开源文生视频项目。你输入一句英文描述,它输出一段对应的视频。这篇文章写给想试水视频生成、但不知道从哪下手的你。
🎬 Open-Sora-Plan 能做什么:3 个文生视频场景
它用文字当输入,生成完整的视频片段,覆盖文生视频和图片生视频两条路线。
一句话提示词生成视频
你写一段场景描述,它生成几秒的视频。你会看到镜头有运动、角色有动作,接近一段真实拍摄的画面。
静态图变成动态视频
给它一张图片当首帧,它能"让画面动起来"。你会看到静止的图变成一个会动的场景,适合给封面图加动态效果。
提示词文件批量生成
你把一堆提示词放进一个文本文件,它逐条各生成一条视频。你会看到一个文件夹里塞满成片,每条对应一行文字。
📋 动手之前:最简配置清单
先确认硬件和软件,具体依赖版本以 pyproject.toml 为准:
- 硬件:GPU 版本推荐多卡 H100;v1.5.0 完全基于昇腾 910(NPU)训练和推理
- 软件:Python 3.8+,PyTorch 2.1.0,其余依赖随包一起装
- 权重:各版本的模型文件单独下载,地址见仓库 README
然后拉代码并安装:
git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan && pip install -e .环境上遇到报错,先翻仓库 README 和 docs/ 下的版本报告,比看零散帖子更靠谱。
🏃 跑起来:生成你的第一条视频
下面走 v1.3.0 的 GPU 推理主线,v1.5.0 是 NPU 版,需切到对应分支。第一步,准备一个提示词文件,内容可以照抄 examples/sora.txt:
echo "a cat playing with a ball in a park, sunny day" > my_prompt.txt第二步,跑推理脚本。它参照 scripts/text_condition/gpu/sample_t2v_v1_3.sh,把 model_path 和 ae_path 换成你下载的位置即可:
torchrun --nproc_per_node 8 -m opensora.sample.sample \ --model_path model_path --version v1_3 \ --text_prompt my_prompt.txt \ --ae WFVAEModel_D8_4x8x8 --ae_path ae_path跑完后,--save_img_path 目录里会存下一个 mp4 文件。这是约 5 秒、93 帧、352×640 分辨率的视频。打开看,你提示词里的场景已经变成会动的画面了。
🚀 它凭什么快和好:两个核心技术点
第一个是 WFVAE,一个视频压缩模型。VAE 先把视频压成小数字(潜空间),后面的主模型只处理这些数字。WFVAE 用 8×8×8 的压缩率,把潜空间形状缩到一半。DiT 的训练成本随之下降,重建质量反而更高。它的 PSNR(分数越高重建越清晰)还超过了社区常用的 4×8×8 VAE:
| 模型 | 下采样率 | PSNR | LPIPS |
|---|---|---|---|
| CogVideoX | 4×8×8 | 36.38 | 0.0243 |
| Wan2.1 | 4×8×8 | 35.77 | 0.0197 |
| WF-VAE-M(本项目) | 8×8×8 | 36.91 | 0.0205 |
第二个是 SUV,一个稀疏 U 型 DiT。DiT 是用 Transformer 做视频生成的主网络。SUV 不改变特征的形状,只减少 token(视频里的一小块画面)之间的交互次数。在昇腾 910B 上,它比密集 DiT 推理快超过 35%,生成质量几乎不掉。
以上数据以项目最新文档为准。
💡 能拿它来干嘛:3 个可直接复制的场景
下面的提示词都可以直接粘贴使用。
给初二生物课做"光合作用"动态图解:
A 3D animated diagram of photosynthesis in a leaf, sunlight and water entering, oxygen releasing, clear labels, educational style给历史课重现古罗马市集:
An ancient Roman marketplace, busy traders, stone buildings, historical atmosphere, cinematic lighting给物理课做火山喷发模拟:
A volcano eruption simulation, lava flowing down the mountain, educational, detailed, realistic
生成后直接投屏讲,或者录进课件里,都比静态 PPT 有代入感。
⚖️ 横向对比:v1.5.0 和开源同行差多少
在 Vbench 基准上,8B 的 v1.5.0 追平了 13B 的 HunyuanVideo(开源版),语义和美学两项还更高:
| 模型 | 参数规模 | 总分 | 质量分 | 语义分 | 美学分 |
|---|---|---|---|---|---|
| CogVideoX-5B | 5B | 81.61% | 82.75% | 77.04% | 61.98% |
| HunyuanVideo(开源版) | 13B | 83.24% | 85.09% | 75.82% | 60.36% |
| Open-Sora-Plan v1.5.0 | 8B | 83.02% | 84.24% | 78.18% | 66.89% |
8B 的参数量,效果贴着 13B 走,语义分和美学分还是最高的。数据以项目最新文档为准。
🧭 接下来去哪
- docs/Report-v1.5.0.md:v1.5.0 完整技术报告
- docs/Contribution_Guidelines.md:贡献流程说明
- scripts/:训练和推理脚本合集
建议你先跑通 v1.3.0 的 GPU 版,有昇腾环境再上 v1.5.0。下一步动作:改一下 examples/sora.txt 里的一行字重新跑,看看视频怎么变。
【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考