Open-Sora-Plan 入门实战:文生视频,3 步跑出你的第一条 AI 视频
2026/9/14 14:12:39 网站建设 项目流程

Open-Sora-Plan 入门实战:文生视频,3 步跑出你的第一条 AI 视频

【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan

Open-Sora-Plan 是一个复现 Sora 的开源文生视频项目。你输入一句英文描述,它输出一段对应的视频。这篇文章写给想试水视频生成、但不知道从哪下手的你。

🎬 Open-Sora-Plan 能做什么:3 个文生视频场景

它用文字当输入,生成完整的视频片段,覆盖文生视频和图片生视频两条路线。

一句话提示词生成视频

你写一段场景描述,它生成几秒的视频。你会看到镜头有运动、角色有动作,接近一段真实拍摄的画面。

静态图变成动态视频

给它一张图片当首帧,它能"让画面动起来"。你会看到静止的图变成一个会动的场景,适合给封面图加动态效果。

提示词文件批量生成

你把一堆提示词放进一个文本文件,它逐条各生成一条视频。你会看到一个文件夹里塞满成片,每条对应一行文字。

📋 动手之前:最简配置清单

先确认硬件和软件,具体依赖版本以 pyproject.toml 为准:

  • 硬件:GPU 版本推荐多卡 H100;v1.5.0 完全基于昇腾 910(NPU)训练和推理
  • 软件:Python 3.8+,PyTorch 2.1.0,其余依赖随包一起装
  • 权重:各版本的模型文件单独下载,地址见仓库 README

然后拉代码并安装:

git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan && pip install -e .

环境上遇到报错,先翻仓库 README 和 docs/ 下的版本报告,比看零散帖子更靠谱。

🏃 跑起来:生成你的第一条视频

下面走 v1.3.0 的 GPU 推理主线,v1.5.0 是 NPU 版,需切到对应分支。第一步,准备一个提示词文件,内容可以照抄 examples/sora.txt:

echo "a cat playing with a ball in a park, sunny day" > my_prompt.txt

第二步,跑推理脚本。它参照 scripts/text_condition/gpu/sample_t2v_v1_3.sh,把 model_path 和 ae_path 换成你下载的位置即可:

torchrun --nproc_per_node 8 -m opensora.sample.sample \ --model_path model_path --version v1_3 \ --text_prompt my_prompt.txt \ --ae WFVAEModel_D8_4x8x8 --ae_path ae_path

跑完后,--save_img_path 目录里会存下一个 mp4 文件。这是约 5 秒、93 帧、352×640 分辨率的视频。打开看,你提示词里的场景已经变成会动的画面了。

🚀 它凭什么快和好:两个核心技术点

第一个是 WFVAE,一个视频压缩模型。VAE 先把视频压成小数字(潜空间),后面的主模型只处理这些数字。WFVAE 用 8×8×8 的压缩率,把潜空间形状缩到一半。DiT 的训练成本随之下降,重建质量反而更高。它的 PSNR(分数越高重建越清晰)还超过了社区常用的 4×8×8 VAE:

模型下采样率PSNRLPIPS
CogVideoX4×8×836.380.0243
Wan2.14×8×835.770.0197
WF-VAE-M(本项目)8×8×836.910.0205

第二个是 SUV,一个稀疏 U 型 DiT。DiT 是用 Transformer 做视频生成的主网络。SUV 不改变特征的形状,只减少 token(视频里的一小块画面)之间的交互次数。在昇腾 910B 上,它比密集 DiT 推理快超过 35%,生成质量几乎不掉。

以上数据以项目最新文档为准。

💡 能拿它来干嘛:3 个可直接复制的场景

下面的提示词都可以直接粘贴使用。

  1. 给初二生物课做"光合作用"动态图解:A 3D animated diagram of photosynthesis in a leaf, sunlight and water entering, oxygen releasing, clear labels, educational style

  2. 给历史课重现古罗马市集:An ancient Roman marketplace, busy traders, stone buildings, historical atmosphere, cinematic lighting

  3. 给物理课做火山喷发模拟:A volcano eruption simulation, lava flowing down the mountain, educational, detailed, realistic

生成后直接投屏讲,或者录进课件里,都比静态 PPT 有代入感。

⚖️ 横向对比:v1.5.0 和开源同行差多少

在 Vbench 基准上,8B 的 v1.5.0 追平了 13B 的 HunyuanVideo(开源版),语义和美学两项还更高:

模型参数规模总分质量分语义分美学分
CogVideoX-5B5B81.61%82.75%77.04%61.98%
HunyuanVideo(开源版)13B83.24%85.09%75.82%60.36%
Open-Sora-Plan v1.5.08B83.02%84.24%78.18%66.89%

8B 的参数量,效果贴着 13B 走,语义分和美学分还是最高的。数据以项目最新文档为准。

🧭 接下来去哪

  • docs/Report-v1.5.0.md:v1.5.0 完整技术报告
  • docs/Contribution_Guidelines.md:贡献流程说明
  • scripts/:训练和推理脚本合集

建议你先跑通 v1.3.0 的 GPU 版,有昇腾环境再上 v1.5.0。下一步动作:改一下 examples/sora.txt 里的一行字重新跑,看看视频怎么变。

【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询