Open-Sora 完整教程:三步做出你的第一个文字生成视频
【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora
Open-Sora 是一个开源的 AI 视频生成项目,支持文字转视频、图片转视频、文字转图片三种模式,画幅比例与分辨率可以随意组合。它是一套完整的文字生成视频开源工具:代码、模型权重和训练流程全部开放。最新的 2.0 版本参数规模 11B,官方报告称整套训练成本约 20 万美元。
一个能完全读懂的视频模型
这个项目的核心价值在于“全开源”。不仅推理代码和权重公开,数据预处理、训练、评测的整条管线也都在仓库里。1.1 版本就支持 2 到 15 秒、144p 到 720p 以及任意画幅比例的生成,2.0 版本改用 DiT 架构后,VBench 与人工偏好评测的得分已接近多款商用模型。使用上有两条路线:直接在命令行里跑推理,或者启动 Gradio 网页界面边试边调。
🚀 从零跑起来:安装与权重下载
装代码和依赖
门槛不高:Python 3.10、PyTorch 2.4.0 以上,外加一块 GPU(官方的资源占用数据是在 H100 上测的)。先克隆仓库再安装:
git clone https://gitcode.com/GitHub_Trending/op/Open-Sora cd Open-Sora pip install -v .装完后建议再补上与 CUDA 版本匹配的 xformers、flash-attn 两个加速组件。不装也能推理,只是速度会慢一截。
下载模型权重
11B 权重支持 256px 与 768px 两档分辨率,同一个模型同时负责文字转视频和图片转视频。装好 huggingface-cli 后,指定 hpcai-tech/Open-Sora-v2 一行命令即可把权重拉到本地 ckpts 目录,国内网络也可以走 ModelScope 镜像。
🎥 两条主生成路径:文字驱动还是图片驱动
文字转视频管线
推荐走“文字→图片→视频”的路线:先用 Flux 模型把简短提示词画成静帧,再让静帧动起来。这条管线使用 configs/diffusion/inference/t2i2v_256px.py 这份配置(768px 则换成 t2i2v_768px.py),命令长这样:
torchrun --nproc_per_node 1 --standalone scripts/diffusion/inference.py \ configs/diffusion/inference/t2i2v_256px.py \ --save-dir samples --prompt "raining, sea"显存紧张时加上 --offload True,把中间结果挪到内存里,能省不少显存。
图片转视频:让静帧动起来
手里有参考图的话,切到 i2v 模式,用 --cond_type i2v_head --ref 把图片传进去,仓库自带的 assets/texts/i2v.png 就是 README 演示用的那张图。想批量出片也不麻烦:把每条提示词和对应图片路径写进 csv,脚本会逐条处理。
🎛️ 关键参数与 Gradio 界面
帧数、画幅与多卡
帧数有两条规矩:必须是 4k+1 的数,且小于 129,比如 49、65、97 帧;画幅可选 16:9、9:16、1:1、2.39:1,用 --aspect_ratio 指定。768px 上跑多卡时不用自己写并行逻辑,脚本里内置了 ColossalAI 序列并行,把 --nproc_per_node 调大就行。
运动、美学与镜头语言
--motion-score 指定运动分值(默认 4,越大动得越厉害),设为 dynamic 会由模型自动评估后适配,需要 OpenAI 密钥。更细的控制交给 Gradio 界面:运动强度分 7 档、美学评分 7 级、平移/推拉/静止共 8 种镜头运动,还能勾选让 GPT4o 改写提示词。运行python gradio/app.py打开页面,填提示词、选画幅和长度即可生成。
先试再调
同一条提示词换种子就是不同结果。想复现某条片子,把 --sampling_option.seed 和 --seed 固定成同一个值;用 --num-sample 可以一次出多条候选,挑中意的再细调参数。
📖 训练与深入阅读
微调与从头训
想训自己的模型,按仓库给的流程走:先训视频 VAE,再做两阶段扩散训练,训练指南 里有逐步说明和配置示例。
架构与 VAE
VAE 的设计思路可以看 AutoEncoder 说明;更新的高压缩率视频 VAE 记录在 docs/hcae.md,它把潜空间开销压得很低,是 11B 模型能以 20 万美元成本训出来的关键部件之一。
克隆仓库、装好依赖、下载权重就能开跑;想再深一层,打开训练指南,试试微调出属于你自己的权重。
【免费下载链接】Open-SoraOpen-Sora: Democratizing Efficient Video Production for All项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考