SkyReels-V2 本地部署指南:4 步出片与显存要求
【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2
SkyReels-V2 是昆仑万维开源的无限长视频生成框架,基于 Diffusion Forcing(扩散强制,让模型逐段自回归续写画面)架构,覆盖文生视频、图生视频和长视频续写三类任务。本文面向准备在本地跑通 SkyReels-V2 本地部署的开发者,讲清显存要求、最小出片路径和最容易踩坑的参数设置。
能力边界:先确认它能不能干你的活
SkyReels-V2 提供三条推理链路:generate_video.py负责文生视频与图生视频,generate_video_df.py负责 Diffusion Forcing 长视频,并支持视频延长与首尾帧控制。单段输出规格为 540P(960×544,97 帧)或 720P(1280×720,121 帧),24fps 下约 4 秒;DF 模型可把总时长拉到 60 秒以上。目前 5B 系列与 Camera Director 权重尚未放出,5B 模型在 README 中标注 Coming Soon。图生视频走 I2V 专用模型,以单张首帧驱动;DF 模型本身则兼容文本与图像两种输入。
显存不够怎么跑:硬件档位对照表
官方 README 给出的实测峰值显存:1.3B 模型生成 540P 视频约 14.7GB;14B 模型在 T2V 链路约 43.4GB,DF 长视频链路约 51.2GB。据此划分三档:
| 设备档位 | 推荐模型 | 预期效果 |
|---|---|---|
| 16GB 显存 | 1.3B-540P(DF / I2V) | 540P 短片、中等长度 DF 长视频,全程需加--offload |
| 48GB 显存 | 14B-540P / 14B-720P | 官方默认配置,540P 长视频或 720P 短片全规格输出 |
| 24GB 单卡 + 多卡 | 14B 系列 +--use_usp | xDiT USP 序列并行摊薄显存,生成速度提升 |
第一次出片:最小步骤
四步:拉仓库、装依赖、跑脚本、等出片。脚本内置download_model,首次运行会自动从 Hugging Face 拉取权重(国内网络慢时改用 ModelScope 下载到本地,把--model_id指向本地目录)。依赖测试环境为 Python 3.10,requirements.txt锁定了 torch 2.5.1 与 flash_attn:
# 1. 拉取仓库 git clone https://gitcode.com/GitHub_Trending/sk/SkyReels-V2 cd SkyReels-V2 # 2. 安装依赖(需 Python 3.10,含 torch/flash_attn) pip install -r requirements.txt首次生成用 540P 短文本生成即可验证链路,download_model会自动拉权重:
# 单卡文生视频:97 帧约 4 秒 540P 短片,首次自动下载 14B-540P 权重 python3 generate_video.py \ --model_id Skywork/SkyReels-V2-T2V-14B-540P \ --resolution 540P \ --num_frames 97 \ --offload \ --prompt "A serene lake surrounded by towering mountains, swans gliding across the water."成片输出到result/video_out/目录。图生视频改用 I2V 模型,追加--image 图片路径即可。
长视频走generate_video_df.py。DF 模型以自回归方式按块续写:每块以若干重叠历史帧为条件去噪,理论上可无限拼接。时长由--num_frames决定,官方推荐值与训练参数对齐——257 帧约 10 秒、737 帧约 30 秒、1457 帧约 60 秒。10 秒同步模式示例:
# 同步模式生成约 10 秒长视频,ar_step 0 表示整段同步去噪 python3 generate_video_df.py \ --model_id Skywork/SkyReels-V2-DF-1.3B-540P \ --resolution 540P \ --ar_step 0 \ --base_num_frames 97 \ --num_frames 257 \ --overlap_history 17 \ --addnoise_condition 20 \ --offload \ --prompt "A graceful white swan swimming in a serene lake at dawn."最常改的三个参数
| 参数 | 改什么 | 影响什么 | 建议值 |
|---|---|---|---|
--num_frames | 视频总帧数 | 直接决定时长;帧数越高显存占用越大 | 97 短片;257/377/737/1457 对应约 10s/15s/30s/60s |
--base_num_frames | DF 单次迭代送入模型的基础帧数 | 控制显存峰值;调低会轻微损失画质 | 540P 默认 97、720P 默认 121;显存吃紧时降到 77 或 57,不要更低 |
--addnoise_condition | 给干净条件帧加噪强度 | 缓解长视频段间跳变与漂移,但过大会反向破坏一致性 | 20;不建议超过 50 |
补充两条按任务切换的默认值:I2V 模型建议--guidance_scale 5.0 --shift 3.0(T2V 为 6.0 / 8.0);--teacache开启后可加速约 2–3 倍,代价是画质轻微下降,可配合--use_ret_steps与--teacache_thresh 0.3使用。
常见问题处理
现象:CUDA out of memory。原因:14B 模型 540P 峰值约 43–51GB,超出单卡容量。处理:加--offload把部分模块卸载到 CPU;DF 长视频降--base_num_frames;再不行换 1.3B 模型或多卡--use_usp。
现象:pip install -r requirements.txt卡在 flash_attn 编译失败。原因:flash_attn 需匹配当前 torch 与 CUDA 版本现场编译,环境不匹配即失败。处理:确认 Python 3.10、torch 2.5.1 与显卡 CUDA 驱动版本配套,或改用与 2.5.1 预编译匹配的 flash_attn 轮子。
现象:模型权重下载缓慢甚至中断。原因:download_model默认走 Hugging Face。处理:通过 ModelScope 手动下载同名模型目录,将--model_id指向本地路径即可跳过自动下载(脚本检测到路径已存在时不会重复拉取)。
现象:加--prompt_enhancer报错或多卡启动失败。原因:提示增强器基于 Qwen2.5-32B-Instruct,峰值显存 64GB 以上,且明确禁止与--use_usp组合。处理:多卡场景先在skyreels_v2_infer/pipelines/prompt_enhancer.py单独生成增强文本,再手动填入--prompt。
现象:断言错误check model_id。原因:任务与模型类型不匹配——未传--image时脚本强制要求 model_id 含 T2V,传图后则必须含 I2V。处理:核对--image与模型系列一致;需要"图 + 文本"双条件时用 DF 模型而非 T2V。
延伸入口
- 提示增强独立脚本:skyreels_v2_infer/pipelines/prompt_enhancer.py
- 三条推理流水线源码:skyreels_v2_infer/pipelines/
- DiT 模型与注意力算子实现:skyreels_v2_infer/modules/
- 流匹配噪声调度器:skyreels_v2_infer/scheduler/fm_solvers_unipc.py
跑通第一条 97 帧短片只是起点。把--num_frames往上加、按显存档位选对模型,这套框架的长视频能力才算真正用起来。
【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考