SkyReels-V2 本地部署指南:4 步出片与显存要求
2026/9/20 3:23:27 网站建设 项目流程

SkyReels-V2 本地部署指南:4 步出片与显存要求

【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2

SkyReels-V2 是昆仑万维开源的无限长视频生成框架,基于 Diffusion Forcing(扩散强制,让模型逐段自回归续写画面)架构,覆盖文生视频、图生视频和长视频续写三类任务。本文面向准备在本地跑通 SkyReels-V2 本地部署的开发者,讲清显存要求、最小出片路径和最容易踩坑的参数设置。

能力边界:先确认它能不能干你的活

SkyReels-V2 提供三条推理链路:generate_video.py负责文生视频与图生视频,generate_video_df.py负责 Diffusion Forcing 长视频,并支持视频延长与首尾帧控制。单段输出规格为 540P(960×544,97 帧)或 720P(1280×720,121 帧),24fps 下约 4 秒;DF 模型可把总时长拉到 60 秒以上。目前 5B 系列与 Camera Director 权重尚未放出,5B 模型在 README 中标注 Coming Soon。图生视频走 I2V 专用模型,以单张首帧驱动;DF 模型本身则兼容文本与图像两种输入。

显存不够怎么跑:硬件档位对照表

官方 README 给出的实测峰值显存:1.3B 模型生成 540P 视频约 14.7GB;14B 模型在 T2V 链路约 43.4GB,DF 长视频链路约 51.2GB。据此划分三档:

设备档位推荐模型预期效果
16GB 显存1.3B-540P(DF / I2V)540P 短片、中等长度 DF 长视频,全程需加--offload
48GB 显存14B-540P / 14B-720P官方默认配置,540P 长视频或 720P 短片全规格输出
24GB 单卡 + 多卡14B 系列 +--use_uspxDiT USP 序列并行摊薄显存,生成速度提升

第一次出片:最小步骤

四步:拉仓库、装依赖、跑脚本、等出片。脚本内置download_model,首次运行会自动从 Hugging Face 拉取权重(国内网络慢时改用 ModelScope 下载到本地,把--model_id指向本地目录)。依赖测试环境为 Python 3.10,requirements.txt锁定了 torch 2.5.1 与 flash_attn:

# 1. 拉取仓库 git clone https://gitcode.com/GitHub_Trending/sk/SkyReels-V2 cd SkyReels-V2 # 2. 安装依赖(需 Python 3.10,含 torch/flash_attn) pip install -r requirements.txt

首次生成用 540P 短文本生成即可验证链路,download_model会自动拉权重:

# 单卡文生视频:97 帧约 4 秒 540P 短片,首次自动下载 14B-540P 权重 python3 generate_video.py \ --model_id Skywork/SkyReels-V2-T2V-14B-540P \ --resolution 540P \ --num_frames 97 \ --offload \ --prompt "A serene lake surrounded by towering mountains, swans gliding across the water."

成片输出到result/video_out/目录。图生视频改用 I2V 模型,追加--image 图片路径即可。

长视频走generate_video_df.py。DF 模型以自回归方式按块续写:每块以若干重叠历史帧为条件去噪,理论上可无限拼接。时长由--num_frames决定,官方推荐值与训练参数对齐——257 帧约 10 秒、737 帧约 30 秒、1457 帧约 60 秒。10 秒同步模式示例:

# 同步模式生成约 10 秒长视频,ar_step 0 表示整段同步去噪 python3 generate_video_df.py \ --model_id Skywork/SkyReels-V2-DF-1.3B-540P \ --resolution 540P \ --ar_step 0 \ --base_num_frames 97 \ --num_frames 257 \ --overlap_history 17 \ --addnoise_condition 20 \ --offload \ --prompt "A graceful white swan swimming in a serene lake at dawn."

最常改的三个参数

参数改什么影响什么建议值
--num_frames视频总帧数直接决定时长;帧数越高显存占用越大97 短片;257/377/737/1457 对应约 10s/15s/30s/60s
--base_num_framesDF 单次迭代送入模型的基础帧数控制显存峰值;调低会轻微损失画质540P 默认 97、720P 默认 121;显存吃紧时降到 77 或 57,不要更低
--addnoise_condition给干净条件帧加噪强度缓解长视频段间跳变与漂移,但过大会反向破坏一致性20;不建议超过 50

补充两条按任务切换的默认值:I2V 模型建议--guidance_scale 5.0 --shift 3.0(T2V 为 6.0 / 8.0);--teacache开启后可加速约 2–3 倍,代价是画质轻微下降,可配合--use_ret_steps--teacache_thresh 0.3使用。

常见问题处理

现象:CUDA out of memory。原因:14B 模型 540P 峰值约 43–51GB,超出单卡容量。处理:--offload把部分模块卸载到 CPU;DF 长视频降--base_num_frames;再不行换 1.3B 模型或多卡--use_usp

现象:pip install -r requirements.txt卡在 flash_attn 编译失败。原因:flash_attn 需匹配当前 torch 与 CUDA 版本现场编译,环境不匹配即失败。处理:确认 Python 3.10、torch 2.5.1 与显卡 CUDA 驱动版本配套,或改用与 2.5.1 预编译匹配的 flash_attn 轮子。

现象:模型权重下载缓慢甚至中断。原因:download_model默认走 Hugging Face。处理:通过 ModelScope 手动下载同名模型目录,将--model_id指向本地路径即可跳过自动下载(脚本检测到路径已存在时不会重复拉取)。

现象:加--prompt_enhancer报错或多卡启动失败。原因:提示增强器基于 Qwen2.5-32B-Instruct,峰值显存 64GB 以上,且明确禁止与--use_usp组合。处理:多卡场景先在skyreels_v2_infer/pipelines/prompt_enhancer.py单独生成增强文本,再手动填入--prompt

现象:断言错误check model_id。原因:任务与模型类型不匹配——未传--image时脚本强制要求 model_id 含 T2V,传图后则必须含 I2V。处理:核对--image与模型系列一致;需要"图 + 文本"双条件时用 DF 模型而非 T2V。

延伸入口

  • 提示增强独立脚本:skyreels_v2_infer/pipelines/prompt_enhancer.py
  • 三条推理流水线源码:skyreels_v2_infer/pipelines/
  • DiT 模型与注意力算子实现:skyreels_v2_infer/modules/
  • 流匹配噪声调度器:skyreels_v2_infer/scheduler/fm_solvers_unipc.py

跑通第一条 97 帧短片只是起点。把--num_frames往上加、按显存档位选对模型,这套框架的长视频能力才算真正用起来。

【免费下载链接】SkyReels-V2SkyReels-V2: Infinite-length Film Generative model项目地址: https://gitcode.com/GitHub_Trending/sk/SkyReels-V2

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询