LTX-Video 视频生成:8GB 显存起步,一条命令出片
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
本地生成一段 10 秒视频要等好几个小时、8GB 显卡直接爆显存,是最常见的两个卡点。LTX-Video 是 DiT 架构的开源视频生成模型,2B 蒸馏版在 8GB 显存就能跑,RTX 4060 上约 12 秒生成 300 帧 1216×704 视频。本文带走三个关键数字:8GB 显存起步、约 12 秒出一段 300 帧视频、蒸馏版采样步数从 30 步降到 10 步。阅读路线:选配置 → 预检 → 首跑 → 场景使用 → 算成本。
一、定档:选哪个配置
最低硬件线:8GB 显存的 NVIDIA 卡 + 16GB 内存 + 50GB SSD。13B 权重单文件约 15GB,磁盘要留得开。
| 配置(configs/ 下) | 权重 | 显存 | 采样步数 | 适合谁 |
|---|---|---|---|---|
| ltxv-2b-0.9.8-distilled | 5GB | 8GB | 10 步 | 8GB 卡、快速迭代 |
| ltxv-13b-0.9.8-distilled | 15GB | 16GB | 10 步 | 生产主力 |
| ltxv-13b-0.9.8-distilled-fp8 | 8GB | 16GB | 10 步 | 16GB 卡榨速 |
| ltxv-13b-0.9.8-dev | 15GB | 24GB | 30 步 | 追极限画质 |
蒸馏版免 CFG/STG、采样从 30 步降到 10 步,是"零改动提速"。多数人直接选ltxv-2b-0.9.8-distilled:8GB 卡就能跑、显存只吃 5GB 权重、出片快,代价是画质比 13B 略降,概念预览完全够。上生产再切ltxv-13b-0.9.8-distilled,画质上 3 档、显存涨到 16GB。dev 版质量最高但要 24GB 显存 + 30 步,不适合批量出片。
三条不推荐情况,提前知道能省折腾:
- GTX 10 系(Turing):fp8 配置跑不了,只能 bfloat16
- 纯 CPU / Mac MPS:能跑但不建议,无 offload 加速
- fp8 配置 + 未装 Q8-Kernels:加载权重时直接抛
Q8-Kernels not found
二、跑起来:30 秒自检 + 3 条命令出片
官方验证过的环境组合:Python 3.10.5、CUDA 12.2、PyTorch ≥ 2.1.2。
nvidia-smi python -c "import torch; print(torch.cuda.is_available(), torch.version.cuda)"第二条应输出True 12.2之类,说明 CUDA 可用且版本对得上。
git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video && python -m venv venv && source venv/bin/activate pip install -e .[inference]python inference.py \ --prompt "A vintage yellow car drives on a wet mountain road, camera following close behind" \ --height 704 --width 1216 \ --num_frames 121 \ --seed 171198 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml验收标准:outputs/<日期>/下出现video_output_*.mp4,且nvidia-smi显存没撞顶。首次运行自动从 HuggingFace 下载权重,2B 约 5GB,100Mbps 带宽下约 5 分钟;13B 约 15GB,约 30 分钟。
三、怎么用:4 种典型任务
四个场景共用同一个 inference 入口,区别只在传哪几个参数。
只给文字出视频
纯文本生成,不给条件媒体,适合概念预览、快速出想法。
python inference.py \ --prompt "A vintage yellow car drives on a wet mountain road, camera following close behind" \ --height 704 --width 1216 --num_frames 121 --seed 42 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml| 参数 | 推荐值 | 说明 |
|---|---|---|
| prompt | 200 词内 | 少于 120 词会触发自动扩写,多耗约 10 秒 |
| num_frames | 121 | 8n+1 规则,30fps 下约 4 秒 |
| seed | 171198 | 固定即可复现,默认 171198 |
⚠️ 坑点:文本编码器是 PixArt-XL-2(英文模型),中文提示词遵循度明显下降,报"画面和提示词对不上"时先用英文写。
静图加运动
一张产品图或人物照,指定锚定帧后生成运动,首帧忠于原图。
python inference.py \ --prompt "Slow zoom-in on the product, soft studio lighting" \ --conditioning_media_paths ./product.png \ --conditioning_start_frames 0 \ --conditioning_strengths 1.0 \ --image_cond_noise_scale 0.15 \ --height 704 --width 1216 --num_frames 121 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml| 参数 | 推荐值 | 说明 |
|---|---|---|
| conditioning_start_frames | 0 | 锚定帧号,首帧条件写 0 |
| conditioning_strengths | 0.8-1.0 | 越接近 1 越忠于原图 |
| image_cond_noise_scale | 0.15 | 给条件帧加噪,防画面僵死 |
⚠️ 坑点:conditioning_media_paths和conditioning_start_frames必须同时给且数量一致,否则infer直接抛ValueError。
片段前后续写
同一段素材接前接后,扩展方向靠conditioning_start_frames取值切换。
python inference.py \ --prompt "The car continues driving into the sunset" \ --conditioning_media_paths clip.mp4 \ --conditioning_start_frames 0 \ --num_frames 257 --seed 42 \ --pipeline_config configs/ltxv-13b-0.9.8-distilled.yaml| 方向 | 参数设法 |
|---|---|
| 向前续(从片尾接) | start_frames 写 0 |
| 向后补(给片头补) | start_frames = num_frames - 原片段帧数 |
⚠️ 坑点:条件视频帧数要满足 8n+1(9、17、25…),目标 num_frames 要是 8 的倍数,否则日志出现Trimming conditioning video警告,首尾被裁掉。
整段改风格
把整段素材喂给--input_media_path,按提示词改写风格,构图基本保留。
python inference.py \ --prompt "The same scene rendered in watercolor style" \ --input_media_path raw.mp4 \ --height 704 --width 1216 --num_frames 121 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml| 参数 | 推荐值 | 说明 |
|---|---|---|
| input_media_path | 本地 mp4 | 超出的帧自动截断到 num_frames |
| num_frames | 与源视频一致 | 显存紧张就调小 |
| height/width | 576×1024 起 | 8GB 卡别直接上 704×1216 |
⚠️ 坑点:v2v 显存占用和纯生成一样,8GB 卡先降到 576×1024 再跑,别直接上 704×1216。
四、算账:速度与成本
单卡 1216×704@30fps 实测档位如下,显存随分辨率近似线性,减半分辨率显存约省 60%。
| 硬件 | 配置 | 吞吐 | 10 秒(300 帧)耗时 |
|---|---|---|---|
| RTX 4060(8GB) | 2b-distilled | 约 25 FPS | 约 12 秒 |
| RTX 4090(24GB) | 13b-distilled | 约 35 FPS | 约 8.6 秒 |
| A100(80GB) | 13b-distilled | 约 35 FPS | 约 8.6 秒 |
月成本按租卡口径估算,三档心里有数即可:
| 规模 | 硬件 | 月成本量级 | 日吞吐(10 秒视频) |
|---|---|---|---|
| 个人 | RTX 4060×1 | 约 ¥300-500 | 约 500 段 |
| 小团队 | RTX 4090×2 | 约 ¥3000-5000 | 约 5000 段 |
| 企业 | A100×8 | 约 ¥30000-50000 | 约 50000 段 |
非实时负载走竞价实例能再降 60% 以上。单张 4090 开 3~5 路并发是 13b-distilled 的舒适区,再往上就要堆卡了。
五、跑挂了:报错速查
九成问题逃不开显存、下载、依赖三类,对照下表现场处置:
| 现象 | 原因 | 解法 |
|---|---|---|
| CUDA out of memory | 704×1216@121 帧太重 | 降到 576×1024、num_frames 改 81 |
| Q8-Kernels not found | fp8 配置没装内核 | 装 Q8-Kernels 或切 bfloat16 配置 |
| 权重缺失/大小不对 | 自动下载中断 | 核对checkpoint_path,13B 约 15GB |
| pip 依赖冲突、环境损坏 | transformers 超出 4.47-4.52 | 新 venv +pip install -e .[inference] --force-reinstall |
| 帧间抖动、动作跳变 | 时空引导模式不匹配 | 配置里stg_mode改attention_values |
| 细节模糊、色彩失真 | VAE 解码参数偏了 | decode_noise_scale调 0.02-0.03 |
| 提示词不遵循 | 文本编码器没下全/中文 | 核对text_encoder_model_name_or_path,改英文 |
两个高频误区:一是盲目追高分辨率,1216×704 是模型调优点,往 4K 硬推显存涨 4 倍而质量没等比回报,反例是先保帧率再谈分辨率;二是把offload_to_cpu当常规提速手段,它只在 30GB 以下显存才生效且生成时间 +20%,反例是只救急不提速。
六、参数字典
常改的参数、推荐范围与默认值,都在这张表里:
| 参数 | 推荐范围/默认 | 说明 |
|---|---|---|
| height / width | 704 × 1216 | 32 的倍数,不满足自动补边再裁回 |
| num_frames | 30-300 | 8n+1 规则,121 帧约 4 秒 @30fps |
| frame_rate | 30 | 输出帧率,默认 30,可选 24 |
| seed | 171198 | 默认 171198,固定即可复现 |
| guidance_scale(配置内) | 3.0-3.5 | 蒸馏配置为 1,免 CFG |
| num_inference_steps(配置内) | 20-40 | dev 配置 30 步,蒸馏 10 步 |
| stg_mode(配置内) | attention_values | 另 3 选:attention_skip / residual / transformer_block |
| decode_noise_scale(配置内) | 0.025 | 默认 0.025,影响解码色彩 |
| precision(配置内) | bfloat16 | fp8 需 Q8-Kernels |
| conditioning_strengths | 1.0 | 条件强度,0-1,默认 1.0 |
| image_cond_noise_scale | 0.15 | 默认 0.15,条件帧加噪防僵死 |
| offload_to_cpu | False | 30GB 以下显存才生效 |
先跑 2b-distilled 把流程走熟,上生产再切 13b-distilled、fp8 兜底,这条路线就是全部选型逻辑。
关键词:LTX-Video 部署、LTX-Video 视频生成、LTX-Video 显存优化、LTX-Video 图生视频、LTX-Video 蒸馏加速
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考