快速上手LingBot-VA:10分钟部署机器人视频-动作世界模型,18GB显存即可跑通推理
【免费下载链接】lingbot-va[RSS 2026] Causal video-action world model for generalist robot control项目地址: https://gitcode.com/gh_mirrors/li/lingbot-va
LingBot-VA 是一个面向通用机器人控制的因果视频-动作世界模型(Causal Video-Action World Model),它能同时预测未来视频帧并生成机器人动作指令。本文是一份面向新手的完整部署指南:只需 18GB 显存的单卡 GPU,约 10 分钟即可完成环境配置,并跑通图像到视频-动作(I2VA)生成推理。
🤖 LingBot-VA 是什么:一个模型同时"看懂世界"与"生成动作"
与传统的"VLA 策略模型"不同,LingBot-VA 采用自回归(AR)扩散框架,把"世界建模"与"动作推理"统一在同一条交错序列中,核心亮点有 3 个:
- 统一的视频-动作建模:视觉动态预测与动作生成在架构层面统一,但概念上保持区分;
- 高效执行:双流 Mixture-of-Transformers(MoT)架构 + 异步执行 + KV Cache,推理速度快;
- 长时序与泛化能力:在长程任务成功率和新场景泛化上有显著提升。
实测性能同样亮眼:在RoboTwin 2.0(50 个任务平均)上 Easy / Hard 成功率分别达到92.9% / 91.6%,成为首个突破 90% 门槛的方法;在LIBERO基准上平均分达到98.5,均超过 π₀.5、X-VLA 等强基线。
📦 第一步:环境准备与模型下载(约 5 分钟)
硬件与软件要求
| 项目 | 要求 | 说明 |
|---|---|---|
| GPU 显存 | 18GB+ | I2VA 推理约 18GB(开启 offload);RoboTwin 评测约 24GB |
| Python | 3.10.16 | 版本需严格一致 |
| PyTorch | 2.9.0 | 搭配 CUDA 12.6 |
| 依赖安装 | pip + flash-attn | 完整清单见 requirements.txt |
克隆仓库并安装依赖
git clone https://gitcode.com/gh_mirrors/li/lingbot-va cd lingbot-va pip install torch==2.9.0 torchvision==0.24.0 torchaudio==2.9.0 --index-url https://download.pytorch.org/whl/cu126 pip install websockets einops diffusers==0.36.0 transformers==4.55.2 accelerate msgpack opencv-python matplotlib ftfy easydict pip install flash-attn --no-build-isolation💡 如果
flash-attn因 PEP 517 构建问题失败,参考 INSTALL.md 中的 No-Build-Isolation 方案重试即可。
下载预训练模型
模型托管在 HuggingFace 与 ModelScope 的robbyant组织下,按需选择其一即可:
| 模型名称 | 适用场景 |
|---|---|
lingbot-va-base | 共享骨干基础模型(后训练起点) |
lingbot-va-posttrain-robotwin | RoboTwin 平台后训练权重,仿真评测推荐 |
lingbot-va-posttrain-libero-long | LIBERO-Long 后训练权重 |
下载后,把 wan_va/configs/va_robotwin_cfg.py 中的wan22_pretrained_model_name_or_path从/path/to/pretrained/model修改为你的实际模型目录。
⚠️ 关键配置:attn_mode 与显存优化(新手必看)
这是最容易踩坑的一步,配置错了会直接报错。
1. 设置attn_mode(训练/推理必须不同)
LingBot-VA 通过from_pretrained加载,注意力模式读取自模型目录下的transformer/config.json,需要手动编辑:
| 使用模式 | attn_mode取值 |
|---|---|
| 训练 | "flex"(仅训练可用) |
| 推理 / 评测 | "torch"或"flashattn"(用"flex"会报错) |
2. 18GB 显存跑通的秘密:开启 offload
服务器端会把 VAE 和文本编码器卸载到 CPU 以节省显存,相关逻辑在 wan_va/wan_va_server.py 中。默认配置 wan_va/configs/shared_config.py 中enable_offload = False,低显存用户请改为True:
va_shared_cfg.enable_offload = True开启后,单卡 18GB 显存即可跑通图像到视频-动作的推理。
🚀 10 分钟跑通:图像到视频-动作生成推理
不想搭仿真环境?先从 I2VA 模式入手:给定机器人初始图像 + 一段文字指令,模型直接生成未来的视频帧 + 动作序列。示例输入图像在 example/robotwin/ 目录(含顶部视角与左右腕部摄像头图像),任务提示为"拿起白色马克杯,旋转后挂到深灰色架子上"。
NGPU=1 CONFIG_NAME='robotwin_i2av' bash script/run_launch_va_server_sync.sh运行逻辑由 script/run_launch_va_server_sync.sh 启动分布式进程,配置项(输入图像路径、推理 chunk 数、提示词)定义在 wan_va/configs/va_robotwin_i2va.py。生成完成后,结果视频会保存到visualization/demo.mp4——你会看到模型"预演"出机器人未来动作的画面,这就是世界模型的直观体现。
🧪 进阶:RoboTwin 与 LIBERO 仿真评测
LingBot-VA 采用Server-Client 架构:模型服务(Server)与仿真环境(Client)通过 WebSocket 通信,依赖相互隔离,也支持多卡分布式推理。
RoboTwin-2.0 评测(约 24GB 显存)
先按 RoboTwin 官方文档装好仿真环境(Vulkan 依赖 + 克隆 RoboTwin 仓库),然后:
# 终端 1:启动推理服务器 bash evaluation/robotwin/launch_server.sh # 终端 2:运行评测客户端(以 adjust_bottle 任务为例) task_name="adjust_bottle" bash evaluation/robotwin/launch_client.sh results/ ${task_name}服务器入口见 evaluation/robotwin/launch_server.sh,客户端参数(引导系数、测试轮数等)见 evaluation/robotwin/launch_client.sh。多卡评测可使用对应的launch_server_multigpus.sh/launch_client_multigpus.sh,结果保存在results/目录。
⚠️ 推理服务器与客户端必须在同一台机器上运行。
LIBERO 评测
装好 LIBERO 仿真环境后,两条命令即可:
# 服务器 bash evaluation/libero/launch_server.sh # 客户端 bash evaluation/libero/launch_client.shLIBERO 使用 128×128 的双视角观测(agentview + 眼在手),配置在 wan_va/configs/va_libero_cfg.py,示例图像见 example/libero/。
🎓 可选:用你自己的机器人数据后训练
如果你有自采的机器人操作数据,LingBot-VA 支持基于FSDP 分布式训练的后训练,数据对接LeRobot 格式:
- 原始数据 → 转换为 LeRobot 格式(含
meta/episodes.jsonl中的action_config动作分段与文字描述); - 用 Wan2.2 VAE 提取视频隐变量,输出到
latents/目录; - 动作统一映射为30 维标准格式(左右臂末端 7 维 ×2 + 关节 7 维 ×2 + 夹爪 1 维 ×2,缺失维度补 0)。
训练一条命令启动:
NGPU=8 CONFIG_NAME='robotwin_train' bash script/run_va_posttrain.sh数据准备细节与字段规范可参考 README.md 的 Post-Training 章节,训练入口在 wan_va/train.py。
❓ 常见问题速查
| 问题 | 解决方法 |
|---|---|
| 推理时报注意力相关错误 | 检查模型transformer/config.json中attn_mode是否为"torch"或"flashattn" |
| 显存不足(OOM) | 在 wan_va/configs/shared_config.py 中设置enable_offload = True |
flash-attn安装失败 | 按 INSTALL.md 使用--no-build-isolation重试 |
| 找不到模型权重 | 确认配置中wan22_pretrained_model_name_or_path已改为本地真实路径 |
写在最后
从克隆仓库到看到第一段"未来预演"视频,LingBot-VA 的部署门槛并不高:单卡 18GB 显存、10 分钟上手、两条命令完成仿真评测。作为一个把世界建模与动作生成统一起来的因果视频-动作模型,它为通用机器人控制提供了一条值得尝试的新路线。项目基于 Apache 2.0 协议开源(见 LICENSE.txt),欢迎在此基础上探索你自己的机器人任务。
【免费下载链接】lingbot-va[RSS 2026] Causal video-action world model for generalist robot control项目地址: https://gitcode.com/gh_mirrors/li/lingbot-va
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考