超级玛丽、俄罗斯方块、魔方:JEV-27B-VL的System 1决策循环玩透5款经典游戏
【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL
如果你想知道 AI 能不能"自己看着屏幕玩游戏",JEV-27B-VL 给出的答案相当干脆:能。这款多模态决策模型用一套极简的 System 1 决策循环,先后拿下了超级玛丽、俄罗斯方块、魔方、贪吃蛇和 Quick, Draw! 猜画 5 款经典游戏——每一步都是"看一眼画面 → 输出每个动作的概率 → 执行最高概率动作",单次决策只要几十到几百毫秒。
这篇文章带你用新手视角看懂:这个决策循环是怎么转起来的,5 款游戏各自是怎么被"玩透"的,以及你如何在自己机器上跑起来看它玩。
🎮 先看结果:5 款游戏,同一个循环
不用训练、不用调参,JEV-27B-VL 的 System 1 对每款游戏只需要回答一类"选择题":
| 游戏 | 每一步 System 1 回答的问题 | 单次决策耗时 | 演示视频 |
|---|---|---|---|
| 🍄 超级玛丽 | 往哪走?跳不跳? | 约 150 ms | videos/vl1.mp4 |
| 🧊 魔方 | 11 个标准公式里选哪一步? | 约 46 ms | videos/vl2.mp4 |
| 🧱 俄罗斯方块 | 这块放哪一列、怎么旋转? | 约 122 ms | videos/vl3.mp4 |
| ✏️ Quick, Draw! | 16 个答案里猜画的是什么? | 约 270 ms | videos/vl4.mp4 |
| 🐍 贪吃蛇 | 看棋盘和位置列表,下一步往哪走? | 约 300 ms | videos/vl5.mp4 |
注意一个关键设计:它不是让大模型"生成一段话"再解析,而是一次前向传播直接输出每个候选动作的校准概率。没有 JSON 解析、没有格式错误、没有"模型今天心情不好不听话"的问题。
1️⃣ 超级玛丽:每步 = 移动选择 + 跳跃决策
每一帧画面送入模型,System 1 同时回答"往哪走"和"跳不跳"两个问题,约 150 ms 出结果(演示视频为 5 倍速)。对新手来说这很直观:它就像反应极快的玩家,看一眼当前画面就做下一步决策,然后循环往复。
2️⃣ 魔方:46 ms 一步,解 25 步乱序
魔方可能是最"反直觉"的:System 1 把当前状态和 11 个标准还原公式放在一起比较,每步只从这 11 个公式里选一个,约 46 ms 一步(视频为 10 倍速回放)。从 25 步随机打乱到还原,全程就是这样一个"选择题循环"在转。
3️⃣ 俄罗斯方块:选列 + 选朝向
每块方块落下前,System 1 从"列 × 朝向"的组合中选出概率最高的落法,约 122 ms 一块(5 倍速)。没有预编程的贪吃规则,纯靠模型对棋盘的理解做决策。
4️⃣ Quick, Draw!:画到 60% 就能猜对 62%
这个不是玩游戏,而是玩"猜画":画手一笔一笔画,System 1 每收一笔就从 16 个答案里重新猜一次。在 320 位真实玩家的作品上,画完时猜对率88%;即使只画到 60% 的笔数,也能猜对62%(随机猜只有 6%)。单次猜测约 270 ms。
5️⃣ 贪吃蛇:131 步吃到 18 个食物
输入是棋盘画面加蛇的位置列表,System 1 每步选一个方向。整局 131 步吃到 18 个食物,单步决策约 300 ms(视频 4 倍速)。
⚡ 核心:System 1 决策循环是怎么转的
JEV-27B-VL 的架构可以拆成两层(详见 README.md):
- System 1(快思考):通过
POST /v1/decide接口,输入"状态 + 一个问题 + 候选项",输出每个候选项的校准概率。支持三种题型:noul(是/否)、score(0–5 打分)、choice(2–256 选 1)。 - System 2(慢思考):未修改的 Qwen3.8-27B,可以看图、一步步推理,适合复杂问题。
决策循环的精髓在于概率是可信的:它在 13,695 行评测上的期望校准误差(ECE)只有 0.019——说 80% 置信时,大约就 80% 是对的。这就允许系统"置信度高就自动执行、置信度低就升级给 System 2",又快又稳:
实测中,置信度低于 0.70 才升级给 System 2:70% 的问题在 0.11 秒内被 System 1 答完,整体准确率从 0.792 提升到 0.892。游戏循环里同理——画面简单时快答,局面微妙时交给更谨慎的决策。
👀 它的"眼睛"为什么靠得住
很多人第一反应是:决策头训练时没见过游戏画面,凭什么能看懂棋盘?
答案是:决策适配器和决策头只用文本训练,视觉编码器直接继承自 Qwen3.8-27B,所以所有图像决策都是零样本。而它的图像理解能力有硬数据支撑——在多模态评审任务上,给一张图、一个问题、两个答案,它单次前向传播就能挑出更好的答案:
在 VL-RewardBench 上总准确率78.3%,超过榜单上全部 26 个模型,包括 GPT-4o(65.8%)和专门训练的评审模型;在更新的 MMRB2 基准上,文生图评审与 GPT-5 仅差 1.3 分。同样的"看图决策"能力也支撑了它零样本短视频推荐(仅看封面图 AUC 0.727,追平用 59,045 个用户行为训练的协同过滤):
也就是说,游戏里那些"看到蛇头快撞墙了""看到坑要跳"的能力,来自这套经过基准检验的视觉判断力。
🚀 快速上手:两条命令看它玩游戏
硬件要求:一张 80 GB 以上显存的 GPU(vLLM 部署)。
git clone https://gitcode.com/hf_mirrors/autotrust/JEV-27B-VL bash JEV-27B-VL/serve.sh # 启动 vLLM 服务,监听 :8000serve.sh 内部会拉起 serve_decide.py——标准 vLLM 服务加一条 System 1 专用的/v1/decide路由。启动后任何 HTTP 客户端发一帧画面 + 一个问题 + 一组候选动作,就能拿到校准概率,游戏循环即可跑起来。
部署要点(新手最容易踩的坑,来自 README.md):
- ✅
--max-num-seqs 8是必需的,超过 8 条并发序列会输出错误的 System 1 概率 - ✅ 图片先缩到 448 px 以内,能显著降低延迟
- ✅ 需要 256K 长上下文时,设置
MAX_MODEL_LEN=262144后再启动
📁 仓库文件导览(找资料看这里)
| 文件 | 作用 |
|---|---|
| serve.sh / serve_decide.py | 一键部署 + System 1 决策接口 |
| adapter_vllm/decision_head.json | 决策头偏置与词表配置 |
| calibration.json | 各题型的校准温度参数 |
| config.json / chat_template.jinja | 模型结构与对话模板 |
| videos/vl1.mp4 ~ videos/vl5.mp4 | 5 款游戏的完整决策循环演示 |
| reports/demos/ | 机器人与电脑操作逐条动作记录 |
| blog/JEV-27B-VL.md | 官方博客长文,含全部实验细节 |
| LICENSE | Apache-2.0 开源协议 |
🤖 彩蛋:同一个循环,还能驱动机械臂和浏览器
游戏之外,这套 System 1 循环还在 MuJoCo 仿真里做了机械臂抓取放置——每一步只看一张摄像头画面,回答"目标在夹爪的左/右、上/下方",20 个随机场景完成75%(家族内最高),单次决策约 240 ms;在真实无头浏览器里做电脑操作,60 个多步任务完成95%,约 0.26 s 每次点击:
- 机械臂:videos/robot_arm_pick_place.mp4
- 电脑操作:videos/computer_use_shop.mp4
一个值得记住的教训:直接让 System 1 从 8 个电机指令里硬选,10 个场景完成 0 个——把复杂动作拆成简单的是/否小问题,才是它发挥最好的姿势。
总结
JEV-27B-VL 把"AI 玩游戏"做成了最朴素的工程形态:一个校准概率接口,一个 while 循环。超级玛丽的每一次跳跃、魔方的每一步公式、俄罗斯方块的每一次落块,背后都是同一句逻辑——看一眼,出概率,选最大,再下一帧。单步 46~300 ms 的速度、可执行的高置信概率、零样本的视觉理解,让它成为目前决策模型里少数"拿来就能组成闭环"的选择。
想深入实验设计,读 blog/JEV-27B-VL.md;想动手部署,两条命令即可开玩。🕹️
【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考