☰
超级玛丽、俄罗斯方块、魔方:JEV-27B-VL的System 1决策循环玩透5款经典游戏
2026/10/9 10:32:47 网站建设 项目流程

超级玛丽、俄罗斯方块、魔方:JEV-27B-VL的System 1决策循环玩透5款经典游戏

【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL

如果你想知道 AI 能不能"自己看着屏幕玩游戏",JEV-27B-VL 给出的答案相当干脆:能。这款多模态决策模型用一套极简的 System 1 决策循环,先后拿下了超级玛丽、俄罗斯方块、魔方、贪吃蛇和 Quick, Draw! 猜画 5 款经典游戏——每一步都是"看一眼画面 → 输出每个动作的概率 → 执行最高概率动作",单次决策只要几十到几百毫秒。

这篇文章带你用新手视角看懂:这个决策循环是怎么转起来的,5 款游戏各自是怎么被"玩透"的,以及你如何在自己机器上跑起来看它玩。

🎮 先看结果:5 款游戏,同一个循环

不用训练、不用调参,JEV-27B-VL 的 System 1 对每款游戏只需要回答一类"选择题":

游戏每一步 System 1 回答的问题单次决策耗时演示视频
🍄 超级玛丽往哪走?跳不跳?约 150 msvideos/vl1.mp4
🧊 魔方11 个标准公式里选哪一步?约 46 msvideos/vl2.mp4
🧱 俄罗斯方块这块放哪一列、怎么旋转?约 122 msvideos/vl3.mp4
✏️ Quick, Draw!16 个答案里猜画的是什么?约 270 msvideos/vl4.mp4
🐍 贪吃蛇看棋盘和位置列表,下一步往哪走?约 300 msvideos/vl5.mp4

注意一个关键设计:它不是让大模型"生成一段话"再解析,而是一次前向传播直接输出每个候选动作的校准概率。没有 JSON 解析、没有格式错误、没有"模型今天心情不好不听话"的问题。

1️⃣ 超级玛丽:每步 = 移动选择 + 跳跃决策

每一帧画面送入模型,System 1 同时回答"往哪走"和"跳不跳"两个问题,约 150 ms 出结果(演示视频为 5 倍速)。对新手来说这很直观:它就像反应极快的玩家,看一眼当前画面就做下一步决策,然后循环往复。

2️⃣ 魔方:46 ms 一步,解 25 步乱序

魔方可能是最"反直觉"的:System 1 把当前状态和 11 个标准还原公式放在一起比较,每步只从这 11 个公式里选一个,约 46 ms 一步(视频为 10 倍速回放)。从 25 步随机打乱到还原,全程就是这样一个"选择题循环"在转。

3️⃣ 俄罗斯方块:选列 + 选朝向

每块方块落下前,System 1 从"列 × 朝向"的组合中选出概率最高的落法,约 122 ms 一块(5 倍速)。没有预编程的贪吃规则,纯靠模型对棋盘的理解做决策。

4️⃣ Quick, Draw!:画到 60% 就能猜对 62%

这个不是玩游戏,而是玩"猜画":画手一笔一笔画,System 1 每收一笔就从 16 个答案里重新猜一次。在 320 位真实玩家的作品上,画完时猜对率88%;即使只画到 60% 的笔数,也能猜对62%(随机猜只有 6%)。单次猜测约 270 ms。

5️⃣ 贪吃蛇:131 步吃到 18 个食物

输入是棋盘画面加蛇的位置列表,System 1 每步选一个方向。整局 131 步吃到 18 个食物,单步决策约 300 ms(视频 4 倍速)。

⚡ 核心:System 1 决策循环是怎么转的

JEV-27B-VL 的架构可以拆成两层(详见 README.md):

  • System 1(快思考):通过POST /v1/decide接口,输入"状态 + 一个问题 + 候选项",输出每个候选项的校准概率。支持三种题型:noul(是/否)、score(0–5 打分)、choice(2–256 选 1)。
  • System 2(慢思考):未修改的 Qwen3.8-27B,可以看图、一步步推理,适合复杂问题。

决策循环的精髓在于概率是可信的:它在 13,695 行评测上的期望校准误差(ECE)只有 0.019——说 80% 置信时,大约就 80% 是对的。这就允许系统"置信度高就自动执行、置信度低就升级给 System 2",又快又稳:

实测中,置信度低于 0.70 才升级给 System 2:70% 的问题在 0.11 秒内被 System 1 答完,整体准确率从 0.792 提升到 0.892。游戏循环里同理——画面简单时快答,局面微妙时交给更谨慎的决策。

👀 它的"眼睛"为什么靠得住

很多人第一反应是:决策头训练时没见过游戏画面,凭什么能看懂棋盘?

答案是:决策适配器和决策头只用文本训练,视觉编码器直接继承自 Qwen3.8-27B,所以所有图像决策都是零样本。而它的图像理解能力有硬数据支撑——在多模态评审任务上,给一张图、一个问题、两个答案,它单次前向传播就能挑出更好的答案:

在 VL-RewardBench 上总准确率78.3%,超过榜单上全部 26 个模型,包括 GPT-4o(65.8%)和专门训练的评审模型;在更新的 MMRB2 基准上,文生图评审与 GPT-5 仅差 1.3 分。同样的"看图决策"能力也支撑了它零样本短视频推荐(仅看封面图 AUC 0.727,追平用 59,045 个用户行为训练的协同过滤):

也就是说,游戏里那些"看到蛇头快撞墙了""看到坑要跳"的能力,来自这套经过基准检验的视觉判断力。

🚀 快速上手:两条命令看它玩游戏

硬件要求:一张 80 GB 以上显存的 GPU(vLLM 部署)。

git clone https://gitcode.com/hf_mirrors/autotrust/JEV-27B-VL bash JEV-27B-VL/serve.sh # 启动 vLLM 服务,监听 :8000

serve.sh 内部会拉起 serve_decide.py——标准 vLLM 服务加一条 System 1 专用的/v1/decide路由。启动后任何 HTTP 客户端发一帧画面 + 一个问题 + 一组候选动作,就能拿到校准概率,游戏循环即可跑起来。

部署要点(新手最容易踩的坑,来自 README.md):

  • ✅--max-num-seqs 8是必需的,超过 8 条并发序列会输出错误的 System 1 概率
  • ✅ 图片先缩到 448 px 以内,能显著降低延迟
  • ✅ 需要 256K 长上下文时,设置MAX_MODEL_LEN=262144后再启动

📁 仓库文件导览(找资料看这里)

文件作用
serve.sh / serve_decide.py一键部署 + System 1 决策接口
adapter_vllm/decision_head.json决策头偏置与词表配置
calibration.json各题型的校准温度参数
config.json / chat_template.jinja模型结构与对话模板
videos/vl1.mp4 ~ videos/vl5.mp45 款游戏的完整决策循环演示
reports/demos/机器人与电脑操作逐条动作记录
blog/JEV-27B-VL.md官方博客长文,含全部实验细节
LICENSEApache-2.0 开源协议

🤖 彩蛋:同一个循环,还能驱动机械臂和浏览器

游戏之外,这套 System 1 循环还在 MuJoCo 仿真里做了机械臂抓取放置——每一步只看一张摄像头画面,回答"目标在夹爪的左/右、上/下方",20 个随机场景完成75%(家族内最高),单次决策约 240 ms;在真实无头浏览器里做电脑操作,60 个多步任务完成95%,约 0.26 s 每次点击:

  • 机械臂:videos/robot_arm_pick_place.mp4
  • 电脑操作:videos/computer_use_shop.mp4

一个值得记住的教训:直接让 System 1 从 8 个电机指令里硬选,10 个场景完成 0 个——把复杂动作拆成简单的是/否小问题,才是它发挥最好的姿势。

总结

JEV-27B-VL 把"AI 玩游戏"做成了最朴素的工程形态:一个校准概率接口,一个 while 循环。超级玛丽的每一次跳跃、魔方的每一步公式、俄罗斯方块的每一次落块,背后都是同一句逻辑——看一眼,出概率,选最大,再下一帧。单步 46~300 ms 的速度、可执行的高置信概率、零样本的视觉理解,让它成为目前决策模型里少数"拿来就能组成闭环"的选择。

想深入实验设计,读 blog/JEV-27B-VL.md;想动手部署,两条命令即可开玩。🕹️

【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询