27 任务 810 样本、Seedance 2.0 只拿 51%:UIUC 给视频生成建了第一个「视觉推理」评测基准
Hugging Face 每日论文(2026-08-27 精选)
最近两年视频生成模型从「画面像不像」卷到「能不能做事」,但「做事」该怎么测一直没有公认标准。8 月 21 日 arXiv 上挂出的 VGI-Bench(arxiv:2608.19583)把这件事给出一个可量化的答案:27 个任务、810 个样本,分四类领域、覆盖多类技能标签,当前最强的视频生成模型 Seedance 2.0 也只拿到 51.0% 的评测分。这件事意味着,视频生成作为「视觉世界模拟器」这件事已经走通,但作为「视觉推理器」这件事才刚刚开始算入门。
UIUC、清华、滑铁卢、MIT、UBC、Microsoft Research、NetMind.ai、Etude AI 等机构 28 位作者联合署名,把过去两年「零样本视觉推理」赛道的散点工作收束成一套可复现、可分维度剖析的评测集。8 月 27 日它登上 Hugging Face 每日论文榜时拿到 136 个 upvote。
这件事的痛点:过去的评测都在测「最终画面」而不是「推理过程」
过去两年测视频生成模型的视觉推理能力,工程团队普遍用两类工作做基准:
第一类是 PhysGenBench、WorldSimBench 这类偏物理一致性的评测,侧重「物体受重力影响后会不会下沉」「液体倒入容器后液面是否对齐」这类低-中等推理需求的任务。
第二类是 V-ReasonBench、VBVR-Bench 这类走抽象输入的评测,用线稿或示意性图作为 prompt,要求模型完成高难度视觉推理。
这两类工作在 2024 到 2025 年间都被广泛使用,但 UIUC 团队在论文里把它们的三类共性问题写得很清楚:
第一,输入视觉分布不匹配。线稿、抽象图与当前视频生成模型在训练阶段看到的自然图像分布差距太大,模型对抽象输入经常出现画面崩塌、约束忽略。这类失败看上去像「模型不擅长视觉推理」,但本质上可能是「视觉域错位」。评测得分到底反映了视觉推理能力,还是反映了视觉域适配能力,过去没有人能分清楚。
第二,对「过程」的需求不充分。很多评测任务只要最终画面看上去合理就算通过,模型完全可以在中间帧之间「作弊」跳到最终态,不必真的按物理或逻辑链条一步步演化。这意味着「最终态看起来合理」和「中间过程真的在做推理」是两件事,但前者无法区分后者。
第三,难度不可控。一些基准把难度堆到远超当前模型能力的位置,结果模型几乎全挂,得分集中在 0% 到 5% 之间,分不出谁比谁强;另一些又把难度放得太低,所有模型都拿 80% 以上,看不出改进。
VGI-Bench 的整套设计就是针对这三类问题展开的。
27 任务 810 样本:四类领域 × 多类技能标签
VGI-Bench 的任务集合包含 27 个具体任务、810 个样本,每个任务同时被归入一个「领域」和一个或多个「技能标签」。
领域是互斥的,分四类:
- 物理类:弹球滚动、流体倾倒、刚体碰撞、机械组装等
- 空间几何类:二维到三维折叠、截面推断、视角变换、路径规划等
- 语义类:物体属性归因、关系推理、意图解读、组合操作等
- 任务执行类:目标导航、子目标拆解、长程执行、动作链一致性等
技能标签是叠加的,可以一个任务同时打多个标签。论文给出的技能标签集包括空间(Spatial)、时序(Temporal)、规划(Planning)、属性归因(Attribute Grounding)、弹簧动力学(Spring)、拓扑(Topology)、可供性(Affordance)等几个维度,覆盖当前视觉推理工作里最关心的几类子能力。
| 维度 | 设计选择 | 解决的问题 |
|---|---|---|
| 输入视觉风格 | 真实场景图像(不用线稿/抽象) | 消除视觉域错位,让评测分数反映真实视觉推理能力 |
| 评测对象 | 中间轨迹 + 最终状态 | 区分「过程推理」与「终态直跳」 |
| 难度分布 | 预生成过滤 + 人工审核 | 把任务难度卡在「勉强可做但容易失败」区间,让分数有区分度 |
| 领域分类 | 4 类互斥(物理/空间/语义/任务) | 让分数可以被分维度剖析 |
| 技能标注 | 多标签叠加(Spatial/Temporal/Planning 等) | 跨任务横向比较同一类技能的不同表现 |
27 个具体任务的例子包括二维到三维的立方体展开与折叠、迷宫路径规划、空间拓扑操作、多步目标导航、装配序列推理、汉诺塔式层级操作等。每一个任务都从真实场景图像出发,要求模型生成一条中间过程可视的视频轨迹,并在最终帧上给出答案。
当前最强模型也只拿 51%:分数不是越高越好,是越能定位越好
论文对一组代表性视频生成模型做了系统评测,覆盖闭源商用模型、开源模型、微调后模型三类。整体结论是:当前生成系统能解决一部分视觉推理任务,但离可靠还差得很远。即使是被评测集中表现最好的 Seedance 2.0,在 VGI-Bench 的评测标准下也只拿到 51.0%。
51% 这个数字本身不是 VGI-Bench 想强调的重点。重点是分数的分维度分布:Seedance 2.0 在物理类任务上表现相对最好,在空间几何类任务上次之,在语义类和任务执行类任务上掉分最严重。其他模型也有类似的模式,但具体分布各有差异。这种「分维度分布」才是研究者真正想要的信号,因为它告诉研究者下一阶段该补哪一类能力。
论文进一步给出四类深入分析:
| 分析维度 | 关键发现 | 对模型设计的含义 |
|---|---|---|
| 输出失败模式 | 模型在多种任务上出现「终态正确但中间过程崩坏」 | 单纯优化最终帧目标不够,需要显式优化中间轨迹 |
| 输入条件敏感度 | 模型对 prompt 措辞、初始帧选择、视角微小变化高度敏感 | 需要更稳健的条件编码与去噪机制 |
| 合成微调迁移边界 | 在合成数据上微调后,在真实任务上只能迁移部分能力 | 合成数据不能替代真实世界训练 |
| 去噪内部视角 | 后期去噪步主要「润色」早期假设,而非纠正早期推理错误 | 早期假设空间需要被显式扩大或重采样 |
最后一条尤其关键。当前主流视频生成的去噪机制是「逐步细化」,论文用一种去噪内部视角的方法观察发现:模型在早期去噪步形成的「假设」,在后期去噪步里几乎不会被推翻。换句话说,模型并不是像人一样在生成过程中持续纠正推理错误,而是在前几步就锁定了大致走向,后面的步骤只是把画面做得更精细。这件事给视频生成研究者一个新的设计抓手:如果想真正提升视觉推理能力,关键不在后期去噪步,而在早期假设空间的扩大与重采样。
为什么「真实场景图像」这件事这么重要
论文在评测方法里反复强调「真实场景图像输入」。这件事看起来是个工程细节,但实际是 VGI-Bench 区分于过去工作的最关键设计。
| 输入类型 | 代表基准 | 模型表现 | 主要失分点 |
|---|---|---|---|
| 线稿/示意性图像 | V-ReasonBench、VBVR-Bench | 经常出现画面崩塌 | 视觉域错位掩盖真实推理能力 |
| 真实场景图像 | VGI-Bench | 表现更接近真实应用场景 | 推理能力本身的不足 |
用线稿做 prompt 的好处是任务定义容易、prompt 可控性强、生成结果易于评估。坏处是当前的视频生成模型都是在自然图像上预训练,对线稿输入的视觉先验严重不足,模型会在「理解线条」这件事上先崩一次,再做视觉推理这件事上又崩一次。两类失败被混在一起,评测分数就无法拆开。
VGI-Bench 的真实场景图像输入更贴近当前模型的实际使用场景:用户上传一张真实照片,让模型「想象」场景如何演化。在这种输入下,模型的失败主要来自推理能力本身,而不是视觉域错位。论文在控制对比实验里给出的数据是:当同一个任务用线稿和真实图像两种 prompt 测同一个模型时,真实图像版本的成功率显著更高,但失败模式的分布也明显不同。
这件事的工程含义是:未来想用视频生成做视觉推理的产品,最好按真实图像 prompt 的方式去设计 prompt 流程,而不是按学术线稿的方式。VGI-Bench 给出的评测分数更接近真实应用场景。
任务设计里的「勉强可做」原则
VGI-Bench 的难度设计有一个反直觉的取舍:他们刻意把任务难度卡在「勉强可做但容易失败」的区间,而不是「完全做不到」或「几乎全做对」。
「完全做不到」的问题是分数集中在 0% 附近,分不出模型之间的差异。「几乎全做对」的问题是分数集中在 90% 以上,看不出改进空间。两者都会让评测失去区分度,浪费研究者的时间。
VGI-Bench 的做法分两步:
第一步,预生成过滤。任务作者先用当前最强模型跑一遍所有候选任务,记录每个任务的通过率。通过率 < 5% 的任务被剔除(难度过高,模型整体挂),通过率 > 80% 的任务被剔除(难度过低,所有模型都能拿满分)。
第二步,人工审核。剩下的任务由人工再次审核,检查任务定义是否清晰、视觉推理难度是否落在合理区间、是否存在偶然通过。
经过这两步,VGI-Bench 的 27 个任务最终落在「最强模型 50% 左右通过率」这个区间。这种难度分布让评测分数既有区分度,又能反映真实的改进空间。
留给视频生成研究者的三件事
第一件:把视觉推理能力从「最终画面」拆到「中间轨迹」。论文用去噪内部视角给出一个清晰结论:当前模型后期去噪步主要润色早期假设,而不是纠正早期错误。研究者应该把改进重点放在早期假设空间的扩大与重采样,而不是简单的后期细化。
第二件:把训练数据从「合成」拉回「真实」。论文给出合成微调的迁移边界:合成数据上微调后,在真实任务上的迁移能力有限。视频生成的训练数据需要更多真实场景视频,而不是更多合成 prompt。
第三件:把评测分数从「总分」拆到「分维度」。Seedance 2.0 的 51% 不是 51%,它在不同领域、不同技能标签下的分布完全不同。研究者应该按分维度报告分数,按分维度寻找改进空间,而不是只看总分。
VGI-Bench 给出的不只是一个评测集,更是一套让视频生成研究者可以按维度定位问题、按维度改进能力的评测方法论。它把「视频生成是不是真的在做视觉推理」这件事,从一句口号变成了 810 个具体样本上的可量化分数。