☰
重磅:分层世界模型开源发布,复杂任务成功率实现大幅提升
2026/10/12 3:59:50 网站建设 项目流程

重磅:分层世界模型开源发布,复杂任务成功率实现大幅提升

如果要让一只机器小蚂蚁在布满岔路的迷宫里找到出口,传统的方案经常会卡在一个极其尴尬的境地:它要么忙着算清楚自己的左前腿下一毫秒该迈多大角度,结果走不出两步就彻底迷路;要么就得强行记住整座迷宫的每一处拐角,算力烧干了也没走到终点。

在计算机仿真迷宫测试里,过去单层架构的世界模型带着这只蚂蚁去摸索,十次里往往只能成功不到两次。

2026年10月5日,图灵奖得主Yann LeCun担任董事长的世界模型创业公司AMI,联合纽约大学、法国国家信息与自动化研究所(INRIA Paris)以及布朗大学,把一项名为H-JEPA的研究摆上了开源平台。他们做了一套三层结构的新模型,让同样一只仿真蚂蚁在迷宫里的通关成功率,从18%直接拉升到了73%。

更让业界侧目的是,这项技术不仅把走迷宫的成功率翻了四倍,整个规划过程消耗的计算资源反而更低了。

一、为什么算力更强,反而越容易在复杂任务里迷路

大语言模型靠预测下一个字符来写文章,而近年来被寄予厚望的世界模型,则试图理解物理世界的运行规律。很多经典世界模型走的是逐个生成画面的路子,但视觉联合嵌入预测架构(JEPA)完全不同:它从不尝试一砖一瓦地把下一帧画面画出来,而是把看到的图像抽象成高维特征,只在内部特征空间里预测未来的变化。

不画废像素,听起来很聪明。但当研究者试图用它来做长距离规划时,立刻撞上了一堵墙。

试想一下,如果一个人要从北京自驾去广州,大脑里绝对不会在出发前就把沿途几千公里每一米的路面坑洼、每一秒的方向盘微调全都推演一遍。普通人规划长途路线,只会先定下大城市节点:先到石家庄,再到武汉,最后到广州。至于具体到某个十字路口怎么打方向盘,那是开到跟前才去处理的即时动作。

过去扁平的单层模型,却被迫在同一个脑子里同时干这两件事。它既要预测机器腿极其微小的精确受力,又要负责在几十步开外找终点。

问题就出在这:精确控制所需的细节,在长距离预测中极其容易发散,而且根本无法用来衡量当前位置离终点还有多远。一套表征空间既要管脚指头怎么动,又要管大方向往哪拐,最后的结果就是预测和规划变得异常艰难。单层模型在迷宫测试里18%的凄惨成功率,就是这么来的。

二、把一个大脑拆成三份,每层只干自己该干的事

H-JEPA给出的解法并不复杂,说白了就是层次分明。

研究团队构建了一个多层联合嵌入预测体系。每一层都有自己的状态编码器、动作编码器和预测器,但它们面对的时间跨度和抽象程度完全不同。

最低层负责贴地飞行。它直接读取原始图像输入,专门预测极短时间内的状态变化,负责产生直接可执行的底层动作。比如小蚂蚁的具体步态、机器手臂的电机输出,都由这一层打理。

高层则负责登高望远。它从下层的特征出发,把时间轴拉长,跨过中间细碎的物理动作,在更长的时间间隔上做长程推演。在实验配置中,高层相邻迈出的一步,直接对应低层两步的动作预测。

这就形成了一个极其聪明的过滤机制:更高层的空间会自动丢掉蚂蚁腿部姿态这类变化极快、又很难长远预测的微观细节,转而死死抓住较慢、但对全局至关重要的状态,比如蚂蚁在整座迷宫中的坐标位置与墙体布局。

规划开始时,大脑采取自上而下的流程:最高层朝着最终目标搜索出一个大致路线,把预测出的中间状态作为子目标向下派发;次高层接下任务,把它细化成更具体的阶段性目标;逐层往下传递,最终由最低层输出扎扎实实的物理动作。

为了不让各层各自为政,整套系统采用端到端联合训练。高层目标产生的梯度信号会一路反向流经低层的编码器。同时,为了防止模型在训练中偷懒把所有画面都压成同一个毫无意义的向量,团队在每一层都加入了来自LeJEPA论文的正则约束,彻底堵死了表征坍缩的漏洞。

三、从虚拟迷宫到机械臂,它到底击败了什么

这套思路到底灵不灵,得拿硬核的基准测试说话。

在四室迷宫、立体方块以及视觉蚂蚁迷宫等多个仿真导航与物理操作环境里,研究团队把H-JEPA与单层模型,以及同样做分层规划但在共享空间里运作的世界模型(HWM)进行了严苛对照。

在测试长程探索能力的视觉蚂蚁迷宫里,单层模型的通关成功率只有18%,而在同样任务下,三层结构的H-JEPA直接冲到了73%。这一成绩不仅彻底碾压了扁平结构,也几乎达到了同类分层模型HWM成功率的两倍,并且整个规划过程消耗的计算算力明显更少。

消融实验证实,这种断崖式的优势来自两个协同发力的轮子:一是把时间维度按照快慢进行了拆解,二是在更高层学到了不带干扰的目标表征。

团队并没有止步于仿真环境。他们进一步把这套架构搬到了开源机器人数据集DROID上,直接面对真实的机械臂抓取操作视频。

现实世界充满了静态背景和动态机械臂的交织。实验发现,如果仅仅依靠纯预测,模型往往容易死抠静态场景,反而丢掉了机械臂自身的运动特征。研究团队在训练中引入了逆动力学监督,也就是让模型去预测连接两个前后观测状态所需的具体动作。加上这道工序后,H-JEPA在真实视频数据集上成功保留了与物理动作密切相关的特征,在更低的计算成本下,显著提升了离线规划的保真度。

不过,研究也指出了这一架构的物理边界:层级并不是搭得越深越好。在相对短周期的推送任务中,四层模型反而不如两层模型表现稳定。说白了,如果任务本身的动作跨度极短,数据量无法支撑更长时间片段的抽取,强行把层级堆得过深,反而会因为有效样本不足而让高层失去推演依据。

在技术突破之外,这家背后的公司同样备受关注。作为LeCun设想的世界模型排头兵,AMI在今年3月完成了约10.3亿美元的融资,投前估值达到3.5亿美元。公司不仅集结了包括首席执行官Alexandre LeBrun、首席科学家Xie Saining在内的豪华阵容,世界模型方向更是由Michael Rabbat亲自领衔。

早在2022年6月,LeCun就在那篇奠基性质的长文《通向自主机器智能之路》中,首次勾勒出这种多层、多尺度、不画像素的世界模型蓝图。四年之后,这份蓝图终于从论文里的推导,变成了可在GitHub上下载、加载权重复现的开源代码。

从18%到73%,机器学会的不是拼命去算每一帧像素,而是终于学会了像人一样,先抓大放小,再看清脚下的路。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询