李飞飞和World Labs联合创始人的那场对谈出来后,不少做CV和做AIGC的朋友都在转。有人兴奋,有人疑惑:这跟现在满屏的视频生成模型到底有什么区别?我的第一反应倒没那么复杂——光是“统一像素生成与重建”这个提法,就值得认真拆一拆。我做三维重建和生成式内容管线有些年头了,过去这两件事几乎是被当成两个领域来做的,现在有人把它们放进同一套框架里,还给出了一个叫Atlas的落地形态,这事对整个行业的影响可能比我们想象中更大。
这篇文章我想站在从业者的角度,把World Labs和Atlas到底在做什么、统一生成与重建为什么重要、以及这套思路和传统方案之间的差异讲清楚。适合正在做三维视觉、AIGC工具链、空间计算应用,或者单纯对“空间智能”这个方向好奇的朋友参考。
1. 先搞清楚World Labs和Atlas到底在做什么
1.1 李飞飞的“空间智能”并不玄乎
先说个基本盘。李飞飞创业做World Labs,从第一天起打的旗号就是“空间智能”。这个词听起来很宏大,但落到工程上其实可以翻译得很朴实:让机器不仅会“看”一张图里有什么,还能理解这张图背后的三维几何关系、物体之间的相对位置、以及从不同角度观察时场景会怎么变化。
她之前在很多场合提到过一个观点:大语言模型学会的是“读写能力”,而空间智能让模型学会的是“在三维世界里推理和执行”。World Labs这个名字本身也暗示了这个方向——世界不是一张平面图片,世界是立体的、连续的、可交互的。所以这家公司做的不是又一个聊天机器人,也不是单纯的文生图工具,而是试图构建一个能表达“世界结构”的模型体系。
这次对谈里提到的Atlas,就是这个体系里一个非常具体的项目。它不是那种概念性的Demo,而是已经具备实际功能的系统:你给它一组真实拍摄的照片,它能重建出带几何结构的三维场景;你给它一段自然语言描述,它也能凭空生成一个风格一致、视角可控的三维世界。生成和重建两条路线,在Atlas里走的是同一条技术路径。
1.2 Atlas不是又一个视频模型,它是把生成与重建统一起来的基础设施
现在市面上的视频生成模型很多,比如输入一段文本生成几秒钟的动态画面,或者输入一张图把它变成动画。这类模型的核心能力是“在像素空间里做预测”——预测下一帧长什么样,预测运动轨迹,但模型内部并没有一个真正稳定的三维几何表示。所以很多人发现,视频生成模型在视角大幅度变化时,场景结构经常“融化”掉,前后帧的几何对不上。
Atlas走的是另一条路。它把三维结构放在模型的核心位置,像素生成只是从这个三维结构里渲染出来的结果。换句话说,Atlas先用一种可微的三维表示去理解场景,再从任意新视角渲染出画面。对用户来说,看到的是一段可以自由切换视角的视频流,但底层是对场景几何的显式建模。
这就是“统一像素生成与重建”的含义:生成不是纯粹地“画”像素,而是先建立几何,再渲染像素;重建也不是只输出一个静态的mesh点云,而是输出一个能支持后续生成操作的动态三维场景表示。生成和重建不再需要两套完全独立的算法,而是共享同一个三维空间理解的核心。
2. 为什么“统一像素生成与重建”值得单独拿出来讲
2.1 过去十年的割裂:生成模型在画,重建模型在量
如果你做过三维相关的工作,一定对“割裂”这两个字深有体会。传统三维重建走的是这样一条路:先用多视角相机采集图片,做特征匹配,算稀疏点云,再走MVS或者NeRF、3D Gaussian Splatting之类的方案稠密化,最后得到mesh或者带纹理的模型。整个过程的目标只有一个词:准。重建出来的东西必须和真实物理世界严格对齐,差一厘米都可能出问题。
而生成模型追求的是另一回事:好看、自然、风格化。扩散模型和GAN在画面上追求的是视觉合理性,它们可以画一只不存在的龙,可以让一个场景有魔幻的光影,但它们不保证几何上真实存在,也不保证你换个角度看到的画面在物理上是连贯的。
这两条技术路线过去几乎是平行发展。做重建的人聊的是相机位姿、深度估计、多视图一致性,做生成的人聊的是扩散采样、噪声调度、CFG引导。两边用的工具链不同、评测指标不同、优化目标也不同。结果就是:你很难拿一个生成模型去修一张重建失败的mesh,也很难拿重建出的点云直接去驱动生成模型做风格化编辑。
2.2 统一表示:三维信息才是两者的中间语言
Atlas提出的统一方案,核心在于找到了一种“中间语言”——三维特征表示。它不是传统的体素,也不是普通的mesh,而是一种支持可微渲染的三维特征场。这种表示有两头好处:对重建来说,它可以精准地编码来自真实图像的几何信息;对生成来说,它又具备足够的灵活度,允许模型在特征空间里做编辑和合成。
打个比方你就明白了。以前生成和重建像是两个只会说不同语言的人:生成模型只会说“像素语”,重建模型只会说“坐标语”。Atlas相当于给这两个人配了一个同声传译——“三维特征语”。有了这种共同语言,重建出来的三维场景可以作为生成任务的起点,生成出来的三维世界也可以被重建模块做精细化校准,两者不再是孤岛。
这种统一还有一个实际优势:数据效率。传统方案里,重建模型需要大量带位姿标注的图片,生成模型需要大量图文对。但如果你用一套三维特征表示同时做两件事,那么在重建任务上学习到的几何先验可以直接助力生成,在生成任务上学到的内容分布也可以辅助重建时的边缘补全和遮挡推理。这有点像多任务学习带来的隐式正则化,整个模型的理解能力会更扎实。
2.3 新视角预测如何成为统一框架的粘合剂
在Atlas的体系里,“新视角预测”是一个非常关键的能力,也是把生成和重建粘在一起的那根线。所谓新视角预测,就是给定一个三维场景表示,任意指定一个新的相机位置,模型能渲染出该视角下物理正确的画面。
如果你做的是重建,那么新视角预测是天然的检验标准:如果一个三维模型能完美预测出所有未见过视角的画面,说明它已经掌握了足够的几何和纹理信息。如果你做的是生成,那么新视角预测是交互的基础:用户希望在一个生成的场景里自由走动,每走一步看到的画面都要连续稳定,这就依赖新视角预测的质量。
Atlas把新视角预测做得比较“活”。它不仅支持用户指定一个离散的视角,还支持沿着一条连续轨迹输出画面,本质上已经具备了一个轻量级实时渲染器的能力。对谈里提到,Atlas生成的场景支持用户实时交互,可以调整相机、可以改变环境光照,这在以前的生成模型里很难做到,因为大多数模型对“场景”的理解还停留在平面像素层面。
3. 从技术路径看Atlas的实现思路
3.1 以三维为中心的处理管线:不像传统pipeline那样先生成再重建
以前我做内容管线的时候,团队最头疼的就是生成和重建模块怎么衔接。比如你想做一个特效场景,通常要先从文本生成一批概念图,再从概念图里选一张做单图三维重建,重建结果往往有各种瑕疵,还得人工修模,修完之后才能进渲染管线。这条pipeline又长又脆,每一步的误差都会向后传导。
Atlas给我的感觉是它想把这个长流程压缩成一个端到端的模型。整个处理以三维特征场为中心:模型接到输入(照片或文本)以后,先在特征空间里构建出一个三维场景表示,然后你做的所有操作——换视角、改光照、编辑物体——都是在这个三维表示上直接完成的,不再需要回到像素层面去“重新画”。
这种设计最大的收益是稳定性。因为三维表示是显式的,所以从任何角度看,场景的几何结构是一致的,不会出现视频生成模型那种“转头就变形”的问题。从工程角度看,这种以三维为中心的pipeline也比模块串联的方式好维护得多,你想调光照就直接调光照参数,想移动物体就直接改三维坐标,不需要逆向推理某个像素是怎么生成的。
3.2 相机位姿与显式几何:Atlas强调的参数细节
我对谈里比较感兴趣的一个技术要点,是Atlas对相机位姿的处理。做过三维重建的人都知道,相机位姿是所有多视角算法的基础,位姿不准,后面的一切都是空中楼阁。Atlas在生成场景时会把相机参数作为显式条件输入,让模型在生成内容的同时“知道”自己是在哪个视角下观察,这跟许多纯生成模型“不管相机随便画”的思路完全不同。
由于相机位姿是显式的,Atlas还能做一件事:把生成出来的三维场景和真实相机轨迹绑定起来。什么意思呢?如果你手里有一段实拍的视频,你可以把它导入Atlas,模型会重建出对应的三维场景。接下来你可以在这个场景里引入生成的物体,或者把场景风格转化成另一种视觉风格,从任何角度渲染都保持统一。
这种做法其实给未来的内容生产提供了一个非常自然的交互方式:真实世界和虚拟世界之间可以互相转换,不再有硬边界。你既可以从真实视频“重建”出场景,也可以在重建结果上“生成”新的内容,整个过程在同一个三维表示下完成。
3.3 与NeRF、3DGS、扩散模型的边界在哪
很多朋友会问,Atlas跟去年很火的3D Gaussian Splatting(3DGS)有什么区别?跟NeRF又有什么关系?我的理解是:Atlas更像是站在NeRF和3DGS肩膀上的下一代框架,但它的目标范围比这两个都大。
NeRF和3DGS解决的核心问题都是“怎么用一个可微表示重建并渲染一个特定场景”。NeRF用的是隐式场,3DGS用的是离散高斯点,两者在各自时代都很出色,但都偏重建、偏静态场景。Atlas则把问题扩展到了生成领域:它不只可以重建一个已有场景,还可以凭空创造一个新场景;不只可以渲染固定视角,还可以支持用户交互式地漫游和编辑。
跟扩散模型比,Atlas的优势在几何一致性,但代价是它的视觉“想象力”可能不如大规模扩散模型那么奔放。扩散模型可以生成天马行空的画面,因为它几乎没有物理约束;Atlas要保证三维一致性,天然会收敛在“物理可行的空间”里。所以我认为两者不是替代关系,而是互补:扩散模型负责灵感发散,Atlas负责把灵感落到稳定的三维空间里。
4. 这波“统一”能落到什么场景
4.1 影视与游戏资产生产管线的变化
如果你在影视或者游戏行业做过资产生产,应该能感受到传统流程的笨重。建一个三维场景,要么靠美术手动建模贴图,一个场景花几周很正常;要么靠实景扫描重建,需要昂贵的数据采集设备,而且数据处理流程冗长。
Atlas这类统一生成与重建的系统,带来的最直接变化是“普通人也能创建高保真三维场景”。你不需要会Maya或者Blender,只需要用自然语言描述你想要的场景,或者拿手机拍一圈视频,就能得到一个可交互的三维场景。对于预可视化、概念设计、虚拟勘景这些环节,效率提升会非常明显。
美术师的角色也会从“手动造轮子”转变成“给AI设定方向和质量标准”。比如团队可以先让Atlas生成一批场景初稿,美术师选择风格方向后,再在生成结果上做精细化调整。这种生产方式处理海量场景需求特别高效,比如开放世界游戏里的大量野外场景、科幻片里的异星地表,都很适合这种管线。
4.2 机器人与具身智能需要的实时空间理解
李飞飞做空间智能,最终的落地场景一定少不了机器人和具身智能。一个机器人要在真实世界里干活,它必须实时理解周围环境的几何结构,知道障碍物在哪、桌面高度多少、抽屉怎么打开。过去这些能力靠的是SLAM、深度估计、occupancy network等一系列模型的组合,每个模型各管一段,工程集成复杂度非常高。
如果能用一套统一的三维特征表示来承载这些能力,机器人只需要维护一个场景表示,各种下游任务——导航、抓取、避障——都从同一个表示里取信息。这种范式简化了系统架构,也增强了鲁棒性。Atlas目前展示的交互式场景漫游,本质上就是在验证这种统一表示的实时性。
虽然目前Atlas还不是一个完整的机器人感知系统,但它证明了方向可行:用一个可微的三维场景表示,可以同时支持人类用户交互和机器自主理解。这对后来做具身智能的团队来说是一个重要信号,未来的机器人大脑很可能不是一堆模型的拼盘,而是一个统一空间感知模型加若干任务头。
4.3 三维内容生成的新入口:从文本到自由视角
从产品形态上看,Atlas带来的最酷体验是“文本直接生成可漫游的3D空间”。以前文生3D也有不少尝试,比如通过分数蒸馏采样让NeRF优化出目标形状,但生成速度慢、成功率低,而且生成结果往往是单体物体,不像一个完整的可进入场景。Atlas的“World”生成能力则直接面向整个场景,用户可以像逛一个微型世界一样在里面移动。
对普通用户来说,这意味着内容消费方式的改变:不再只是看一段视频,而是进入一个可探索的空间。对创作者来说,这意味着叙事方式的改变:你可以设计一个物理空间,让用户在里面自由发现故事线索,而不是被迫跟随导演的镜头移动。这种“空间叙事”在游戏和沉浸式展览里已经有了雏形,但过去制作成本极高,Atlas这类工具把它降到了更低门槛。
5. 几个容易踩的误区和实操层面的思考
5.1 别把Atlas当成SuperRes或者图像生成器
我在一些讨论区看到有人把Atlas跟“AI图片生成最高能做8K吗”这种话题放在一起聊,觉得它能不能生成超高清图片。这里有个误区:Atlas的核心价值不在分辨率,而在三维一致性和交互性。它能生成高分辨率画面,但那是三维渲染的副产品,不是核心卖点。
如果你只是想把一张模糊图变成8K高清图,那应该找专门的超分辨率重建模型,比如一些基于扩散模型的超分工具。如果你是想做图像风格化或者文生图,应该用Stable Diffusion或者Midjourney。Atlas解决的是“可交互三维场景”的问题,拿它的长板去比别人的短板没有意义,反之亦然。
做技术选型的时候,最关键的是认清自己的问题属于哪个维度。二维图像的像素级操作和三维空间的几何级操作是完全不同的需求,选错工具会让你事倍功半。
5.2 显式几何与隐式生成的取舍
Atlas采用的方案是在显式几何结构上做神经渲染,这带来了稳定性,但不是没有代价。显式几何对算力的需求并不低,尤其是在实时交互场景下,每一帧都要做光栅化和特征解码。对谈里也提到,想要达到更流畅的交互体验,还需要在工程层面做大量优化。
相比之下,纯隐式生成模型更“省事”,因为它不维护一个真正的三维结构,所有信息都编码在权重里。但省事的代价是不可控,你不能精确地去移动或者删除场景里的某个物体,因为场景不存在一个显式的实体。Atlas选择显式路线,其实是选择了一条更难但上限更高的路。
从落地角度说,显式表示更友好。美术师可以导出场景的几何结构,程序可以读取物体的空间坐标,一套表示能满足多方需求。我相信未来几年,显式和隐式的边界会越来越模糊,但至少在现阶段,显式几何带来的可编辑性和可控性是很多行业客户最看重的东西。
5.3 对做工程的人意味着什么
聊点接地气的。如果你是一个做图像或者三维方向的工程师,Atlas这类项目给你的信号不是“马上学它的代码”,而是“该往三维统一表示的方向靠”。过去几年CV圈被扩散模型带得很“2D化”,很多人都在做图像生成、视频生成,真正做三维基础模型的团队反而不多。
但空间智能这个方向,接下来一定会有大爆发。因为算力已经够了,数据也有积累,缺的是一个像Atlas这样整合性的框架。一旦验证走通,后续会有大量应用层机会:三维内容电商展示、虚拟现实社交、自动驾驶的空间理解、工业数字孪生……每一个方向都需要一批懂三维表示、懂神经渲染、懂多视角几何的人。
我的建议是,如果你是学生或者刚入行,与其卷一个已经很卷的二维生成方向,不如花点时间研究三维表示和统一场景理解。这个领域门槛高一点,但正因为门槛高,竞争反而没那么拥挤,而且一旦建立起知识体系,护城河会非常深。
另外说点实操层面的体会。我做三维重建这些年,最大的感悟是这个领域没有银弹,任何模型都有自己的适用边界。Atlas很强,但它也不是能解决所有空间问题的万能钥匙。在真正落地项目里,你还是得混合使用传统CV算法、现代神经渲染和大模型能力,保持工具链的灵活性。技术的发展方向是把复杂留给自己,把简单留给用户,但作为使用者,对底层原理的理解始终是帮你做判断的最重要依据。