DreamEdit3D 是慕尼黑工业大学团队的研究成果,一句话概括:你给它一个 3D 物体,再用一句话告诉它想怎么改,它就能保证你从任何角度看,改得都一样。
例如把狗变成猫、给人戴上墨镜、把面包车改成红色跑车、把一只鞋变成一双鞋。
项目页展示了二十多个案例,并和 MVEdit、PrEditor3D、Vox-E 三个同类方法做了对比。
你有没有试过用 AI 给照片里的人"戴上墨镜"?
正面看效果很惊艳。但如果这是一个 3D 模型,你把它转到侧面,墨镜可能变成了一团黑影;转到背面,墨镜直接消失了。
这是 AI 修改 3D 内容时一个老大难问题:它只会"看一个角度"改一个角度。
现在,慕尼黑工业大学的团队做了一个叫DreamEdit3D的项目,专门解决这个问题。
它到底能干什么?
用大白话讲:给它一个 3D 物体,说一句话,它就帮你改,而且从任何角度看都对。
他们展示的案例包括:
把一只狗,改成一只猫(甚至一头猪)
把一辆普通面包车,改成敞篷跑车
️ 给一个人戴上墨镜,或者让他"露齿而笑"
️ 把一张沙发,重新设计成单人座
把一只鞋,变成"一双鞋"
把一只老鹰,变成"两只老鹰"
把一只考拉,变成乐高版考拉
更关键的是,这些修改不会因为你换个角度就翻车。
为什么这件事很难?
打个比方。
假设你有一尊雕塑,想给它戴顶帽子。传统 AI 的做法,相当于让一个人只盯着正面,把帽子画上去;另一个人只盯着侧面,再画一顶帽子。结果两顶帽子大小不一、颜色不同、位置对不上,拼起来就是一场灾难。
DreamEdit3D 的思路是:让 AI 同时看着好几个角度,一起商量着改。所以帽子只有一顶,而且转一圈都在同一个位置。
它还有个巧妙的设计:先让 AI"认识"你的东西
这个项目的另一个关键词叫"个性化"。
AI 修改前,会先"认识"你的这个具体物体,给它起个专属的名字(项目里叫 <asset0>)。有点像你给家里的猫起了名字,以后说"给咪咪戴个帽子",AI 就知道是你家那只,而不是随便一只猫。
这样,改完之后它还是它:狗变成微笑的狗,还是原来那只狗,而不是换成了另一只长得像的。
这意味着什么?
短期内你不会马上用上,但想想这些场景:
- 电商
:同一双鞋换个颜色、换个款式,不用重新拍或重新建模
- 游戏和动画
:角色换装、换表情,不用美术从头做
- 家装设计
:沙发改个样式,直接 360° 预览
- 元宇宙/AR
:人人都能低成本"改造"自己的虚拟物品
过去,改一个 3D 模型是专业美工的活。现在,门槛正在被一句话拆掉。
它是怎么做到的
整体流程分三步:
- 分割
:用 Meta 的 SAM(Segment Anything)对输入的 4 个视角图片做物体分割,拿到每个视角的物体遮罩。
- 个性化训练
:在多视角扩散模型MVDream上,采用类似 GoogleBreak-A-Scene的训练方式,做文本反演(Textual Inversion)+ 模型微调,把物体"压缩"成一个专属 token <asset0>。
- 生成与重建
:输入类似 "a photo of <asset0> smile with teeth" 的提示词,生成多视角一致的编辑结果,再交给GTR提升为带纹理的 3D 网格,输出 GLB/OBJ 格式。
几个值得关注的细节:
- 消融实验
证明每个组件都有贡献:去掉注意力损失、去掉遮罩损失、只用单视角、只用 TI 或只用 DreamBooth,效果都会下降。TI + DreamBooth 的组合效果最好。
- 多样性
:同一个提示词换不同随机种子,可以生成不同的编辑结果(比如四种不同的墨镜),说明它不是"死记硬背"。
- 门槛不算高
:官方给出的验证环境是一张 RTX 3090,约 5 分钟跑完一个例子。默认训练分辨率 256,每阶段 400 步。
- 一个细节
:项目页写的是用 3D Gaussian Splatting 做重建,但开源代码里实际用的是 GTR 生成网格。
需要泼点冷水的地方:
代码里的 GTR 子模块采用Snap 非商业许可,所以 3D 提升这一环仅限非商业研究使用,想商用得另做处理。
输入是 4 视角、512×512 的分割图,离"随手拍一段视频就能改"还有距离。
目前仓库刚公开,GitHub 上还没有什么热度,实际效果需要社区检验。
更多transformer,VIT,swin tranformer 参考头条号:人工智能研究所 v号:人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程