当机器人学会走路,却依然找不到答案
2026/9/10 5:35:22 网站建设 项目流程

先讲个场景。

你养了一条机器狗,它已经学会了在你家里到处溜达,绕开茶几,钻过门缝,走到你指的任何一个房间都不带撞墙的。厉害吧?现在你问它:"帮我看看客厅那个黑色沙发是不是脏了。"

它愣住了。

不是它不会走路,而是它不知道该往哪走,走完之后该记住什么,走了五个房间之后该不该放弃。这就是今天要聊的这篇论文想解决的问题:一个能走的身体,和一个会想的脑子,怎么才能真正配合起来干成一件复杂的事。

**这篇论文的作者来自上海交通大学、阿里巴巴通义千问团队、阿德莱德大学、北京大学、清华大学等机构,他们给这个问题起了个名字,叫NavMCP。**

它要解决的具体任务叫EQA

*EQA(Embodied Question Answering,具身问答):让一个机器人在物理环境里到处走动,去寻找视觉证据,然后回答一个跟环境有关的问题,比如"卧室灯是开着的吗"。*

这事听起来简单,做起来很难。因为答案往往不在你面前,你得先找到它。

先说说这个领域此前卡在哪。在NavMCP出现之前,最强的方法叫FAST-EQA,在HM-EQA这个基准测试上能拿到69.2%的准确率。而ToolEQA只有62.3%,Memory-EQA在另一个数据集MT-HM3D上是43.1%。这些数字看起来还行,但你换个角度想:每答10道题,FAST-EQA还要错3道。放在真实世界里,这意味着机器人有近三分之一的概率,跑遍了整个房子,最后给你一个错的答案。

问题出在哪呢?论文作者观察到一个很有意思的现象。

现在做具身智能的模型分成两大阵营。一边是VLM

*VLM(Vision-Language Model,视觉语言模型):能看图、能读文字、能推理的AI模型,比如GPT-4V这类,擅长判断"还缺什么信息""该去哪找",但让它直接控制机器人的每一步移动,就会变得笨拙又低效。*

另一边是NFM

*NFM(Navigation Foundation Model,导航基础模型):专门训练来执行"走到某个地方"这类导航任务的模型,比如论文里用到的Qwen-RobotNav,它能稳定地把一句话指令变成一段真实的移动轨迹,但它自己不会规划长期任务,也不记得之前发生了什么。*

这两者其实是互补的。VLM懂得"想什么",NFM懂得"怎么走"。问题是,怎么把它们粘合起来?

**直接把NFM当成一个普通的"工具调用"来用,是行不通的。**

论文里管这个叫"episodic interface gap",翻译过来就是"一次性调用接口的缺口"。具体来说有三个坑。

第一个坑,是指令和意图对不上。你让NFM执行一条"走到厨房"的指令,这条指令没法承载agent真正想表达的意图,比如"我在找一个咖啡机,如果找不到就换个地方看看",这种带条件、带目的、带预算的复杂需求,一句路线指令根本装不下。

第二个坑,是中间观察全丢了。机器人走过去的路上,可能路过了一个物体,瞥见了半开的门,这些信息如果只在任务完成后返回一个"成功"或"失败"的状态,中间看到的一切就全部作废了。

第三个坑,是没有跨轮记忆。每次调用NFM都是独立的一次性交易,它不知道你之前搜过哪些房间,排除过哪些猜测,留下过什么疑点。

这三个坑加起来,会导致什么后果?论文里做了一个关键实验,把NavMCP换成一个纯粹的"一次调用一次返回"的episodic接口,其他条件完全不变,准确率直接从74.0%掉到59.1%,跌了14.9个百分点。

**这14.9个百分点,就是这三个坑加起来的真实代价。**

想象一下,你雇了个特别聪明的侦探帮你找丢失的钥匙,但你们之间的沟通方式是:你说一句"去卧室看看",侦探进去转一圈,出来只告诉你"没找到",中间路过客厅时看到的那个可疑的包,看到的那扇没关的窗户,全部不告诉你。而且每次派他去一个新地方,他都完全忘记之前去过哪儿。这样的侦探再聪明,破案效率也会大打折扣。如果不解决这三个坑,再强的VLM也只是在盲人摸象。

三条通道,把断裂的沟通接起来

NavMCP的解法,是设计了三条通道,专门用来补上这三个坑。

第一条叫意图通道。

VLM不再需要直接控制机器人的每一步,它只需要发出一个结构化的"语义导航调用",里面写清楚模式、目标、预算、限制条件。比如"搜索厨房台面,找咖啡机,最多走64步"。这个调用支持两种模式,一种是navigate_to_object,指名要找什么物体;另一种是navigate_by_instruction,描述一段路线或一个区域范围。

这就好比你给外卖骑手发指令,不是让他每一步都听你指挥往左拐往右拐,而是直接告诉他"送到3号楼502,预计20分钟内到",剩下的路线规划交给他自己判断。如果反过来,你事无巨细地遥控骑手每一步动作,效率反而会更低,而且骑手一旦遇到你没预料到的岔路,就会卡住。

第二条叫观察通道。

它解决的是"路上看到的东西不能丢"这个问题。执行器每完成一次导航,会沿途每隔4步采样一次画面,最多保留16张关键帧,然后用一个VLM把这些画面转换成一份"有据可查的旅程记录",里面写清楚走过了哪些房间、看到了哪些物体、还有哪些出口没探索过。

关键的是,每一条物体或房间的描述,都必须绑定到具体的某一张源图片上,还要标注置信度。论文里特别强调,这个总结器被明确要求"只报告视觉上真实观察到的证据,明确标注不确定性,不要把单次视角里没看到,就当成确定的否定证据"。

这一点其实很值得琢磨。你去朋友家找一本书,进了卧室扫了一眼没看到,你能不能直接断定"这本书绝对不在这个房间"?不一定,可能它就藏在你没扫到的书架背面。这就是为什么系统要求"否定证据"必须来自系统性的、覆盖到位的搜索,而不是一眼没看见就草率下结论。如果不做这个区分,机器人很容易把"暂时没看见"误判成"根本不存在",进而给出错误答案。

第三条叫记忆通道。

这条通道把观察通道产出的证据,沉淀成一份可持续更新的状态,论文里叫EQA context state,里面包含三块内容:一份紧凑的交互历史,一份带来源标注的证据台账,还有一份"待办事项清单",记录还没解决的搜索目标。

这就像你破案时随身带的笔记本,每查完一个地方,就把"客厅:已查,无黑沙发"这样的结论写下来,而不是全靠脑子记。等你查到第五个房间时,翻开笔记本一眼就知道前四个房间的结果,不用再靠回忆去拼凑。系统还有个"保守压缩策略":只有当信息已经被提炼进证据台账之后,原始的、冗长的工具返回记录才会被精简替换掉。这样即使上下文长度受限需要裁剪,裁掉的也是已经被消化过的原始数据,而不是关键结论。

三条通道合起来,机器人从"一次性完成一个任务的执行器",变成了"能持续积累经验的搭档"。图3里画得很直观:VLM先冒出一个疑问"需要确认下灯是否开着",通过意图通道变成结构化的导航调用;执行器跑完一趟,通过观察通道把"卧室已进入""台灯已发现""状态待确认"这样的结果反馈回来;最后通过记忆通道,把这些结论写进下一轮决策要用的状态里。

数据说话:三个基准测试全面领先

方法讲完了,效果到底怎么样?

论文在三个EQA基准上做了测试。HM-EQA包含500道选择题,覆盖267个HM3D场景;MT-HM3D引入了需要跨房间比较的多目标问题;EXPRESS-Bench则包含2044道开放式问题,用LLM Score评判答案质量,用Epath评判探索路径的效率。

| 方法 | HM-EQA准确率 | MT-HM3D准确率 | EXPRESS-Bench LLM Score |

|---|---|---|---|

| Explore-EQA | 58.4% | 36.2% | – |

| Memory-EQA | 61.4% | 43.1% | – |

| ToolEQA | 62.3% | – | 65.77 |

| FAST-EQA | 69.2% | 50.5% | 68.7 |

| **NavMCP(本文)** | **76.7%** | **54.4%** | **79.27** |

NavMCP在HM-EQA上比FAST-EQA高出7.5个百分点,在MT-HM3D上高出3.9个百分点,在EXPRESS-Bench上高出10.57分。而且更让人意外的是,这些提升并不是靠堆砌更多计算换来的。

论文设计了一套步数核算方法,专门用来衡量"高层决策的效率"。简单说,就是数VLM需要动多少次脑子,而不是数机器人的物理步数。按照这套核算,NavMCP在HM-EQA和MT-HM3D上用的归一化步数只有0.15和0.19,是所有方法里最低的。也就是说,NavMCP不仅答得更准,思考的次数还更少。

为了排除"是不是因为对比的模型本身太弱"这种质疑,论文还专门做了一次对齐实验:让Explore-EQA、ToolEQA、FAST-EQA和NavMCP全部用同一个Qwen3.5-397B-A17B作为推理大脑,跑一样的场景、一样的初始状态、一样的预算。结果NavMCP还是以74.0%的准确率领先,比排名第二的FAST-EQA复现结果高出10.5个百分点。

这说明什么?说明领先的不是"用了更强的大模型",而是这套三通道协作机制本身在起作用。

VLM和NFM谁也离不开谁

论文还做了一组特别有意思的对照实验,专门验证"VLM大脑"和"NFM身体"是不是真的互补,而不是随便哪个强就行。

固定住导航执行器不变,只升级上层的推理能力:完全没有agent介入,只让VLM看初始画面直接回答,准确率只有38.2%;给它一次全景扫描的机会,涨到58.4%;再给一个固定探索循环的"反应式"agent,涨到62.0%;换成完整的Qwen3.5协调框架,直接跳到74.0%;再换成Qwen3.6-Plus,涨到76.7%。

反过来,固定住完整的VLM+NavMCP框架不变,只升级下层导航能力:随机游走只有60.9%;用前沿探索算法(Frontier Exploration)能到65.3%;换成StreamVLN能到69.3%;换成Qwen-RobotNav-4B能到73.3%;换成8B版本,74.0%。

**这两组数据摆在一起,结论就很清楚了:单边变强都撑不起整体表现,两边必须一起进步。**

这跟很多人对"越大越好"的直觉认知是有出入的。你可能以为只要换个更强的大模型接口,成绩就能突飞猛进,但数据显示,如果执行层还是随机游走,哪怕大脑再聪明也只能拿到60.9%左右的分数。反过来,哪怕执行器再精准,没有一个能持续规划、积累证据的大脑在上面协调,分数直接腰斩到38.2%。这就好比一个乐队,主唱唱得再好,如果鼓手一直乱打节拍,整首歌照样毁掉;反过来鼓手再稳,主唱一直跑调,观众也听不下去。

论文里图4展示了一个真实的搜索过程,题目是"找一个小黑沙发"。机器人先后搜索了五个房间,在每个房间都留下否定证据,避免重复搜索,最后在第20回合切换成针对物体的精准搜索,在第25回合于卧室角落找到了目标。整个过程中,距离目标的曲线是非单调的,机器人不断远离目标去排除其他可能的房间,最后才收敛到答案上。这种"看似绕远路,实则在排除干扰项"的行为,恰恰体现了这套系统真正在做主动的证据驱动搜索,而不是盲目瞎撞。

拆掉每一块积木,看看谁在扛大梁

光看整体效果还不够,论文进一步做了消融实验,逐一拆掉三条通道的某个部件,看每一块到底贡献了多少。

| 拆掉的部分 | 准确率 | 相比完整系统的下降 |

|---|---|---|

| 完整系统 | 74.0% | – |

| 换成一次性episodic接口 | 59.1% | -14.9 |

| 观察通道只返回终止状态 | 68.1% | -5.9 |

| 去掉旅程分析总结 | 69.6% | -4.4 |

| 去掉EQA上下文状态 | 69.4% | -4.6 |

| 关键帧稀疏采样 | 71.2% | -2.8 |

| 只保留一种导航模式 | 72.0% | -2.0 |

| 去掉上下文压缩 | 73.1% | -0.9 |

| 去掉物体放大检查工具 | 73.4% | -0.6 |

从这张表能看出,观察通道和记忆通道贡献最大,各自单独拆掉都会损失4到6个百分点。这符合直觉:如果机器人走过一段路却什么都记不住,那走再多趟也是在原地打转。

论文的按类别分析也很有意思。存在性问题(问某物存不存在)和识别问题准确率都超过80%,状态判断问题也有77.2%,但计数类问题只有65.0%,是最弱的一项。原因是多张关键帧可能拍到了同一个物体,机器人容易把重复看到的同一个东西误当成好几个不同的物体来数。这提示未来还需要更强的跨视角物体关联能力。

从虚拟仿真走到真实机器狗

前面所有实验都是在仿真环境里跑的,论文还专门在一台Unitree Go2真实机器狗上做了实测,验证这套方法能不能扛住现实世界的传感器噪声、里程计漂移和长距离行走的挑战。

实验设计了六种任务,分成三个难度档:低难度是单房间内的证据搜集,比如查一个背包上的品牌标志;中难度是跨房间搜索,比如查会议室里屏幕投影的验证码;高难度是超过20米的开放场景探索,比如数电梯厅里有几部电梯。

| 难度层级 | 反应式基线 | Frontier探索基线 | NavMCP |

|---|---|---|---|

| 低(单房间) | 80% | 70% | **90%** |

| 中(跨房间) | 35% | 60% | **85%** |

| 高(超20米) | 0% | 15% | **60%** |

| 总体 | 38.3% | 48.3% | **78.3%** |

这张表最值得琢磨的地方,是随着任务难度上升,NavMCP的优势不是线性扩大,而是加速扩大。在最简单的单房间任务里,NavMCP领先反应式基线只有10个百分点;到了跨房间搜索,领先扩大到25个百分点甚至更多;到了超过20米的长距离任务,反应式基线直接归零,而NavMCP还能保住60%的成功率,领先幅度扩大到45个百分点以上。

这个现象背后的道理不难理解。任务越短,就算没有记忆能力,靠运气蒙对的概率也不低。但任务一旦拉长,需要多轮搜索、多次排除、跨房间比对信息,没有记忆和持续规划能力的系统就会迅速崩溃,因为它每走一步都在"失忆重启"。这就像考试,一道选择题就算瞎蒙也有四分之一的机会对,但一道需要连续推理五个步骤的大题,只要中间有一步断片,全盘皆输。

论文里附了一个特别长的真实案例:用户让机器人去一家叫Cotti Coffee的咖啡店,查看自己是否落下了一把绿色雨伞,还要留意路上看到的有趣的东西。整个轨迹超过50米,机器人先观察周围环境获取初始定位,识别关键地标后决定右转,穿过走廊,中途还发现了一个新地标"阿里巴巴logo",最终锁定咖啡店位置,走近后确认看到了绿色雨伞。这个过程完整走了34个回合的规划与执行循环,是仿真实验里从未测过的超长距离场景,也直观展示了这套三通道协作机制在真实世界里到底是怎么运作的。

写在后面

读完这篇论文,最触动我的一点,其实不是这套三通道设计本身有多精巧,而是那14.9个百分点的对比实验揭示的一件事:很多AI系统看起来"能力不足",可能压根不是模型不够聪明,而是接口设计砍掉了它本该拥有的信息。同样的VLM,同样的NFM,仅仅因为中间的沟通协议从"一次性黑盒调用"换成"带记忆、带证据、带意图"的协作机制,准确率就能差出15个百分点。这提醒我一件事:升级AI系统,未必总要换更大的模型,有时候只是把两个已经足够聪明的模块之间的沟通方式理顺,收益就已经很可观了。

另一个让我意外的细节,是论文里那条"否定证据"的判定规则。系统被明确要求,不能因为"这一眼没看到"就断言"东西不存在",必须要有系统性搜索覆盖的支撑才能下否定结论。这其实是个很朴素但常被忽略的认知陷阱,人类自己判断事情的时候也经常犯,觉得"我扫了一眼没看见"就等于"不存在"。把这条规则显式写进AI系统的设计里,某种程度上也是在提醒我们自己该怎么更严谨地下结论。

真实机器人实验里那条"难度越高、优势越大"的曲线,也让我重新想了一下"长期记忆"这件事的价值到底体现在哪。短任务里差距不明显,长任务里差距炸开,这说明记忆和持续规划能力不是锦上添花的功能,而是决定一个系统能不能扛住复杂世界的分水岭。

那条会走路却不知道该记住什么的机器狗,如果有一天它真的养成了边走边想边记的习惯,你会先问它什么问题?

Q&A

Q1:NavMCP是什么?

A:NavMCP是一个脚手架式框架,把负责推理的VLM大脑和负责导航执行的NFM导航基础模型结合起来,通过意图、观察、记忆三条通道让二者协作完成需要长时间探索的物理世界任务,比如具身问答。

Q2:NavMCP在实验中表现如何?

A:在三个EQA基准测试里全部达到最优,HM-EQA准确率76.7%,比此前最强方法FAST-EQA高7.5个百分点;真实机器狗测试总成功率78.3%,且任务越长优势越明显,最高领先45个百分点。

Q3:为什么普通的工具调用接口不够用?

A:普通的一次性调用只返回成功或失败的终止状态,会丢失路上看到的中间信息,也没法承载复杂的搜索意图,更不能在多次调用之间积累经验。论文实验显示换成这种简单接口后准确率直接跌了14.9个百分点。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询