Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
2026/9/7 19:15:06 网站建设 项目流程

该文章提出了一个名为Situat3DChange的情境化3D变化理解数据集,并设计了对应的3D多模态大语言模型SCReasoner,旨在解决现有3D数据集在动态场景与情境融合理解上的不足,推动人机协作在动态环境中的应用。

一、文章主要内容总结

1. 研究背景与问题

现有3D数据集存在两大局限:一是侧重静态场景或孤立动态场景,缺乏情境感知;二是多依赖合成数据,缺失真实环境中的细微日常变化,且人机对空间关系的认知存在差异(如机器人用笛卡尔坐标系,人类用圆柱坐标系),导致难以形成共享心智模型。

2. Situat3DChange数据集
  • 数据规模与构成:基于903组真实世界扫描对,包含17.4万组配对数据,涵盖三大任务——12.1万组问答对(QA)、3.6万组变化描述、1.7万组重置指令,均源于1.1万条人类标注。
  • 核心设计:融合自我中心视角(如第一人称位置、方向)与客体中心视角(如物体间空间关系),结合类别与坐标空间信息,遵循“感知-行动”模型,实现情境化动态场景理解。
  • 数据质量控制:由7名有视障人群协助经验的标注者完成基础标注,再通过LLM(如GPT-4)扩展空间信息,同时通过交叉验证确保QA准确性,针对距离评估提出修订版REL指标避免计算偏差。
3. SCReasoner模型

    需要专业的网站建设服务?

    联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

    立即咨询