[论文解读] Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding
本文介绍了跨房间(Room-across-Room, RxR)数据集,这是一个大规模、多语言的视觉与语言导航数据集,具备密集的时空定位,其中指令中的每个词语均与智能体的3D位姿序列时间对齐。该数据集包含英语、印地语和泰卢固语共12.6万条指令,附带人类跟随者示范和细粒度视觉定位,通过多任务学习和位姿感知注意力机制,显著提升了单语和多语言智能体的性能,在未见过的环境中实现了最先进水平的结果。
We introduce Room-Across-Room (RxR), a new Vision-and-Language Navigation (VLN) dataset. RxR is multilingual (English, Hindi, and Telugu) and larger (more paths and instructions) than other VLN datasets. It emphasizes the role of language in VLN by addressing known biases in paths and eliciting more references to visible entities. Furthermore, each word in an instruction is time-aligned to the virtual poses of instruction creators and validators. We establish baseline scores for monolingual and multilingual settings and multitask learning when including Room-to-Room annotations. We also provide results for a model that learns from synchronized pose traces by focusing only on portions of the panorama attended to in human demonstrations. The size, scope and detail of RxR dramatically expands the frontier for research on embodied language agents in simulated, photo-realistic environments.
研究动机与目标
- 为解决现有在照片级真实感3D环境中缺乏多语言、大规模且细粒度定位的视觉-语言导航数据集的问题。
- 通过引入更多样化和更长的导航路径,减少现有数据集(如R2R)中存在的路径偏差。
- 实现语言指令与3D视觉位姿之间在词级别的密集对齐,提升定位准确性和智能体性能。
- 提供完整位姿轨迹的人类跟随者示范,以支持从自然导航行为中学习。
- 通过包含语言类型差异显著的语言(英语、印地语、泰卢固语)及母语者生成的指令,推动多语言具身语言理解的研究。
提出的方法
- RxR数据集由来自美国(en-US)、印度(en-IN)和泰卢固语地区母语者生成三种语言的原始导航指令。
- 导览员在Matterport3D环境中沿预设路径行走并口头发布指令,后续通过自定义标注工具将指令转录并时间对齐至其3D位姿序列。
- 每个指令词语均与特定的虚拟位姿及全景图中的视觉区域关联,实现在词级别的细粒度时空定位。
- 通过让人类参与者从导览员视角跟随相同指令,收集其完整的3D位姿轨迹作为跟随者示范。
- 基线模型采用改进的强化交叉模态匹配智能体,结合多模态注意力机制进行训练,并在单语和多语言设置下进行评估。
- 通过在RxR和R2R数据上联合训练,应用多任务学习;消融研究评估视觉与语言模态的贡献。
实验结果
研究问题
- RQ1与粗粒度或无定位相比,词级别密集时空定位在多大程度上提升了视觉-语言导航性能?
- RQ2在多种语言(英语、印地语、泰卢固语)上进行多语言预训练,能在多大程度上提升视觉-语言导航的零样本泛化能力和鲁棒性?
- RQ3能够捕捉人类对指令理解的跟随者示范轨迹,是否能超越导览路径本身,提升智能体训练与泛化性能?
- RQ4将RxR与R2R数据结合进行多任务学习时,其有效性如何?两者数据集之间的迁移学习动态是怎样的?
- RQ5在多语言视觉-语言导航中,视觉与语言模态对智能体性能的相对贡献如何?它们与定位监督之间又如何相互作用?
主要发现
- 在RxR测试标准划分上,基于RxR训练的多语言智能体达到77.2%的成功率,显著优于随机基线(0.7%),并接近人类表现(90.2%)。
- 在RxR和R2R数据上联合进行多任务训练,提升了所有指标的性能,且在两个数据集上均取得最佳结果,表明数据具有互补性。
- 使用跟随者示范轨迹可提升智能体性能,优于仅使用导览路径,表明人类对指令的理解模式对训练具有重要价值。
- 通过视觉注意力实现的时空定位监督效果不一:NDTW和NE得分有所提升,但未见环境中的成功率指标下降,表明存在复杂的权衡。
- 仅语言模态的智能体优于仅视觉模态的智能体,表明即使无视觉输入,语言线索(如“向左转”或“上楼”)仍携带有意义的导航信息。
- 消融研究证实,视觉与语言模态对最优性能均不可或缺,多模态模型显著优于单模态基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。