[论文解读] Diagnosing Vision-and-Language Navigation: What Really Matters
该论文通过受控的消融研究诊断视觉-语言导航(VLN)智能体,发现室内智能体依赖于指令中的物体和方向,而室外智能体则过度依赖方向线索。基于Transformer的模型在跨模态对齐和数值推理方面表现更优,但视觉与语言之间注意力不平衡削弱了其宣称的视觉-语言对齐效果。
Vision-and-language navigation (VLN) is a multimodal task where an agent follows natural language instructions and navigates in visual environments. Multiple setups have been proposed, and researchers apply new model architectures or training techniques to boost navigation performance. However, there still exist non-negligible gaps between machines' performance and human benchmarks. Moreover, the agents' inner mechanisms for navigation decisions remain unclear. To the best of our knowledge, how the agents perceive the multimodal input is under-studied and needs investigation. In this work, we conduct a series of diagnostic experiments to unveil agents' focus during navigation. Results show that indoor navigation agents refer to both object and direction tokens when making decisions. In contrast, outdoor navigation agents heavily rely on direction tokens and poorly understand the object tokens. Transformer-based agents acquire a better cross-modal understanding of objects and display strong numerical reasoning ability than non-Transformer-based agents. When it comes to vision-and-language alignments, many models claim that they can align object tokens with specific visual targets. We find unbalanced attention on the vision and text input and doubt the reliability of such cross-modal alignments.
研究动机与目标
- 研究视觉-语言导航智能体在决策过程中如何解释多模态输入。
- 识别智能体在导航过程中是否依赖指令中的物体、方向或数值线索。
- 评估最先进模型所宣称的视觉-语言对齐的可靠性。
- 诊断室内(R2R, RxR)与室外(Touchdown)导航环境之间智能体行为的差异。
- 评估模型架构(尤其是Transformer)对跨模态理解与推理的影响。
提出的方法
- 通过遮蔽或替换指令中的物体、方向和数值词进行反事实干预。
- 通过动态遮蔽环境中的物体区域或翻转视角图像施加视觉扰动。
- 通过干预后的导航成功率下降程度来推断智能体对特定输入模态的依赖程度。
- 在R2R、RxR和Touchdown数据集上,对比基于Transformer的智能体(如BERT-based)与非Transformer基线模型。
- 采用消融设置:动态遮蔽视觉物体、受控实验以及完整词遮蔽,以隔离模态依赖性。
- 通过比较物体词被替换与被遮蔽时的性能下降程度,评估视觉-语言对齐效果,假设对齐意味着对词更改敏感。
实验结果
研究问题
- RQ1在导航过程中,VLN智能体在多大程度上依赖语言指令中的物体词而非方向词?
- RQ2在输入扰动下,VLN智能体在室内与室外环境中的表现有何差异?
- RQ3基于Transformer的智能体是否展现出强于非Transformer模型的跨模态理解与数值推理能力?
- RQ4最先进VLN模型所宣称的视觉-语言对齐是否可靠,还是注意力在文本或视觉上存在不平衡?
- RQ5智能体对视觉物体遮蔽与文本物体遮蔽的响应有何不同,这揭示了模态注意力的何种特征?
主要发现
- 室内导航智能体在决策中同时使用物体和方向词,当指令中的物体词被遮蔽时,性能最高下降36%。
- 室外导航智能体严重依赖方向词,当物体词被替换时性能仅下降不足10%,表明其对物体理解能力较差。
- 基于Transformer的智能体展现出更强的数值推理能力,在R2R数据集中当数值词被遮蔽时,成功率下降21%,显著高于非Transformer模型。
- 尽管宣称具有强视觉-语言对齐,但视觉物体遮蔽仅导致5–13%的性能下降,而文本物体替换则导致20–48%的下降,表明注意力明显偏向文本。
- 即使指令中提及的所有视觉物体都被遮蔽,R2R上的成功率仍保持在44%以上,RxR-en上保持在32%以上,与视觉定位可靠的假设相矛盾。
- 当物体词被替换时,智能体性能显著劣于视觉遮蔽情况,表明视觉-语言对齐并不稳健,可能仅是表面现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。