[论文解读] A Dataset for Interactive Vision-Language Navigation with Unknown Command Feasibility
本文提出了MoTIF,一个面向移动应用的新视觉-语言导航数据集,包含可行与不可行的自然语言指令,配备细粒度的可行性标注及后续问题。该研究提出了交互式可行性预测这一新任务,证明了视觉理解对准确性的关键作用,并对当前最先进方法进行了基准测试,揭示了在未见过的应用环境中的显著泛化挑战。
Vision-language navigation (VLN), in which an agent follows language instruction in a visual environment, has been studied under the premise that the input command is fully feasible in the environment. Yet in practice, a request may not be possible due to language ambiguity or environment changes. To study VLN with unknown command feasibility, we introduce a new dataset Mobile app Tasks with Iterative Feedback (MoTIF), where the goal is to complete a natural language command in a mobile app. Mobile apps provide a scalable domain to study real downstream uses of VLN methods. Moreover, mobile app commands provide instruction for interactive navigation, as they result in action sequences with state changes via clicking, typing, or swiping. MoTIF is the first to include feasibility annotations, containing both binary feasibility labels and fine-grained labels for why tasks are unsatisfiable. We further collect follow-up questions for ambiguous queries to enable research on task uncertainty resolution. Equipped with our dataset, we propose the new problem of feasibility prediction, in which a natural language instruction and multimodal app environment are used to predict command feasibility. MoTIF provides a more realistic app dataset as it contains many diverse environments, high-level goals, and longer action sequences than prior work. We evaluate interactive VLN methods using MoTIF, quantify the generalization ability of current approaches to new app environments, and measure the effect of task feasibility on navigation performance.
研究动机与目标
- 解决视觉-语言导航研究中命令被假设为可行的缺口,即使现实世界中的请求可能存在歧义或不可能实现。
- 创建一个可扩展、真实的移动应用交互式视觉-语言导航数据集,其中涉及复杂的、改变状态的操作,如点击、输入文字和滑动。
- 提出并基准化多模态、交互式环境中可行性预测的新问题。
- 评估视觉-语言导航方法在未见过的应用环境中的泛化能力,并分析任务可行性对导航性能的影响。
- 通过后续问题支持不确定性消解的研究,以应对模糊或不可行的任务。
提出的方法
- MoTIF数据集收集了自然语言指令、应用屏幕图像、视图层次结构(后端结构)以及操作坐标(点击、轻触、滚动、文本输入)等多个移动应用环境中的数据。
- 每个指令均标注了二元可行性标签,并附带子类别注释,解释其为何不可行(例如,功能缺失、语言模糊、状态依赖)。
- 收集了后续问题,以模拟人类对话方式来解决任务不确定性。
- 提出了一种可行性预测的基线模型,利用多模态输入(视觉与语言)对指令的可行性进行分类。
- 在MoTIF上评估了现有视觉-语言导航方法(Seq2Seq、MOCA、Seq2Act)在任务自动化中的表现,比较了在有无高层目标和低层指令情况下的性能。
- 通过大量消融实验,评估了视觉、语言和应用探索在可行性预测与动作序列生成中的作用。
实验结果
研究问题
- RQ1视觉-语言模型能否在指令模糊或所需功能缺失的情况下,准确预测自然语言指令在移动应用环境中的可行性?
- RQ2不同输入模态——高层目标、低层指令和视觉输入——如何影响视觉-语言导航模型在未见过的应用环境中的性能与泛化能力?
- RQ3任务可行性在多大程度上影响导航性能?当模型面对不可行指令时,其失败模式是什么?
- RQ4后续问题能否有效解决模糊或不可行指令中的不确定性?它们如何提升模型的鲁棒性?
- RQ5当在MoTIF的多样化且具有挑战性的测试集上测试时,现有视觉-语言导航方法在新应用环境中的泛化能力如何?
主要发现
- 视觉输入对准确的可行性预测至关重要,仅依赖语言或应用图标的模型性能低于使用多模态视觉特征的模型。
- 可行性预测中表现最佳的模型在未见过的应用上实现了51.1%的完整序列准确率和21.3%的定位准确率,表明仍有巨大提升空间。
- 模型在新任务上的泛化能力显著优于在新应用环境中的泛化能力,凸显了零样本应用泛化的关键挑战。
- 低层的逐步指令显著提高了动作和定位准确率(例如,Seq2Act模型在仅使用低层指令时达到97.3%的动作准确率),远超仅使用高层目标的情况。
- 即使同时提供高层和低层输入,模型在未见过的应用上性能仍会下降,表明训练过程中需要更多的应用内探索以提升鲁棒性。
- 先前基于应用特定表示学习的方法(如使用应用图标)并未取得最佳性能,凸显了视觉理解相较于领域特定特征的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。