Skip to main content
QUICK REVIEW

[论文解读] Are We There Yet? Learning to Localize in Embodied Instruction Following

Shane Storks, Qiaozi Gao|arXiv (Cornell University)|Jan 9, 2021
Multimodal Machine Learning Applications参考文献 25被引用 7
一句话总结

本文提出了一种基于 BERT 的空间定位模块,通过使用全景视觉输入和物体分割掩码来预测智能体相对于目标的相对角度,从而在 ALFRED 基准测试中提升了具身指令遵循能力。该方法在强基线基础上提升了动作预测准确率与导航成功率,但性能仍低于提供真实方向的最优解(oracle),表明导航智能体在空间推理方面仍有较大提升空间。

ABSTRACT

Embodied instruction following is a challenging problem requiring an agent to infer a sequence of primitive actions to achieve a goal environment state from complex language and visual inputs. Action Learning From Realistic Environments and Directives (ALFRED) is a recently proposed benchmark for this problem consisting of step-by-step natural language instructions to achieve subgoals which compose to an ultimate high-level goal. Key challenges for this task include localizing target locations and navigating to them through visual inputs, and grounding language instructions to visual appearance of objects. To address these challenges, in this study, we augment the agent's field of view during navigation subgoals with multiple viewing angles, and train the agent to predict its relative spatial relation to the target location at each timestep. We also improve language grounding by introducing a pre-trained object detection module to the model pipeline. Empirical studies show that our approach exceeds the baseline model performance.

研究动机与目标

  • 通过增强空间定位与语言对齐能力,提升在连续、逼真视觉环境中的具身指令遵循能力。
  • 解决在 ALFRED 基准测试中,利用自然语言指令与视觉输入导航至目标位置的挑战。
  • 缩小学习到的空间追踪性能与提供真实目标方向的最优解(oracle)之间的差距。
  • 评估全景视觉输入、物体分割掩码以及基于 Transformer 的定位模块在提升导航与动作预测性能方面的有效性。

提出的方法

  • 在每个导航时间步,增强智能体的输入,加入全景视觉观测与完整物体分割掩码。
  • 引入预训练的目标检测模块,通过将指令与视觉物体关联,提升语言对齐能力。
  • 提出一种基于 BERT 的空间定位模块,用于预测智能体相对于目标位置的方位角正弦与余弦值。
  • 使用 BERT 的 [CLS] token 表示,端到端训练该定位模块,回归至目标的方位角方向。
  • 采用逐步训练范式,提升动作序列预测的保真度。
  • 采用多任务学习设置,使定位头与主动作预测头同时进行训练。

实验结果

研究问题

  • RQ1学习到的空间定位模块是否能在具身指令遵循任务中,超越标准基线,提升导航性能?
  • RQ2在导航过程中提供真实空间方向(oracle)时,可实现多大的性能增益?
  • RQ3全景视觉输入与物体分割掩码在多大程度上提升了空间推理与动作预测能力?
  • RQ4基于 Transformer 的定位头在估计智能体与目标相对朝向方面,是否优于更简单的基线模型?

主要发现

  • 与基线相比,所提出的基于 BERT 的定位器在已见房间中将逐动作 F-measure 提升 9.3%,在未见房间中提升 13.1%。
  • 该模型在导航子目标成功率方面相比基线有轻微提升,但与最优解(oracle)相比仍存在显著差距。
  • 采用真实方向信息的最优解空间追踪方法,在导航子目标成功率与目标达成率方面均带来显著性能提升。
  • 细致的、分步训练显著提升了动作预测的精确度,但对整体导航或目标达成率的提升作用有限。
  • 学习到的定位器与最优解之间的性能差距表明,当前的空间推理方法仍有巨大改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。