Skip to main content
QUICK REVIEW

[论文解读] FILM: Following Instructions in Language with Modular Methods

So-Yeon Min, Devendra Singh Chaplot|arXiv (Cornell University)|Oct 12, 2021
Multimodal Machine Learning Applications参考文献 34被引用 14
一句话总结

FILM 提出了一种模块化、结构化的具身指令跟随方法,通过构建环境的语义地图并使用语义搜索策略引导探索,实现了在 ALFRED 基准测试中的最先进性能(24.46% 的成功率),且无需专家轨迹或低水平语言指令。该方法通过显式建模空间记忆和目标导向搜索,提升了长时程任务的执行能力。

ABSTRACT

Recent methods for embodied instruction following are typically trained end-to-end using imitation learning. This often requires the use of expert trajectories and low-level language instructions. Such approaches assume that neural states will integrate multimodal semantics to perform state tracking, building spatial memory, exploration, and long-term planning. In contrast, we propose a modular method with structured representations that (1) builds a semantic map of the scene and (2) performs exploration with a semantic search policy, to achieve the natural language goal. Our modular method achieves SOTA performance (24.46 %) with a substantial (8.17 % absolute) gap from previous work while using less data by eschewing both expert trajectories and low-level instructions. Leveraging low-level language, however, can further increase our performance (26.49 %). Our findings suggest that an explicit spatial memory and a semantic search policy can provide a stronger and more general representation for state-tracking and guidance, even in the absence of expert trajectories or low-level instructions.

研究动机与目标

  • 解决基于端到端、模仿学习的方法在具身指令跟随任务中依赖专家轨迹和低水平语言监督的局限性。
  • 通过显式建模空间记忆和结构化状态追踪,提升长时程导航与任务执行能力。
  • 探究模块化、结构化组件是否能在复杂、多模态指令跟随任务中超越端到端神经网络。
  • 评估语义搜索策略在提升大型复杂环境中小型或扁平物体定位能力方面的有效性。
  • 证明无需序列监督也可实现优异性能,从而降低对数据和监督的依赖。

提出的方法

  • 使用语言处理模块将自然语言指令转化为结构化形式,以提取与任务相关的子目标和动作。
  • 利用第一视角 RGB-D 观测结果,通过深度估计和实例分割构建语义度量地图,以表示场景语义。
  • 采用语义搜索策略,基于语义地图采样目标位置,以引导探索至未观测到的子目标物体。
  • 使用确定性策略头,根据当前状态和目标生成导航与交互动作,实现精确控制。
  • 在模块化流程中集成各组件,实现感知、记忆、规划与动作生成的解耦,提升可解释性与鲁棒性。
  • 端到端训练系统,无需专家轨迹或低水平语言监督,仅依赖高层语言指令。

实验结果

研究问题

  • RQ1在无专家演示的情况下,模块化、结构化方法是否能超越端到端神经网络在具身指令跟随任务中的表现?
  • RQ2语义搜索策略在大型复杂环境中提升探索效率与子目标定位能力方面有多有效?
  • RQ3显式空间记忆在多大程度上改善了状态追踪与长时程规划能力?
  • RQ4缺乏低水平语言监督是否显著降低性能?能否通过更优的感知与规划加以补偿?
  • RQ5该方法在不同任务类型和房间大小下的表现如何,特别是在处理扁平或微小物体等具有挑战性的子目标时?

主要发现

  • FILM 在 ALFRED 基准测试中实现了 24.46% 的新最先进成功率,相比之前最先进方法绝对提升 8.17%。
  • 语义搜索策略显著提升了首次目标物体定位率,在验证集未见场景中由 76.12% 提升至 80.51%。
  • 在大型场景中,语义搜索策略将成功率从 14.74% 提升至 15.17%,并使首次目标物体检测率提升 6.39 个百分点。
  • 在 'clean & place' 任务中,子目标为扁平且视觉上不明显的物体(如水槽),使用语义策略后成功率从 14.16% 提升至 33.63%。
  • 引入低水平语言指令后,性能进一步提升至 26.49%,表明结构化监督可增强泛化能力。
  • 消融实验表明,语义搜索策略在大型复杂环境及难以检测的物体上最具优势,能有效减少智能体的迷失现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。