Skip to main content
QUICK REVIEW

[论文解读] Modular Framework for Visuomotor Language Grounding

Kolby Nottingham, Litian Liang|arXiv (Cornell University)|Sep 5, 2021
Multimodal Machine Learning Applications参考文献 12被引用 5
一句话总结

本文提出了一种模块化的语言、动作与视觉(LAV)框架,用于视觉-运动语言定位,该框架在无需依赖指令遵循数据集的情况下独立训练视觉与动作模块,从而实现数据高效的训练。该框架在 ALFRED 基准测试中优于端到端基线模型,尤其在未见过的环境中表现更优,表明模块解耦虽受限于当前导航规划能力,但仍能提升泛化性能。

ABSTRACT

Natural language instruction following tasks serve as a valuable test-bed for grounded language and robotics research. However, data collection for these tasks is expensive and end-to-end approaches suffer from data inefficiency. We propose the structuring of language, acting, and visual tasks into separate modules that can be trained independently. Using a Language, Action, and Vision (LAV) framework removes the dependence of action and vision modules on instruction following datasets, making them more efficient to train. We also present a preliminary evaluation of LAV on the ALFRED task for visual and interactive instruction following.

研究动机与目标

  • 通过解耦语言、视觉与动作模块,解决端到端指令遵循模型中的数据效率低下问题。
  • 通过在更便宜、更丰富的视觉与仿真数据上训练视觉与动作模块,减少对昂贵专家示范的依赖。
  • 通过独立训练感知与控制模块,提升在未见过环境中的泛化能力。
  • 证明在复杂指令遵循任务中,模块化训练可优于端到端学习。

提出的方法

  • 语言模块(L)使用微调后的 T5 模型,从自然语言指令中预测子任务与目标物体。
  • 视觉模块(V)使用三个监督网络(语义分割、深度估计、障碍物检测)从 RGB 观察与目标物体中提取状态特征。
  • 动作模块(A)利用状态特征与目标物体执行子任务,采用深度优先搜索进行导航,结合任务特定动作。
  • 各模块独立训练:视觉模块在 AI2THOR 仿真数据上训练,动作模块通过多任务强化学习训练,语言模块在指令数据集上训练。
  • 该框架在推理阶段允许模块间信息交互,例如利用视觉状态信息辅助语言预测。
  • 未来改进包括用强化学习智能体替代当前导航方法,以提升性能。

实验结果

研究问题

  • RQ1在不依赖指令数据集的情况下独立训练视觉与动作模块,是否能提升视觉-运动语言定位中的数据效率?
  • RQ2模块化训练在指令遵循任务中对未见过环境的性能与泛化能力有何影响?
  • RQ3语言模块在未接触视觉或动作数据的情况下,多大程度上能准确预测子任务与目标物体?
  • RQ4与端到端基线相比,模块独立性对整体任务成功率的影响如何?
  • RQ5当用人工标注的“完美”模块(oracle)替换当前模块时,LAV 框架的性能下降程度如何,这揭示了当前的哪些性能瓶颈?

主要发现

  • LAV 框架在 ALFRED 基准测试中显著优于端到端基线模型,在已见测试数据上达到 13.4% 的成功率(SR),在未见测试数据上达到 6.3%。
  • 在未见环境中,LAV 达到 6.3% 的 SR 与 3.1% 的 PWSR,展现出优于基线模型(分别为 0.4% 与 0.1%)的泛化能力。
  • 当语言与视觉模块均被替换为 oracle 模块时,LAV 仅达到 25.2% 的 SR,表明当前导航策略是主要性能瓶颈。
  • 与最先进方法 LWIT 相比,LAV 在未见场景中的性能下降更小,表明其对分布偏移具有更强的鲁棒性。
  • 视觉模块通过在仿真数据上训练得到增强,相比指令遵循数据集,该方法成本更低且更具可扩展性。
  • 语言模块的性能受限于视觉状态特征的质量,引入视觉反馈可提升预测准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。