Skip to main content
QUICK REVIEW

[论文解读] Auxiliary Tasks and Exploration Enable ObjectNav

Joel Ye, Dhruv Batra|arXiv (Cornell University)|Apr 8, 2021
Multimodal Machine Learning Applications参考文献 37被引用 15
一句话总结

该论文提出了一种简单的 CNN+RNN 智能体用于 ObjectGoal 导航,通过引入辅助任务和探索奖励,实现了最先进性能。通过添加语义分割、目标存在特征以及逆动力学预测,智能体学习到更平滑、低维的循环动态,最终在 Habitat ObjectNav 挑战赛中取得 24.5% 的成功率和 8.1% 的 SPL,相较于之前的工作分别提升了 37% 和 8%。

ABSTRACT

ObjectGoal Navigation (ObjectNav) is an embodied task wherein agents are to navigate to an object instance in an unseen environment. Prior works have shown that end-to-end ObjectNav agents that use vanilla visual and recurrent modules, e.g. a CNN+RNN, perform poorly due to overfitting and sample inefficiency. This has motivated current state-of-the-art methods to mix analytic and learned components and operate on explicit spatial maps of the environment. We instead re-enable a generic learned agent by adding auxiliary learning tasks and an exploration reward. Our agents achieve 24.5% success and 8.1% SPL, a 37% and 8% relative improvement over prior state-of-the-art, respectively, on the Habitat ObjectNav Challenge. From our analysis, we propose that agents will act to simplify their visual inputs so as to smooth their RNN dynamics, and that auxiliary tasks reduce overfitting by minimizing effective RNN dimensionality; i.e. a performant ObjectNav agent that must maintain coherent plans over long horizons does so by learning smooth, low-dimensional recurrent dynamics. Site: https://joel99.github.io/objectnav/

研究动机与目标

  • 使通用的端到端学习智能体在无需显式空间地图的情况下,实现 ObjectGoal 导航任务的最先进性能。
  • 解决原始 CNN+RNN 智能体在复杂、未见过的环境中样本效率低下和过拟合的问题。
  • 探究辅助任务和探索信号是否能够使简单架构重新超越基于地图的方法在 ObjectNav 中的表现。
  • 分析循环动态在智能体行为和失败模式中的作用,特别是记忆缺失和混沌动态。
  • 开发一种系留策略方法,实现在稀疏 ObjectNav 奖励下的快速适应,同时保持探索能力。

提出的方法

  • 在智能体输入中增加自指语义分割和语义目标存在(SGE)特征,用于表示目标物体占据画面的比例。
  • 引入三项辅助任务:逆动力学预测、未来帧预测(CPC)和地图覆盖度预测,以促进对世界结构化的理解。
  • 添加探索奖励,以鼓励智能体访问未探索区域,从而提升在未见过环境中的样本效率。
  • 实现一种系留策略机制,其中次级策略仅通过离策略更新在稀疏 ObjectNav 奖励上进行训练,从而实现更快的适应。
  • 使用主策略进行探索,次级系留策略进行导航,次级策略通过主策略的动作分布进行执行。
  • 应用探测技术分析循环动态,包括通过训练过程和不同随机种子下 RNN 状态的不动点分析来估计记忆跨度。

实验结果

研究问题

  • RQ1无需显式空间地图,简单的 CNN+RNN 智能体能否在 ObjectGoal 导航中实现最先进性能?
  • RQ2辅助任务如何影响具身智能体中循环动态的稳定性和泛化能力?
  • RQ3添加探索奖励在多大程度上能提升未见过环境中的样本效率和成功率?
  • RQ4与微调单一策略相比,系留策略方法是否能提升对稀疏 ObjectNav 奖励的适应能力?
  • RQ5循环动态——特别是记忆跨度和轨迹维度——在智能体失败和性能中扮演何种角色?

主要发现

  • 所提出的智能体在 Habitat ObjectNav 挑战赛中取得 24.5% 的成功率和 8.1% 的 SPL,相较于之前最先进方法,成功率相对提升 37%,SPL 相对提升 8%。
  • 辅助任务通过限制智能体 RNN 的有效维度,减少过拟合,从而产生更平滑、低维的循环动态。
  • 智能体倾向于选择视觉上更简单的场景,这些场景能产生更平滑的 RNN 动态,表明其对稳定内部表征存在行为偏好。
  • 失败模式通常与记忆缺失有关,特别是在长时空中丢失目标或路径信息时。
  • 在辅助任务下,特别是 CPC 和 CP,智能体 RNN 信念状态的记忆跨度减小,表明循环动态得到正则化。
  • 在稀疏 ObjectNav 奖励上训练的系留策略优于标准微调方法,展现出更快的适应速度和更高的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。