Skip to main content
QUICK REVIEW

[论文解读] Auxiliary Tasks Speed Up Learning PointGoal Navigation

Joel Ye, Dhruv Batra|arXiv (Cornell University)|Jul 9, 2020
Multimodal Machine Learning Applications参考文献 49被引用 6
一句话总结

该论文提出通过注意力机制融合自监督辅助任务(如动作条件对比预测编码、逆动力学和时间距离估计),以加速视觉逼真环境中PointGoal导航任务的样本高效学习。该方法相比之前的最先进方法(DD-PPO)实现5.5倍更快的收敛速度,在仅700万帧时达到0.55 SPL,样本复杂度降低5.5倍,且在4000万帧时性能提升0.16 SPL。

ABSTRACT

PointGoal Navigation is an embodied task that requires agents to navigate to a specified point in an unseen environment. Wijmans et al. showed that this task is solvable but their method is computationally prohibitive, requiring 2.5 billion frames and 180 GPU-days. In this work, we develop a method to significantly increase sample and time efficiency in learning PointNav using self-supervised auxiliary tasks (e.g. predicting the action taken between two egocentric observations, predicting the distance between two observations from a trajectory,etc.).We find that naively combining multiple auxiliary tasks improves sample efficiency,but only provides marginal gains beyond a point. To overcome this, we use attention to combine representations learnt from individual auxiliary tasks. Our best agent is 5.5x faster to reach the performance of the previous state-of-the-art, DD-PPO, at 40M frames, and improves on DD-PPO's performance at 40M frames by 0.16 SPL. Our code is publicly available at https://github.com/joel99/habitat-pointnav-aux.

研究动机与目标

  • 提升在视觉逼真环境中训练具身智能体进行PointGoal导航的样本效率与时间效率。
  • 探究自监督辅助任务是否能有效从简单环境迁移至复杂视觉逼真环境(如Gibson环境)。
  • 确定多个辅助任务在组合时的相互作用机制,以及损失函数的简单相加是否导致正向迁移或干扰。
  • 开发一种有效融合多个辅助任务表示的机制,以克服简单组合带来的收益递减问题。
  • 分析辅助任务是否在智能体内部信念模块中诱导出专门化、功能化的角色。

提出的方法

  • 智能体采用循环神经网络架构,并配备多个辅助任务头,从第一人称观察中学习自监督信号。
  • 采用三项核心辅助任务:动作条件对比预测编码(CPC|A)、逆动力学(ID)和时间距离估计(TD)。
  • 通过可学习的注意力机制融合各辅助任务的表示,实现基于任务相关性的动态加权。
  • 注意力机制与主策略端到端联合训练,实现多任务表示的自适应融合。
  • 通过模块掩码消融实验,评估每个辅助任务对整体性能的功能性贡献。
  • 在Habitat PointNav基准上使用Gibson数据集评估该方法,SPL与样本效率为主要指标。

实验结果

研究问题

  • RQ1自监督辅助任务是否能在复杂视觉逼真环境中显著提升PointGoal导航的样本效率?
  • RQ2多个辅助任务在组合时如何相互作用——是否产生正向迁移,还是存在干扰?
  • RQ3对多个辅助任务的损失进行简单相加是否导致收益递减?若存在,注意力融合能否克服此问题?
  • RQ4各个辅助任务是否在智能体内部信念模块中诱导出专门化的功能角色?
  • RQ5与单任务或简单多任务学习相比,基于注意力的辅助表示融合是否能实现更快收敛与更优性能?

主要发现

  • 所提方法仅用700万帧即达到0.55 SPL,相比基线方法DD-PPO(需4000万帧达到相同性能)实现5.5倍加速。
  • 在固定4000万帧预算下,最优模型将SPL从0.55提升至0.70,相对提升27%,且相比DD-PPO提升0.16 SPL。
  • 表现最佳的单一辅助任务CPC|A-4在4000万帧时将SPL从0.55提升至0.66,相对提升22%。
  • 多个辅助任务的简单组合(CPC|A、ID、TD)带来进一步增益,在4000万帧时达到0.70 SPL,且仅需1200万帧即达0.55 SPL,实现3.3倍加速。
  • 掩码实验表明CPC|A-8对性能至关重要:若排除该任务,SPL从0.712骤降至0.233,表明其具有专门化的功能角色。
  • 注意力可视化显示模块激活在不同环境位置呈现聚类特征,提示其表现出类似生物系统中位置细胞的潜在专门化机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。