Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Reinforcement Learning of Transferable Meta-Skills for Embodied Navigation

Juncheng Li, Xin Wang|arXiv (Cornell University)|Nov 18, 2019
Multimodal Machine Learning Applications参考文献 46被引用 6
一句话总结

该论文提出ULTRA,一种新颖的无监督强化学习框架,能够从未标注的3D环境中无监督地学习可迁移的元技能(如绕过障碍物或直线前进)。通过在任务生成器与元学习器之间采用基于课程的对抗性训练过程,该方法能够通过学习到的主策略快速适应新的视觉导航任务,在SPL指标上相比基线模型实现了53.34%的相对提升。

ABSTRACT

Visual navigation is a task of training an embodied agent by intelligently navigating to a target object (e.g., television) using only visual observations. A key challenge for current deep reinforcement learning models lies in the requirements for a large amount of training data. It is exceedingly expensive to construct sufficient 3D synthetic environments annotated with the target object information. In this paper, we focus on visual navigation in the low-resource setting, where we have only a few training environments annotated with object information. We propose a novel unsupervised reinforcement learning approach to learn transferable meta-skills (e.g., bypass obstacles, go straight) from unannotated environments without any supervisory signals. The agent can then fast adapt to visual navigation through learning a high-level master policy to combine these meta-skills, when the visual-navigation-specified reward is provided. Evaluation in the AI2-THOR environments shows that our method significantly outperforms the baseline by 53.34% relatively on SPL, and further qualitative analysis demonstrates that our method learns transferable motor primitives for visual navigation.

研究动机与目标

  • 解决在3D视觉导航环境中训练具身智能体时的数据效率低下和标注成本过高的问题。
  • 通过学习可重用的元技能,实现在极少标注数据情况下的新导航任务快速适应。
  • 在元训练过程中消除对手动设计或标注任务的依赖。
  • 开发一种可扩展的无监督框架,能够自主生成难度逐步提升的任务课程。
  • 提升所学策略在多样化环境中的可迁移性和泛化能力。

提出的方法

  • 引入基于课程的对抗性训练过程,其中任务生成器能从未标注环境中自主生成难度逐步提升的导航任务。
  • 元学习器通过基于梯度的元学习方法学习可迁移的子策略(元技能),采用Reptile进行优化。
  • 分层策略架构将主策略(任务特定)与共享子策略(任务无关)分离,从而减少元过拟合。
  • 子策略在无监督条件下于多样化场景中学习执行特定行为(如前进、向左/向右转、绕过障碍物)。
  • 在元测试阶段,仅训练一个新的主策略,通过任务特定奖励组合预先学习的子策略。
  • 该框架利用无监督探索和内在好奇心来引导任务生成与策略学习。

实验结果

研究问题

  • RQ1能否从未标注的3D环境中无监督地学习可迁移的元技能,且无需任何监督?
  • RQ2能否自动生成难度逐步提升的任务课程以提升元学习器的性能?
  • RQ3具有共享子策略的分层策略架构是否能在低资源环境下提升泛化能力并减少过拟合?
  • RQ4ULTRA在少样本视觉导航任务中的性能与监督学习和预训练基线相比如何?
  • RQ5所学的子策略在不同环境中的行为是否具有一致性和可解释性?

主要发现

  • ULTRA在SPL指标上相比最强基线模型实现了53.34%的相对提升,证明了其在低资源视觉导航任务中的显著性能优势。
  • 消融实验表明,若移除分层策略架构,SPL下降0.93分,成功率下降3.47个百分点,证实其对泛化能力的关键作用。
  • 对子策略数量的消融分析显示,性能在七种子策略时达到峰值;超过此数量后性能下降,原因在于策略混淆。
  • 定性分析表明,每个子策略在多样化场景中均表现出一致且可解释的行为(例如,子策略1始终绕过障碍物,子策略2始终向右转)。
  • 基于课程的对抗性训练优于随机任务采样,验证了结构化任务推进的有效性。
  • 该方法优于在图像驱动导航上进行微调的预训练基线,表明此类预训练在语义视觉导航任务中迁移效果不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。