Skip to main content
QUICK REVIEW

[论文解读] Learning a Prior over Intent via Meta-Inverse Reinforcement Learning

Kelvin Xu, Ellis Ratner|arXiv (Cornell University)|May 31, 2018
Reinforcement Learning in Robotics参考文献 55被引用 8
一句话总结

本文提出 Meta-IRL,一种元逆强化学习框架,通过从多样化任务中学习奖励函数的先验,实现高效少样本奖励学习。通过在少量示范数据上对初始奖励函数权重进行元优化,以实现快速适应,该方法在基于视觉的控制任务中实现了更高的数据效率和泛化能力,优于标准 IRL 和元学习基线模型——尤其在示范数据有限时表现更优。

ABSTRACT

A significant challenge for the practical application of reinforcement learning in the real world is the need to specify an oracle reward function that correctly defines a task. Inverse reinforcement learning (IRL) seeks to avoid this challenge by instead inferring a reward function from expert behavior. While appealing, it can be impractically expensive to collect datasets of demonstrations that cover the variation common in the real world (e.g. opening any type of door). Thus in practice, IRL must commonly be performed with only a limited set of demonstrations where it can be exceedingly difficult to unambiguously recover a reward function. In this work, we exploit the insight that demonstrations from other tasks can be used to constrain the set of possible reward functions by learning a "prior" that is specifically optimized for the ability to infer expressive reward functions from limited numbers of demonstrations. We demonstrate that our method can efficiently recover rewards from images for novel tasks and provide intuition as to how our approach is analogous to learning a prior.

研究动机与目标

  • 为解决真实世界强化学习中专家示范稀缺、奖励函数设计困难的问题。
  • 通过从相关任务中学习共享的奖励函数先验,改进少样本逆强化学习。
  • 在仅有少量示范的情况下,实现对新任务的有效泛化,尤其适用于高维观测(如图像)场景。
  • 通过利用先前任务中元学习得到的归纳偏置,减少在数据有限时 IRL 的过拟合问题。
  • 证明元学习得到的奖励函数初始化可实现比随机初始化或监督预训练更快、更准确的适应。

提出的方法

  • 该方法在包含专家示范的多样化任务集合上进行元训练,以学习奖励函数参数化的初始化。
  • 采用最大熵逆强化学习框架(MaxEnt-IRL)从示范中推断奖励函数,使用深度神经网络进行函数逼近。
  • 元优化目标是最小化在真实与学习到的奖励函数下最优策略的期望值差异,跨任务进行优化。
  • 在元测试阶段,通过在新任务上仅使用少量示范进行几步梯度更新,对预训练的奖励函数进行微调。
  • 该方法显式优化初始权重,以实现快速适应,避免标准微调预训练表征时可能产生的负迁移。
  • 该方法在两个领域进行评估:一个模拟的 2D 导航环境(SpriteWorld)和一个包含第一人称图像的 3D 室内导航环境(SUNCG)

实验结果

研究问题

  • RQ1元学习得到的奖励函数先验是否能提升视觉控制任务中少样本逆强化学习的性能?
  • RQ2在低数据场景下,元优化初始化与随机初始化或监督预训练相比,对 IRL 的表现如何?
  • RQ3单一元学习得到的奖励函数在多大程度上能泛化到未见过的任务和环境中?
  • RQ4当仅提供少量示范时,该方法是否优于标准 IRL 和其他元学习基线模型?
  • RQ5即使预训练因领域差异或数据有限而失败,该方法是否仍能实现正向迁移?

主要发现

  • 在 SpriteWorld 环境中,MandRIL(Meta-IRL)在仅使用 1–5 个示范时,价值差异显著低于基线模型,甚至在更高数据规模下也优于从零开始训练的模型。
  • 在 SUNCG 环境中,MandRIL 在保留任务上使用 5 个示范时达到 82.6% 的成功率,而从零开始训练为 76.5%,最佳元学习基线为 73.3%。
  • MandRIL 对分布外的精灵角色和未见过的房屋布局表现出有效泛化,展示了在极少微调下的稳健适应能力。
  • 该方法优于使用平均梯度更新的监督预训练基线,后者导致负迁移和泛化性能差。
  • 即使仅使用 1 个示范,MandRIL 在 PICK 任务上达到 52.3% 的成功率,在 NAV 任务上达到 90.7%,显著超过其他方法。
  • 消融实验表明,预适应(即元训练得到的初始权重)至关重要——若无此步骤,平均性能下降至 20.7%

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。