Skip to main content
QUICK REVIEW

[论文解读] Lifelong Inverse Reinforcement Learning

Jorge A. Mendez, Shashank Shivkumar|arXiv (Cornell University)|Jul 1, 2022
Reinforcement Learning in Robotics参考文献 27被引用 7
一句话总结

本文提出终身逆强化学习(LIRL),一种使智能体能够跨多个示范任务转移知识以减少示范需求的框架。通过将最大熵逆强化学习扩展为共享潜在奖励表征,所提出的ELIRL算法通过持续优化,提升了新任务和先前学习任务的性能,在计算开销极低的情况下显著优于单任务逆强化学习。

ABSTRACT

Methods for learning from demonstration (LfD) have shown success in acquiring behavior policies by imitating a user. However, even for a single task, LfD may require numerous demonstrations. For versatile agents that must learn many tasks via demonstration, this process would substantially burden the user if each task were learned in isolation. To address this challenge, we introduce the novel problem of lifelong learning from demonstration, which allows the agent to continually build upon knowledge learned from previously demonstrated tasks to accelerate the learning of new tasks, reducing the amount of demonstrations required. As one solution to this problem, we propose the first lifelong learning approach to inverse reinforcement learning, which learns consecutive tasks via demonstration, continually transferring knowledge between tasks to improve performance.

研究动机与目标

  • 为减轻通过模仿学习多个任务时的用户负担,通过跨任务持续知识迁移实现。
  • 将从示范中进行终身学习的形式化为逆强化学习中的在线多任务学习问题。
  • 开发一个通用框架,封装现有逆强化学习方法以支持终身知识共享。
  • 评估通过共享奖励表征是否可实现反向迁移——即在过往任务上的性能提升。
  • 将框架扩展至跨领域及连续状态-动作空间。

提出的方法

  • 该框架使用低秩矩阵分解来建模跨奖励函数的共享潜在成分,表示为矩阵L。
  • 每个任务的奖励函数被建模为共享潜在因子的线性组合,由任务特定权重s^(t)参数化。
  • 该算法执行在线学习,随着每个新任务的加入,更新共享潜在因子L和任务特定权重s^(t)。
  • 采用最大熵逆强化学习作为基础学习器,通过联合优化L和s^(t)将其适配至终身学习设置。
  • 通过随时间不断优化L,实现反向迁移,从而自动提升对先前学习任务的建模性能。
  • 扩展包括通过领域自适应特征对齐实现跨领域迁移,以及通过径向基函数表示适应连续状态-动作空间。

实验结果

研究问题

  • RQ1在逆强化学习中,先前学习任务的知识是否能有效迁移以加速新任务的学习?
  • RQ2对共享潜在奖励成分的持续优化是否能带来对先前学习任务性能的提升(即反向迁移)?
  • RQ3与单任务逆强化学习相比,终身逆强化学习在样本效率和计算成本方面表现如何?
  • RQ4该框架能否在具有不同特征空间或连续状态-动作空间的任务间实现泛化?
  • RQ5重新优化任务特定权重s^(t)在多大程度上能提升多样任务下的性能与稳定性?

主要发现

  • ELIRL显著优于单任务最大熵逆强化学习,在计算成本远低于高斯过程基逆强化学习的情况下,实现相当或更优的性能。
  • 该算法展现出反向迁移:随着学习任务数量的增加,早期任务的性能持续提升,学习全部任务后平均性能获得提升。
  • 通过CD-ELIRL实现的跨领域迁移,相比域内ELIRL,奖励差异减少高达30%,表明在不同特征空间中均具有效性。
  • 在连续平面导航任务中,ELIRL优于单任务AME-IRL,且随着学习任务数量增加,性能增益持续提升。
  • 在每个任务后重新优化s^(t)可提升反向迁移效果并稳定性能,尤其在不同网格尺寸的领域间切换时表现更优。
  • 共享潜在矩阵L捕捉到了有意义的任务结构,所学成分对应于Objectworld环境中特定颜色周围的空间区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。