Skip to main content
QUICK REVIEW

[论文解读] Inverse Reinforcement Learning with Simultaneous Estimation of Rewards and Dynamics

Michael Herman, Tobias Gindele|arXiv (Cornell University)|Apr 13, 2016
Reinforcement Learning in Robotics参考文献 2被引用 19
一句话总结

本文提出了一种基于梯度的逆强化学习方法 SERD,可从专家演示中联合估计奖励函数和马尔可夫决策过程(MDP)动态。通过利用专家策略建模奖励与动态之间的相互依赖关系,SERD 提升了样本效率和估计精度,尤其在动态信息不足时表现更优——在合成 MDP 和迁移学习任务中,相比无模型和有模型的 IRL 基线方法,性能更优。

ABSTRACT

Inverse Reinforcement Learning (IRL) describes the problem of learning an unknown reward function of a Markov Decision Process (MDP) from observed behavior of an agent. Since the agent's behavior originates in its policy and MDP policies depend on both the stochastic system dynamics as well as the reward function, the solution of the inverse problem is significantly influenced by both. Current IRL approaches assume that if the transition model is unknown, additional samples from the system's dynamics are accessible, or the observed behavior provides enough samples of the system's dynamics to solve the inverse problem accurately. These assumptions are often not satisfied. To overcome this, we present a gradient-based IRL approach that simultaneously estimates the system's dynamics. By solving the combined optimization problem, our approach takes into account the bias of the demonstrations, which stems from the generating policy. The evaluation on a synthetic MDP and a transfer learning task shows improvements regarding the sample efficiency as well as the accuracy of the estimated reward functions and transition models.

研究动机与目标

  • 解决现有 IRL 方法假设系统动态已知或估计良好这一局限性,而该假设在实际中往往不现实。
  • 通过联合学习奖励函数与 MDP 转移动态,提升逆强化学习中的样本效率与估计精度。
  • 利用专家演示通过专家策略编码了关于奖励与动态的信息这一事实,即使在未观测到转移的情况下亦可实现。
  • 开发一种可微分的、基于梯度的框架,实现对奖励与动态参数的同步优化。
  • 在示范数据有限或有偏差的场景下(包括迁移学习设置)评估该方法。

提出的方法

  • 将 IRL 建模为奖励参数与动态参数的联合优化问题,利用专家策略作为两者的桥梁。
  • 以最大折扣因果熵 IRL 框架为基础,扩展其以通过可微分的软 Q-迭代算子实现动态估计。
  • 采用隐函数定理,计算收敛软 Q-函数对奖励与动态参数的梯度。
  • 使用具有利普希茨连续性和压缩映射条件保证收敛的迭代策略梯度计算方法。
  • 将转移模型参数 θ 整合进策略梯度计算中,实现通过动态与奖励函数的端到端反向传播。
  • 推导出一种联合似然目标,最大化在估计模型下观测到的示范的概率,同时考虑奖励与动态的不确定性。

实验结果

研究问题

  • RQ1在专家示范稀疏或有偏差的情况下,IRL 中联合估计奖励与动态是否能提升样本效率?
  • RQ2在奖励与动态估计精度方面,联合估计方法相较于无模型与有模型 IRL 方法表现如何?
  • RQ3在多大程度上可利用策略作为约束,从专家示范中推断未观测到的状态-动作转移?
  • RQ4所提出方法在未见环境(如迁移学习任务)中是否具有更好的泛化能力?
  • RQ5将专家策略建模为同时依赖于奖励与动态的函数,对估计偏差与收敛性有何影响?

主要发现

  • 在训练任务中,当示范集大小超过 3 时,SERD 在示范对数似然上相比基线方法取得统计显著提升(p < 0.05)。
  • 在迁移学习任务中,当示范集大小超过 12 时,SERD 在对数似然上亦取得统计显著增益(p < 0.05)。
  • 与基线 IRL 方法相比,SERD 将估计转移模型与真实转移模型之间的 Kullback-Leibler 散度降低了最多 40%。
  • 在合成 MDP 中,SERD 将学习策略与真实专家策略之间的 KL 散度降低了 30%–50%,表明策略模仿更优。
  • 联合估计框架即使在未观测到的状态-动作对上也能实现准确的动态推断,利用专家策略作为正则化信号。
  • 在标准假设下(包括利普希茨连续性与 γ < 1),证明了迭代策略梯度计算的收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。