Skip to main content
QUICK REVIEW

[论文解读] Identifiability in inverse reinforcement learning

Haoyang Cao, Samuel N. Cohen|arXiv (Cornell University)|Jun 7, 2021
Reinforcement Learning in Robotics参考文献 23被引用 5
一句话总结

该论文通过证明在熵正则化条件下,当在不同折扣因子或充分不同的环境中观察到最优策略时,真实奖励函数可唯一恢复(至常数偏移),从而解决了逆强化学习(IRL)中的非可识别性问题。关键洞见在于,价值函数与策略共同参数化了一致奖励函数的空间,从而在存在多个行为观测时实现重建。

ABSTRACT

Inverse reinforcement learning attempts to reconstruct the reward function in a Markov decision problem, using observations of agent actions. As already observed in Russell [1998] the problem is ill-posed, and the reward function is not identifiable, even under the presence of perfect information about optimal behavior. We provide a resolution to this non-identifiability for problems with entropy regularization. For a given environment, we fully characterize the reward functions leading to a given policy and demonstrate that, given demonstrations of actions for the same reward under two distinct discount factors, or under sufficiently different environments, the unobserved reward can be recovered up to a constant. We also give general necessary and sufficient conditions for reconstruction of time-homogeneous rewards on finite horizons, and for action-independent rewards, generalizing recent results of Kim et al. [2021] and Fu et al. [2018].

研究动机与目标

  • 解决逆强化学习中的根本可识别性问题,即多个奖励函数可能产生相同的最优策略。
  • 表征在熵正则化马尔可夫决策过程(MDP)中与给定最优策略一致的全部奖励函数空间。
  • 建立在不同环境或折扣因子下,从行为数据中唯一恢复真实奖励的条件。
  • 推广Kim等人(2021)和Fu等人(2018)关于时齐且与动作无关奖励的先前结果。
  • 通过正式刻画奖励模糊性,分离即时奖励与未来奖励对策略行为的影响。

提出的方法

  • 作者使用熵正则化马尔可夫决策过程(MDPs)以稳定逆学习问题并提升可识别性。
  • 推导出所有产生给定最优策略的奖励函数的参数化形式,表明该空间完全由控制问题的价值函数决定。
  • 该方法利用熵正则化设定下最优策略、价值函数与奖励之间的贝尔曼方程关系。
  • 通过观察在两个不同折扣因子(例如,γ₁ = 0.95 和 γ₂ = 0.25)下的最优策略,可唯一恢复真实奖励函数(至常数偏移)。
  • 该方法使用联合损失函数,最小化在多个环境或折扣率下的策略预测误差,从而实现基于优化的奖励恢复。
  • 数值实验通过Adam优化验证了该方法,并利用奖励和价值函数估计的ℓ₂误差评估重建精度。

实验结果

研究问题

  • RQ1在逆强化学习中,即使问题本质上病态,是否仍能从观测到的最优策略中唯一识别真实奖励函数?
  • RQ2熵正则化如何影响马尔可夫决策过程中奖励的可识别性?
  • RQ3在不同折扣因子下观测到多个最优策略时,奖励在何种条件下可恢复至常数偏移?
  • RQ4在有限horizon MDP中,识别时齐且与动作无关奖励的一般必要与充分条件是什么?
  • RQ5在已知策略的前提下,价值函数在在多大程度上可作为重建奖励函数的充分统计量?

主要发现

  • 在仅掌握单一折扣因子下的最优策略的完美知识时,奖励函数仍不可识别,但一致奖励的集合完全由价值函数参数化。
  • 当在两个不同折扣因子(例如,γ₁ = 0.95 和 γ₂ = 0.25)下观测到最优策略时,真实奖励函数可唯一恢复(至常数偏移)。
  • 数值实验表明,使用两个策略时训练损失衰减至接近零,且奖励恢复的ℓ₂误差比使用单一策略时小一个数量级。
  • 学习到的奖励矩阵与真实奖励非常接近,差异量级约为10⁻¹,如图6所示。
  • 当使用多个策略时,价值函数估计的误差也显著降低,ℓ₂误差在γ₁和γ₂下均达到约10⁻³量级,如图7所示。
  • 该方法成功重建了在两种折扣率下接近真实最优策略的策略,差异量级约为10⁻³,证实了奖励恢复的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。