[论文解读] Inverse Reinforcement Learning with the Average Reward Criterion
本文提出了一种基于平均奖励准则的新型逆强化学习框架,引入了随机策略镜像下降(SPMD)以求解平均奖励马尔可夫决策过程(AMDP),并提出逆向策略镜像下降(IPMD)用于逆强化学习。SPMD实现$Ó(1/\varepsilon)$收敛,IPMD实现$Ó(1/\varepsilon^2)$收敛,首次在具有通用函数逼近的平均奖励设定下提供了逆强化学习的有限时间收敛分析。
We study the problem of Inverse Reinforcement Learning (IRL) with an average-reward criterion. The goal is to recover an unknown policy and a reward function when the agent only has samples of states and actions from an experienced agent. Previous IRL methods assume that the expert is trained in a discounted environment, and the discount factor is known. This work alleviates this assumption by proposing an average-reward framework with efficient learning algorithms. We develop novel stochastic first-order methods to solve the IRL problem under the average-reward setting, which requires solving an Average-reward Markov Decision Process (AMDP) as a subproblem. To solve the subproblem, we develop a Stochastic Policy Mirror Descent (SPMD) method under general state and action spaces that needs $\mathcal{O}(1/\varepsilon)$ steps of gradient computation. Equipped with SPMD, we propose the Inverse Policy Mirror Descent (IPMD) method for solving the IRL problem with a $\mathcal{O}(1/\varepsilon^2)$ complexity. To the best of our knowledge, the aforementioned complexity results are new in IRL. Finally, we corroborate our analysis with numerical experiments using the MuJoCo benchmark and additional control tasks.
研究动机与目标
- 解决先前逆强化学习方法依赖于折扣MDP中已知折扣因子的局限性。
- 为基于平均奖励准则的逆强化学习建立理论框架,以更好地建模长期、平稳的行为。
- 为平均奖励设定下的逆强化学习算法提供有限时间收敛保证,特别是在通用状态空间与动作空间下。
- 通过将最大熵原理整合到平均奖励逆强化学习公式中,解决奖励恢复中的歧义性。
- 通过采用具有理论收敛速率保证的一阶随机优化方法,实现高效且可扩展的逆强化学习。
提出的方法
- 提出随机策略镜像下降(SPMD),一种用于在通用状态与动作空间下使用非线性函数逼近求解平均奖励MDP(AMDP)的一阶方法。
- 利用性能差异引理建立收敛边界,表明对特定函数类实现$Ó(1/\varepsilon)$步收敛,对通用函数逼近实现$Ó(1/\varepsilon^2)$步收敛。
- 提出逆向策略镜像下降(IPMD),即在平均奖励框架下对最大熵逆强化学习的对偶公式,通过最小化专家与智能体平均奖励之间的差异来优化。
- 采用双时间尺度随机逼近框架分析IPMD,其中SPMD在每次迭代中求解内层熵正则化强化学习问题。
- 通过$Ó(\cdot)$符号表示梯度误差边界,并利用稳定性项如$\nu$和$C_d$控制近似误差。
- 引入正则化项(预测奖励的0.05倍范数)以防止训练过程中目标函数爆炸。

实验结果
研究问题
- RQ1我们能否为平均奖励准则下的逆强化学习建立有限时间收敛分析,特别是在具有通用函数逼近的情况下?
- RQ2如何利用一阶随机优化方法高效求解逆强化学习中底层的平均奖励MDP(AMDP)子问题?
- RQ3在一阶逆强化学习算法中,平均奖励设定下结合最大熵正则化时,其收敛速率是多少?
- RQ4SPMD能否在非线性函数逼近下实现$Ó(1/\varepsilon)$收敛,且在一般情况下实现$Ó(1/\varepsilon^2)$收敛?
- RQ5所提出的IPMD方法在奖励恢复精度与样本效率方面相较于最先进逆强化学习算法表现如何?
主要发现
- SPMD算法在求解AMDP时,对特定类别的非线性函数逼近器实现了$Ó(1/\varepsilon)$收敛。
- 对于通用函数逼近,SPMD在$Ó(1/\varepsilon^2)$步内收敛,为AMDP中随机策略优化建立了新的理论边界。
- 在平均奖励准则下用于逆强化学习的IPMD算法以$Ó(1/\varepsilon^2)$的速率收敛,这是该设定下的首次此类有限时间收敛分析。
- 在MuJoCo基准上的数值实验表明,IPMD在奖励恢复方面优于最先进方法,显著降低了误差。
- 所提出的算法在控制任务中表现出稳健性能,训练稳定,并且相比基于GAN和采样方法的逆强化学习,样本效率更高。
- 在奖励函数上加入小规模L2正则化可防止目标函数爆炸,并在不影响理论收敛性的情况下维持训练稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。