Skip to main content
QUICK REVIEW

[论文解读] f-IRL: Inverse Reinforcement Learning via State Marginal Matching

Tianwei Ni, Harshit Sikchi|arXiv (Cornell University)|Nov 9, 2020
Reinforcement Learning in Robotics参考文献 41被引用 4
一句话总结

f-IRL 提出了一种新颖的逆强化学习方法,通过计算奖励参数的解析梯度,最小化智能体与专家状态分布之间的任意 f-散度,从而学习一个平稳的奖励函数。该方法在样本效率方面表现更优,并在 MuJoCo 基准测试中超越了对抗性模仿学习方法,实现了有效的行为迁移和快速的下游策略训练。

ABSTRACT

Imitation learning is well-suited for robotic tasks where it is difficult to directly program the behavior or specify a cost for optimal control. In this work, we propose a method for learning the reward function (and the corresponding policy) to match the expert state density. Our main result is the analytic gradient of any f-divergence between the agent and expert state distribution w.r.t. reward parameters. Based on the derived gradient, we present an algorithm, f-IRL, that recovers a stationary reward function from the expert density by gradient descent. We show that f-IRL can learn behaviors from a hand-designed target state density or implicitly through expert observations. Our method outperforms adversarial imitation learning methods in terms of sample efficiency and the required number of expert trajectories on IRL benchmarks. Moreover, we show that the recovered reward function can be used to quickly solve downstream tasks, and empirically demonstrate its utility on hard-to-explore tasks and for behavior transfer across changes in dynamics.

研究动机与目标

  • 为了解决从模仿学习中的专家状态分布中学习平稳奖励函数的挑战。
  • 提升逆强化学习中的样本效率,尤其是在专家轨迹有限的情况下。
  • 利用恢复的奖励函数实现在动力学变化下的行为迁移。
  • 提供一个统一的框架,用于从专家演示或直接指定的目标状态密度中进行学习。
  • 与先前的对抗性模仿学习方法相比,降低超参数敏感性。

提出的方法

  • 该方法推导了智能体与专家状态分布之间任意 f-散度关于奖励参数的解析梯度。
  • 它将逆强化学习建模为在状态边际分布之间 f-散度上的优化问题,而非轨迹或状态-动作分布。
  • f-IRL 使用梯度下降最小化 f-散度,从而实现奖励函数的端到端训练。
  • 该方法支持前向和反向 f-散度,根据选择可实现模式寻找或模式覆盖行为。
  • 它支持未归一化的密度指定,简化了偏好编码和目标密度定义。
  • 该方法旨在恢复一个可重复使用的平稳奖励函数,用于从零开始训练策略。

实验结果

研究问题

  • RQ1我们能否通过 f-散度的解析梯度,从专家状态分布中学习到一个平稳奖励函数?
  • RQ2与 GAIL 和 AIRL 等对抗性模仿学习方法相比,f-IRL 在样本效率方面表现如何?
  • RQ3恢复的奖励函数是否能加速在难以探索、稀疏奖励环境中的学习?
  • RQ4相同的奖励函数是否可以跨动力学变化(如机器人形态改变)进行迁移?
  • RQ5f-IRL 是否比先前的 IRL 方法需要更少的超参数调优?

主要发现

  • 在 MuJoCo 基准测试中,f-IRL 在环境交互步数和专家轨迹数量方面均优于 GAIL、AIRL 和 MaxEntIRL,表现出更优的样本效率。
  • 在 Ant 环境中使用 50 条专家轨迹时,f-IRL 的回报达到 145.5,优于 AIRL(-29.9)和 MaxEntIRL(130.3)。
  • 该方法成功在残障 Ant 代理上学习到了行走策略,证明了其在动力学变化下有效的行为迁移能力。
  • 在点质量目标到达任务中,f-IRL 学习到的奖励表现出预期的模式覆盖(前向 KL)和模式寻找(反向 KL)行为。
  • 在所有 MuJoCo 任务中,f-IRL 仅需极少的超参数调优,而 f-MAX 和 AIRL 等基线方法则对超参数高度敏感。
  • 恢复的奖励函数显著加速了稀疏奖励任务中的策略训练,证明了其在下游策略学习中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。