Skip to main content
QUICK REVIEW

[论文解读] Risk-Sensitive Generative Adversarial Imitation Learning

Jonathan Lacotte, Mohammad Ghavamzadeh|arXiv (Cornell University)|Aug 13, 2018
Human Pose and Action Recognition被引用 10
一句话总结

本文提出了一种风险敏感型生成对抗模仿学习(RS-GAIL)框架,该框架扩展了GAIL,不仅匹配专家策略的期望性能,还匹配其风险特征——特别是CVaR和VaR。通过在风险嵌入的占据测度上使用JS散度和Wasserstein距离来形式化风险敏感型模仿学习,RS-GAIL在MuJoCo和OpenAI控制环境中实现了优于GAIL和RAIL的风险感知性能,尤其在尾部分布风险指标上表现更优。

ABSTRACT

We study risk-sensitive imitation learning where the agent's goal is to perform at least as well as the expert in terms of a risk profile. We first formulate our risk-sensitive imitation learning setting. We consider the generative adversarial approach to imitation learning (GAIL) and derive an optimization problem for our formulation, which we call it risk-sensitive GAIL (RS-GAIL). We then derive two different versions of our RS-GAIL optimization problem that aim at matching the risk profiles of the agent and the expert w.r.t. Jensen-Shannon (JS) divergence and Wasserstein distance, and develop risk-sensitive generative adversarial imitation learning algorithms based on these optimization problems. We evaluate the performance of our algorithms and compare them with GAIL and the risk-averse imitation learning (RAIL) algorithms in two MuJoCo and two OpenAI classical control tasks.

研究动机与目标

  • 为解决风险中性模仿学习在保留专家风险特征(如CVaR和VaR)方面的局限性。
  • 形式化一种风险敏感型模仿学习设置,要求智能体在匹配期望回报的同时,也匹配专家的风险特征。
  • 开发一种基于GAIL的框架,通过在风险嵌入的分歧度量下匹配占据测度,优化风险敏感型目标。
  • 在基准控制任务上,使用定量风险指标评估所提出的RS-GAIL算法与GAIL和RAIL的性能。

提出的方法

  • 将风险敏感型模仿学习形式化为一个优化问题,通过Jensen-Shannon散度和Wasserstein距离匹配智能体与专家的风险特征。
  • 通过凸共轭将风险敏感型正则化项引入GAIL目标,推导出两种变体:JS-RS-GAIL和W-RS-GAIL。
  • 使用编码风险特征(如CVaR)的占据测度,而非标准的状态-动作分布,从而实现风险感知型策略学习。
  • 采用对抗训练,判别器在风险嵌入测度下区分智能体轨迹与专家轨迹。
  • 在连续控制环境中应用该方法,结合深度强化学习与策略梯度方法。
  • 采用两阶段训练过程:判别器学习区分风险嵌入轨迹,生成器(策略)则通过最小化风险感知分歧度来更新。

实验结果

研究问题

  • RQ1能否将基于GAIL的框架扩展为不仅匹配期望性能,还能匹配专家策略的风险特征(如CVaR)?
  • RQ2当应用于风险嵌入占据测度时,JS散度与Wasserstein距离在模仿学习中的表现如何?
  • RQ3所提出的RS-GAIL方法在连续控制任务中是否优于GAIL和RAIL,在VaR与CVaR等风险敏感型指标上表现更优?
  • RQ4与基于JS的变体相比,网络容量如何影响基于Wasserstein的RS-GAIL性能?
  • RQ5该方法能否在风险规避行为至关重要的复杂环境中实现泛化?

主要发现

  • 在Hopper任务中,JS-RS-GAIL的平均回报为-5622 ± 198,优于GAIL(-5428 ± 191)和RAIL(-6894 ± 241),且在相同风险特征下表现更优。
  • 在Walker2d环境中,JS-RS-GAIL在λ=0.05时达到CVaRα为-5202 ± 222,显著优于RAIL(-6111 ± 202)和GAIL(-4913 ± 231)。
  • 在CartPole环境中,W-RS-GAIL在风险敏感指标上达到ραλ为-384 ± 10,优于W-GAIL(平均-314 ± 9)和RAIL(-7714 ± 72)。
  • 在小网络设置下,基于JS的RS-GAIL变体始终优于其基于Wasserstein的对应变体,可能由于权重裁剪网络的表示能力有限。
  • 实证结果表明,标准GAIL无法保留专家风险特征,即使平均性能匹配,CVaR与VaR之间仍存在显著差距。
  • 作者推测,基于Wasserstein的RS-GAIL在更高容量网络的复杂环境中可能表现更优,提示未来需在这些设置中进一步评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。