Skip to main content
QUICK REVIEW

[论文解读] Addressing reward bias in Adversarial Imitation Learning with neutral reward functions

Rohit Jena, Siddharth Agrawal|arXiv (Cornell University)|Sep 20, 2020
Adversarial Robustness in Machine Learning参考文献 14被引用 4
一句话总结

本文提出了一种生成对抗模仿学习(GAIL)中的中性奖励函数,消除了在具有单个或多个终止状态的任务型环境中存在的生存偏差和终止偏差。通过将标准的正向或负向奖励函数替换为对称的对数比率形式,该方法实现了更优的模仿性能,在具有复杂终止动态特性的环境中,优于现有的GAIL和DAC方法。

ABSTRACT

Generative Adversarial Imitation Learning suffers from the fundamental problem of reward bias stemming from the choice of reward functions used in the algorithm. Different types of biases also affect different types of environments - which are broadly divided into survival and task-based environments. We provide a theoretical sketch of why existing reward functions would fail in imitation learning scenarios in task based environments with multiple terminal states. We also propose a new reward function for GAIL which outperforms existing GAIL methods on task based environments with single and multiple terminal states and effectively overcomes both survival and termination bias.

研究动机与目标

  • 识别并解决GAIL中的奖励偏差,特别是生存和终止偏差,这些偏差会阻碍在任务型环境中的模仿。
  • 分析现有奖励函数(正向/负向)如何在具有多个终止状态的环境中导致次优策略。
  • 提出一种对生存或过早终止无偏见的中性奖励函数,以实现在多样化任务型设置下的稳健模仿。
  • 通过实证验证,中性奖励函数在具有单个和多个终止状态的环境中,优于DAC和标准GAIL变体等现有方法。

提出的方法

  • 提出一种新的奖励函数,定义为 $ R = \log(D(s,a)) - \log(1 - D(s,a)) $,其中 $ D(s,a) $ 为判别器的输出,以生成对称且中性的奖励信号。
  • 在GAIL框架中使用此中性奖励函数,替代标准的 $ \log(D(s,a)) $ 或 $ -\log(1 - D(s,a)) $ 形式,以避免对生存或终止的偏向。
  • 采用标准的GAIL训练流程,结合基于策略的强化学习算法,使策略最大化来自判别器的中性奖励信号。
  • 训练判别器以区分专家轨迹与专家模仿轨迹,保持GAIL目标的同时使用平衡的奖励信号。
  • 对策略网络和价值网络均使用两层MLP并配合Leaky ReLU激活函数,并通过3个随机种子的平均结果确保鲁棒性。
  • 在具有不同终止状态结构的5个MiniGrid环境中,使用成功率和环境回报评估性能。

实验结果

研究问题

  • RQ1在具有多个终止状态的任务型环境中,GAIL中的正向和负向奖励函数如何引发生存和终止偏差?
  • RQ2为何现有方法如DAC在具有多个终止状态的任务型环境中表现不佳,尽管其在更简单设置中已解决偏差问题?
  • RQ3一种避免对生存或终止偏向的中性奖励函数,是否能提升复杂任务型环境中的模仿性能?
  • RQ4所提出的中性奖励函数是否在具有单个和多个终止状态的环境中,优于正向和负向奖励基线以及DAC方法?

主要发现

  • 在Empty和DoorKey环境中,中性奖励函数的成功率达到1.00 ± 0.00,与专家表现一致,并优于所有基线方法。
  • 在GoToDoor环境中,中性奖励函数的成功率为0.97 ± 0.15,显著优于DAC(0.26 ± 0.44)和负向奖励(0.38 ± 0.48)。
  • 在RedBlueDoors环境中,中性奖励函数的成功率为0.91 ± 0.27,优于DAC(0.70 ± 0.45)和负向奖励(0.00 ± 0.00)。
  • 在DistShift环境中,中性奖励函数的成功率为0.97 ± 0.15,优于DAC(0.76 ± 0.42)和负向奖励(0.65 ± 0.47)。
  • 使用正向奖励的GAIL在具有多个终止状态的环境中完全失败,所有此类环境中的成功率为0.00 ± 0.00。
  • 负向奖励函数在GoToDoor环境中的成功率为0.25 ± 0.43,表明由于随机到达正确门的概率,存在强烈的终止偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。