Skip to main content
QUICK REVIEW

[论文解读] Positive-Unlabeled Reward Learning

Danfei Xu, Misha Denil|arXiv (Cornell University)|Nov 1, 2019
Adversarial Robustness in Machine Learning参考文献 49被引用 10
一句话总结

本文提出正样本-未标记样本奖励学习(PURL),一种统一框架,将监督模仿学习与GAIL类方法中的奖励学习重新表述为正样本-未标记样本(PU)学习。通过训练判别器以专家(正样本)和智能体生成(未标记)轨迹区分成功与失败,PURL缓解了监督学习中的奖励高估问题以及GAIL中的判别器过拟合问题,从而在不引入额外假设或标注的情况下显著提升性能。

ABSTRACT

Learning reward functions from data is a promising path towards achieving scalable Reinforcement Learning (RL) for robotics. However, a major challenge in training agents from learned reward models is that the agent can learn to exploit errors in the reward model to achieve high reward behaviors that do not correspond to the intended task. These reward delusions can lead to unintended and even dangerous behaviors. On the other hand, adversarial imitation learning frameworks tend to suffer the opposite problem, where the discriminator learns to trivially distinguish agent and expert behavior, resulting in reward models that produce low reward signal regardless of the input state. In this paper, we connect these two classes of reward learning methods to positive-unlabeled (PU) learning, and we show that by applying a large-scale PU learning algorithm to the reward learning problem, we can address both the reward under- and over-estimation problems simultaneously. Our approach drastically improves both GAIL and supervised reward learning, without any additional assumptions.

研究动机与目标

  • 解决监督奖励学习中的奖励错觉问题,即智能体利用稀疏人类标注中的错误。
  • 解决GAIL中的判别器过拟合问题,即判别器学习到的是平凡特征而非与任务相关的行为。
  • 在统一的PU学习框架下整合监督奖励学习与GAIL,实现共享改进。
  • 在演示与策略环境之间存在领域差异的情况下提升鲁棒性。
  • 证明大规模算法的PU学习可在模仿学习中实现更好的泛化性与性能。

提出的方法

  • 将GAIL中判别器的目标从区分专家行为与智能体行为,重新表述为以专家轨迹作为正样本、智能体轨迹作为未标记样本,对成功与失败进行分类。
  • 应用大规模PU学习算法(Kiryo et al., 2017)在正样本(专家)和未标记样本(智能体)数据上训练可靠分类器,避免对负样本标签的需求。
  • 将训练好的判别器作为强化学习中的代理奖励函数,使奖励信号反映可靠的成果检测,而非平凡的区分。
  • 在监督奖励学习中引入支持集估计模块,通过训练PU分类器识别奖励模型可靠的state space区域。
  • 采用基于PU学习理论推导的风险最小化目标,利用估计的类别先验来校正正样本-未标记样本数据的不平衡问题。
  • 实现可微分的端到端训练流程,将PU学习整合到监督与对抗性模仿学习中。

实验结果

研究问题

  • RQ1PU学习能否用于提升稀疏标注下监督模仿学习中奖励模型的可靠性?
  • RQ2将GAIL判别器重新表述为成功/失败分类器,能否缓解高维state space中对平凡特征的过拟合?
  • RQ3在统一的PU学习目标下整合监督与对抗性模仿学习,是否能带来更好的泛化性与性能?
  • RQ4当专家演示与智能体环境之间存在领域偏移时,PURL的性能如何?
  • RQ5PU学习能否扩展至其他基于GAN的生成模型(如图像GAN),以提升生成样本质量?

主要发现

  • PURL通过减少奖励高估与判别器过拟合,在GAIL与监督奖励学习中均显著提升性能。
  • 该方法在不引入额外假设或训练期间人类反馈的前提下,大幅提升了样本效率与最终策略性能。
  • nn-PURL在存在领域差距的环境中优于标准PURL与基线方法,展现出对分布偏移的鲁棒性。
  • 消融实验表明,PU学习算法的选择以及将问题建模为PU学习的形式对性能至关重要。
  • 该框架即使在仅标注state space小部分区域的情况下,也能实现可靠的奖励建模,降低对昂贵人工监督的依赖。
  • 实证结果表明,所提出的风险估计与类别先验处理方法可生成更稳定、更准确的奖励信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。