Skip to main content
QUICK REVIEW

[论文解读] Replacing Rewards with Examples: Example-Based Policy Search via Recursive Classification

Benjamin Eysenbach, Sergey Levine|arXiv (Cornell University)|Mar 23, 2021
Reinforcement Learning in Robotics参考文献 41被引用 4
一句话总结

该论文提出了一种基于示例的控制递归分类方法(RCE),这是一种强化学习方法,通过直接从成功示例中学习来替代手动设计奖励函数。与先学习奖励函数的方法不同,RCE使用递归分类来预测未来成功的概率,满足一种新颖的数据驱动贝尔曼方程;在复杂操作任务中,包括基于图像的环境,其性能优于以往的模仿学习与奖励学习方法。

ABSTRACT

Reinforcement learning (RL) algorithms assume that users specify tasks by manually writing down a reward function. However, this process can be laborious and demands considerable technical expertise. Can we devise RL algorithms that instead enable users to specify tasks simply by providing examples of successful outcomes? In this paper, we derive a control algorithm that maximizes the future probability of these successful outcome examples. Prior work has approached similar problems with a two-stage process, first learning a reward function and then optimizing this reward function using another RL algorithm. In contrast, our method directly learns a value function from transitions and successful outcomes, without learning this intermediate reward function. Our method therefore requires fewer hyperparameters to tune and lines of code to debug. We show that our method satisfies a new data-driven Bellman equation, where examples take the place of the typical reward function term. Experiments show that our approach outperforms prior methods that learn explicit reward functions.

研究动机与目标

  • 为解决强化学习中手动设计奖励函数所面临的挑战,该过程耗时且需要专业技术知识。
  • 使用户能够仅通过提供成功结果的示例来指定任务,而非定义数学形式的奖励函数。
  • 开发一种直接的、端到端的策略学习方法,避免中间奖励函数学习带来的偏差与复杂性。
  • 为一种新型贝尔曼方程建立理论基础,其中成功示例替代了奖励项。
  • 在复杂操作任务上,包括具有图像观测值的任务,实证验证其优越性能。

提出的方法

  • RCE直接学习一个价值函数,通过转换数据和成功示例预测未来成功的概率,而无需学习中间的奖励函数。
  • 它采用一种递归分类框架,满足一种新的数据驱动贝尔曼方程,用成功示例信号替代标准的奖励项。
  • 该方法使用分类器 $ C_{\theta} $ 来估计未来成功概率的比值,其预测值被限制在 [0, 0.5] 范围内,以反映概率比的形式。
  • 该算法采用时序差分学习,结合目标网络和一个损失函数,该函数同时包含即时预测和自举的未来估计。
  • 它假设成功示例存在生成过程,并引入一种鲁棒变体,通过最小化平方赫林格距离来处理示例收集过程中的模糊性。
  • 该方法可端到端训练,无需微调图像编码器,在图像任务中使用随机初始化权重反而能获得更好性能。

实验结果

研究问题

  • RQ1能否通过用用户提供的成功示例替代奖励函数,使强化学习更加易用?
  • RQ2能否通过跳过奖励函数学习阶段的直接策略学习方法,实现优于两阶段方法的性能?
  • RQ3支持一种用成功示例替代奖励项的贝尔曼方程的理论基础是什么?
  • RQ4该方法在目标位置和物体形状不同的新环境中是否具有泛化能力?
  • RQ5为实现稳定学习,对示例收集过程需要做出哪些假设?如何增强其鲁棒性?

主要发现

  • RCE在复杂操作任务中优于最先进的模仿学习方法(AIRL、DAC、SQIL)和奖励学习基线方法(ORIL、PURL、VICE)。
  • 在Sawyer推送环境中,RCE的平均回报达到0.2,显著优于仅获得0.07回报的修改版C-learning变体。
  • RCE成功学习解决了诸如拿起锤子和敲入钉子等任务——这些任务均未被任何基线方法解决。
  • 当使用图像观测值时,该方法在目标位置和物体形状变化的新环境中也表现出良好的泛化能力,展示了稳健的成功泛化性能。
  • RCE对学习率、折扣因子、批量大小和权重初始化等超参数选择具有鲁棒性,几乎无需调参。
  • 使用随机初始化的图像编码器性能优于微调后的编码器,表明表示学习可能是未来研究中需要单独解决的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。