Skip to main content
QUICK REVIEW

[论文解读] Quantifying Differences in Reward Functions

Adam Gleave, Michael D. Dennis|arXiv (Cornell University)|Jun 24, 2020
Reinforcement Learning in Robotics参考文献 19被引用 10
一句话总结

本文提出EPIC(等效策略不变比较),一种无需训练策略即可直接量化奖励函数差异的方法,通过规范化奖励并计算其在覆盖分布上的相关性。EPIC对潜在奖励塑形和正向缩放具有不变性,对覆盖分布选择具有鲁棒性,并能在动态变化时仍对最优策略的遗憾提供上界,优于基于策略的评估方法。

ABSTRACT

For many tasks, the reward function is inaccessible to introspection or too complex to be specified procedurally, and must instead be learned from user data. Prior work has evaluated learned reward functions by evaluating policies optimized for the learned reward. However, this method cannot distinguish between the learned reward function failing to reflect user preferences and the policy optimization process failing to optimize the learned reward. Moreover, this method can only tell us about behavior in the evaluation environment, but the reward may incentivize very different behavior in even a slightly different deployment environment. To address these problems, we introduce the Equivalent-Policy Invariant Comparison (EPIC) distance to quantify the difference between two reward functions directly, without a policy optimization step. We prove EPIC is invariant on an equivalence class of reward functions that always induce the same optimal policy. Furthermore, we find EPIC can be efficiently approximated and is more robust than baselines to the choice of coverage distribution. Finally, we show that EPIC distance bounds the regret of optimal policies even under different transition dynamics, and we confirm empirically that it predicts policy training success. Our source code is available at https://github.com/HumanCompatibleAI/evaluating-rewards.

研究动机与目标

  • 为解决基于策略滚动评估的局限性,后者将奖励错位与优化失败混淆,且难以泛化到新环境。
  • 开发一种对潜在塑形和正向缩放不变的奖励距离度量,确保对等效奖励函数的一致比较。
  • 提出一种计算高效、鲁棒且可预测的方法,仅使用奖励本身评估学习到的奖励函数,无需策略优化。
  • 建立理论边界,表明当EPIC距离趋近于零时,即使在动态变化下,最优策略的遗憾也极低。

提出的方法

  • EPIC在覆盖分布𝒟上计算规范化奖励函数之间的相关性,该过程消除了潜在基于奖励的塑形并归一化了正向缩放。
  • 规范化包括从转移分布中减去平均奖励,并消除与状态相关的偏差,以确保不变性。
  • 该方法使用从无信息先验(如随机滚动)导出的覆盖分布𝒟,以确保对现实转移具有广泛支持。
  • EPIC通过在覆盖分布上对转移进行蒙特卡洛采样高效近似,实现可扩展计算。
  • 理论分析证明EPIC是伪度量,且在潜在塑形和正向缩放下保持不变,满足奖励距离度量的关键期望属性。
  • EPIC的理论遗憾边界(定理4.3)表明,当EPIC距离趋近于零时,即使在不同动态下,两个奖励下最优策略之间的性能差距也会消失。

实验结果

研究问题

  • RQ1我们能否在不训练策略的情况下评估学习到的奖励函数,从而将奖励质量与优化失败分离?
  • RQ2是否存在一种对潜在塑形和正向缩放不变的奖励距离度量,以确保对等效奖励函数的一致比较?
  • RQ3能否设计一种既计算高效又对覆盖分布选择具有鲁棒性的奖励距离度量?
  • RQ4当学习到的奖励与真实奖励之间的EPIC距离较小时,是否能预测在动态变化下最优策略的遗憾较低?

主要发现

  • EPIC是首个无需策略优化即可直接量化奖励函数差异的方法,实现了将奖励质量与优化失败分离。
  • EPIC对潜在塑形和正向缩放具有不变性,确保了诱导相同最优策略的奖励函数之间的一致比较。
  • EPIC对覆盖分布的选择具有鲁棒性,在多种分布下均产生稳定结果,而基线方法如NPEC和ERC则不然。
  • 实证结果证实,低EPIC距离可预测在动态变化下最优策略的低遗憾,验证了其理论遗憾边界。
  • EPIC通过蒙特卡洛采样实现高效近似,使其在实际评估学习到的奖励函数时具备可扩展性。
  • 理论分析表明,当EPIC距离趋近于零时,即使在不同动态下,两个奖励下最优策略之间的性能差距也会消失,证明了其预测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。