Skip to main content
QUICK REVIEW

[论文解读] Inverse Preference Learning: Preference-based RL without a Reward Function

Joey Hejna, Dorsa Sadigh|arXiv (Cornell University)|May 24, 2023
Advanced Graph Neural Networks被引用 6
一句话总结

本文提出逆偏好学习(IPL),一种参数高效的离线强化学习算法,通过直接优化Q函数以对齐人类偏好,绕过了显式奖励函数学习。通过利用逆软-Bellman算子,IPL在机器人基准测试中实现了与最先进方法相当的性能,且参数和超参数更少,优于使用Transformer等复杂奖励模型的方法。

ABSTRACT

Reward functions are difficult to design and often hard to align with human intent. Preference-based Reinforcement Learning (RL) algorithms address these problems by learning reward functions from human feedback. However, the majority of preference-based RL methods naïvely combine supervised reward models with off-the-shelf RL algorithms. Contemporary approaches have sought to improve performance and query complexity by using larger and more complex reward architectures such as transformers. Instead of using highly complex architectures, we develop a new and parameter-efficient algorithm, Inverse Preference Learning (IPL), specifically designed for learning from offline preference data. Our key insight is that for a fixed policy, the $Q$-function encodes all information about the reward function, effectively making them interchangeable. Using this insight, we completely eliminate the need for a learned reward function. Our resulting algorithm is simpler and more parameter-efficient. Across a suite of continuous control and robotics benchmarks, IPL attains competitive performance compared to more complex approaches that leverage transformer-based and non-Markovian reward functions while having fewer algorithmic hyperparameters and learned network parameters. Our code is publicly released.

研究动机与目标

  • 解决现有基于偏好RL方法中依赖学习奖励函数所带来的高复杂度和超参数敏感性问题。
  • 通过消除对独立奖励网络的需求,降低离线RL中的计算和架构开销。
  • 在保持连续控制和机器人任务性能的同时,提升样本效率和参数效率。
  • 探究在固定策略下,仅Q函数是否足以编码足够的奖励信息以实现有效的偏好对齐。
  • 开发一种比现有两阶段方法(包括独立奖励模型训练)更稳定且更易调优的方法。

提出的方法

  • IPL使用逆软-Bellman算子,在固定策略下将Q函数映射回隐式奖励函数,从而实现直接基于偏好的优化。
  • 该算法训练Q函数以匹配最优Q*,同时确保隐式奖励与专家偏好数据一致。
  • 通过引入超参数λ的正则化项,惩罚与偏好一致的Q值的偏离,从而在无需独立奖励模型的情况下稳定学习。
  • IPL完全在离线强化学习框架内运行,使用IQL或AWAC等离策略算法,避免训练独立的奖励网络。
  • 该方法利用了在固定策略下,Q函数包含重建奖励函数所需的所有必要信息的特性。
  • 其采用单阶段训练流程,联合优化最优Q值和偏好一致性,从而减少误差传播。

实验结果

研究问题

  • RQ1仅依靠Q函数(无显式奖励模型)是否能在基于偏好的RL中实现有竞争力的性能?
  • RQ2消除奖励网络是否能降低超参数敏感度并提升训练稳定性?
  • RQ3IPL的参数效率与使用Transformer或RNN进行奖励建模的最先进方法相比如何?
  • RQ4正则化强度λ的选择在IPL中在多大程度上影响性能?
  • RQ5IPL是否能在无需显式奖励函数学习的情况下,泛化到多样化的机器人基准测试中?

主要发现

  • IPL在大多数任务中实现了与使用马尔可夫奖励模型的IQL相当或更优的性能,即使未学习奖励函数。
  • 在抽屉开启任务中,使用64维MLP的IPL表现优于MR(35),后者基于35维MLP的奖励模型,尽管参数更少。
  • 由于减少了来自奖励预测的误差传播,IPL在多次运行中表现出显著更低的方差。
  • 在极低参数预算(14k参数)下,IPL优于标准基于偏好的RL基线方法,后者使用高达10倍的参数。
  • IPL的性能对正则化超参数λ的变化不敏感,表明其对超参数调优具有鲁棒性。
  • MR模型在训练步数不足时欠拟合,步数过多时则过拟合,而IPL由于采用单阶段端到端优化,避免了这一权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。