Skip to main content
QUICK REVIEW

[论文解读] Extreme Q-Learning: MaxEnt RL without Entropy

Divyansh Garg, Joey Hejna|arXiv (Cornell University)|Jan 5, 2023
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出了一种新型深度强化学习框架——极端Q学习(XQL),该框架利用极值理论(EVT)和Gumbel分布,直接估计最大熵强化学习中的最优软值函数,无需显式策略网络或熵计算。通过使用Gumbel回归建模对数划分函数(LogSumExp),XQL实现了稳定且高性能的在线与离线最大熵Q学习,在避免策略外推误差的同时,显著提升了性能——尤其在D4RL的Franka Kitchen任务上实现了超过10分的性能提升,达到当前最先进水平。

ABSTRACT

Modern Deep Reinforcement Learning (RL) algorithms require estimates of the maximal Q-value, which are difficult to compute in continuous domains with an infinite number of possible actions. In this work, we introduce a new update rule for online and offline RL which directly models the maximal value using Extreme Value Theory (EVT), drawing inspiration from economics. By doing so, we avoid computing Q-values using out-of-distribution actions which is often a substantial source of error. Our key insight is to introduce an objective that directly estimates the optimal soft-value functions (LogSumExp) in the maximum entropy RL setting without needing to sample from a policy. Using EVT, we derive our \emph{Extreme Q-Learning} framework and consequently online and, for the first time, offline MaxEnt Q-learning algorithms, that do not explicitly require access to a policy or its entropy. Our method obtains consistently strong performance in the D4RL benchmark, outperforming prior works by \emph{10+ points} on the challenging Franka Kitchen tasks while offering moderate improvements over SAC and TD3 on online DM Control tasks. Visualizations and code can be found on our website at https://div99.github.io/XQL/.

研究动机与目标

  • 为解决在连续动作空间中估计最优软值函数(LogSumExp)的挑战,现有最大熵强化学习方法依赖于难以计算的熵与策略采样。
  • 消除最大熵强化学习中对辅助策略网络与显式熵估计的需求,这些因素是在线与离线强化学习中误差与不稳定的根源。
  • 开发一种理论基础坚实、端到端可微的框架,用于在线与离线最大熵Q学习,直接优化真实的贝尔曼更新算子 $\mathcal{B}^*$。
  • 通过所提出的基于EVT的公式,弥合保守Q学习与软Q学习之间的差距,证明二者在该框架下等价。
  • 通过避免分布外动作采样,提升离线强化学习中的样本效率与鲁棒性,从而缓解演员-critic方法中的常见问题。

提出的方法

  • 该方法借鉴McFadden的离散选择理论与极值理论(EVT),将Q值估计误差的分布建模为Gumbel分布,从而为最大值的极限分布提供理论依据。
  • 提出Gumbel回归作为对数划分函数(LogSumExp)的一致估计器,实现对连续动作空间中最优软值函数 $V^*$ 的可微估计。
  • 推导出一种新型贝尔曼损失目标函数,直接优化真实的最大熵贝尔曼算子 $\mathcal{B}^*$,无需依赖策略网络或对动作的软最大值运算。
  • 基于Gumbel损失的随机梯度下降(SGD)方法,构建了在线与离线XQL算法,不包含显式策略网络或熵正则化项。
  • 通过在不同环境中调优温度 $\beta$、梯度裁剪与价值函数更新频率等超参数,提升训练稳定性,尤其在具有挑战性的离线设置中表现显著。
  • 在D4RL基准测试中进行了验证,涵盖Mujoco、AntMaze与Franka Kitchen环境,并通过消融实验确认了基于Gumbel的估计方法相较于标准方法的优势。

实验结果

研究问题

  • RQ1能否利用极值理论,在不从策略中采样的前提下,为连续动作空间中的对数划分函数(LogSumExp)推导出一致且可微的估计器?
  • RQ2将Q值误差建模为Gumbel分布,是否能提升最大熵强化学习中对最优软值函数的估计稳定性与准确性?
  • RQ3XQL是否能在不依赖策略网络或熵正则化的情况下,实现离线强化学习中的最先进性能,从而避免外推误差?
  • RQ4与标准软Q学习和保守Q学习相比,所提出的基于Gumbel的贝尔曼损失在样本效率与最终回报方面表现如何?
  • RQ5XQL框架在多大程度上通过统一的理论基础,将软Q学习与保守Q学习整合为一体?

主要发现

  • 在具有挑战性的D4RL Franka Kitchen任务上,XQL相较于先前方法实现了超过10分的性能提升,显著优于现有离线强化学习基线方法。
  • 在D4RL离线Mujoco基准测试中,XQL-Tuned(经超参数调优的版本)在所有环境中均保持或超越SAC与TD3的性能,尤其在最困难的任务上取得显著提升。
  • 该方法通过避免分布外动作采样,显著提升了离线强化学习的训练稳定性,而这是演员-critic算法中主要的误差来源。
  • 即使在在线强化学习中,XQL的性能也与SAC和TD3相当,且略有提升,同时消除了对独立策略网络与熵计算的需求。
  • 消融实验表明,基于Gumbel的对数划分函数估计比标准方法更准确,尤其在Q值误差非高斯分布时优势更为明显。
  • 该框架成功统一了软Q学习与保守Q学习,表明在所提出的基于EVT的公式下,最大熵强化学习自然地表现为一种保守性形式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。