Skip to main content
QUICK REVIEW

[论文解读] Q-value Regularized Transformer for Offline Reinforcement Learning

Shengchao Hu, Ziqing Fan|arXiv (Cornell University)|May 27, 2024
Elevator Systems and Control被引用 4
一句话总结

本文提出QT,一种基于Q值正则化的Transformer模型,用于离线强化学习。该方法通过双目标损失函数,将条件序列建模与动态规划相结合:采用行为克隆进行策略正则化,通过Q值最大化实现最优动作选择。在D4RL基准测试中,QT在长时序和稀疏奖励设置下表现优于传统离线RL方法以及当前最先进(SOTA)的CSM与DP方法,通过实现稳健的轨迹拼接和改进的回报对齐,显著提升了性能。

ABSTRACT

Recent advancements in offline reinforcement learning (RL) have underscored the capabilities of Conditional Sequence Modeling (CSM), a paradigm that learns the action distribution based on history trajectory and target returns for each state. However, these methods often struggle with stitching together optimal trajectories from sub-optimal ones due to the inconsistency between the sampled returns within individual trajectories and the optimal returns across multiple trajectories. Fortunately, Dynamic Programming (DP) methods offer a solution by leveraging a value function to approximate optimal future returns for each state, while these techniques are prone to unstable learning behaviors, particularly in long-horizon and sparse-reward scenarios. Building upon these insights, we propose the Q-value regularized Transformer (QT), which combines the trajectory modeling ability of the Transformer with the predictability of optimal future returns from DP methods. QT learns an action-value function and integrates a term maximizing action-values into the training loss of CSM, which aims to seek optimal actions that align closely with the behavior policy. Empirical evaluations on D4RL benchmark datasets demonstrate the superiority of QT over traditional DP and CSM methods, highlighting the potential of QT to enhance the state-of-the-art in offline RL.

研究动机与目标

  • 为解决条件序列建模(CSM)在离线强化学习中的局限性,即由于采样回报与最优回报之间不一致,无法从次优轨迹中拼接出最优轨迹。
  • 通过将序列建模与动态规划方法结合,克服DP方法在长时序和稀疏奖励环境中的不稳定性。
  • 构建一个统一框架,融合Transformer的轨迹建模能力与Q-learning的最优回报预测能力。
  • 通过将动作采样与行为策略分布及学习到的Q值对齐,提升策略泛化能力并降低分布偏移风险。
  • 在无需显式环境交互或额外行为克隆组件的前提下,实现离线强化学习的最先进性能。

提出的方法

  • 该方法采用基于Transformer的策略,基于状态-动作-奖励三元组序列及一个“剩余回报”(RTG)标记,预测后续动作。
  • 引入双目标训练损失:一项条件行为克隆项用于匹配行为策略分布,另一项Q值正则化项用于最大化期望回报。
  • Q值正则化项源自一个联合训练的Q网络,为每个状态-动作对提供未来最优回报的估计。
  • 将Q值直接整合进动作采样过程,使预测结果偏向高回报动作,同时保持与行为策略的一致性。
  • 通过依赖示范轨迹上的监督学习避免bootstrapping不稳定性,同时借助Q值模块保留Bellman备份原则。
  • 通过将采样动作的期望回报与多条轨迹中的最优回报对齐,实现有效的轨迹合成。

实验结果

研究问题

  • RQ1与标准CSM方法相比,基于Q值正则化的Transformer策略是否能提升离线强化学习中的轨迹拼接能力?
  • RQ2将Q值正则化整合进序列建模框架,对长时序和稀疏奖励离线强化学习任务的性能有何影响?
  • RQ3Q值正则化在多大程度上可缓解分布偏移,同时保持与行为策略的一致性?
  • RQ4行为克隆与Q值最大化联合优化是否能带来比现有离线强化学习基线更优的样本效率与泛化能力?
  • RQ5所提方法是否能在无需额外行为克隆或基于模型的动力学建模的情况下,实现最先进性能?

主要发现

  • QT在多个D4RL基准环境上均达到最先进性能,超越了传统动态规划与条件序列建模方法。
  • 该方法展现出卓越的轨迹拼接能力,即使在次优数据序列上也能有效合成高回报轨迹。
  • Q值正则化的整合显著改善了回报对齐,减少了动作采样中期望回报与最优回报之间的差异。
  • QT通过将策略正则化直接嵌入序列建模目标,消除了对显式行为克隆或保守值函数正则化的依赖。
  • 实证评估表明,QT在长时序和稀疏奖励设置下保持了稳健性能,而传统方法常在此类场景下失效。
  • 消融实验确认,行为克隆与Q值正则化两个组件对最优性能均不可或缺,各自在策略稳定性和回报最大化方面发挥独特作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。