Skip to main content
QUICK REVIEW

[论文解读] DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning

Jinxin Liu, Hongyin Zhang|arXiv (Cornell University)|Mar 13, 2022
Reinforcement Learning in Robotics被引用 8
一句话总结

DARA 提出了一种面向离线强化学习的动力学感知奖励增强框架,通过利用具有不同动力学特性的源数据,减少了对大规模目标离线数据集的依赖。通过基于状态-动作-下一个状态分布对奖励进行修改,以惩罚在目标环境中不太可能发生的转移,DARA 实现了在极小量目标数据下的强大性能,优于模拟环境和真实世界任务中的先前方法。

ABSTRACT

Offline reinforcement learning algorithms promise to be applicable in settings where a fixed dataset is available and no new experience can be acquired. However, such formulation is inevitably offline-data-hungry and, in practice, collecting a large offline dataset for one specific task over one specific environment is also costly and laborious. In this paper, we thus 1) formulate the offline dynamics adaptation by using (source) offline data collected from another dynamics to relax the requirement for the extensive (target) offline data, 2) characterize the dynamics shift problem in which prior offline methods do not scale well, and 3) derive a simple dynamics-aware reward augmentation (DARA) framework from both model-free and model-based offline settings. Specifically, DARA emphasizes learning from those source transition pairs that are adaptive for the target environment and mitigates the offline dynamics shift by characterizing state-action-next-state pairs instead of the typical state-action distribution sketched by prior offline RL methods. The experimental evaluation demonstrates that DARA, by augmenting rewards in the source offline dataset, can acquire an adaptive policy for the target environment and yet significantly reduce the requirement of target offline data. With only modest amounts of target offline data, our performance consistently outperforms the prior offline RL methods in both simulated and real-world tasks.

研究动机与目标

  • 通过减少对大规模目标离线数据集的依赖,解决离线强化学习中的高数据需求问题。
  • 表征并缓解源环境与目标环境之间过渡动力学差异的动态漂移问题,该问题在以往的离线强化学习方法中常被忽视。
  • 开发一种通用且简单的框架,可与现有的无模型和基于模型的离线强化学习算法集成。
  • 仅使用少量目标数据,实现从动力学特性不同的源环境到目标环境的有效策略迁移。

提出的方法

  • DARA 引入了一种奖励增强机制,基于对状态-动作-下一个状态三元组的动力学感知建模,对在目标环境中不太可能发生但在源数据中可能的转移进行惩罚。
  • 通过建模给定状态-动作对的下一个状态的条件分布,识别并抑制在源环境中合理但在目标环境中不合理的转移。
  • 在训练过程中修改奖励信号,以避免学习这些不匹配的转移,从而有效将源数据与目标动力学对齐。
  • 该框架与无模型和基于模型的离线强化学习算法均兼容,且可通过对数据加载器进行最小代码修改实现。
  • 采用一种动力学感知的损失项,量化源与目标动力学之间的差异,指导奖励塑造。
  • 该方法在包含 MuJoCo 任务中动力学差异的新基准上进行了评估,并在仿真和真实世界设置下的 12 自由度四足机器人上进行了测试。

实验结果

研究问题

  • RQ1通过利用具有不同动力学特性的源数据集,是否能显著提升离线强化学习性能,同时仅使用极少量的目标离线数据?
  • RQ2在离线强化学习中,如何显式建模并缓解源环境与目标环境之间的动态漂移问题?
  • RQ3基于状态-动作-下一个状态分布的奖励增强,在不同动力学特性的环境中,能在多大程度上提升策略的泛化能力?
  • RQ4所提出的 DARA 框架是否能在包括真实世界机器人任务在内的多种环境中保持性能优势?
  • RQ5DARA 是否能无缝集成到现有的无模型和基于模型的离线强化学习算法中,而无需进行架构修改?

主要发现

  • 仅使用标准目标离线数据量的 10%(1T)时,基于 DARA 的方法在 D4RL Walker2d 环境中表现优于基线方法,取得了 53.8 的归一化得分,而表现最佳的基线为 44.6。
  • 在 Hopper 环境中存在联合噪声漂移的情况下,DARA 使用 1T 数据取得了 111.0 的归一化得分,显著优于基线方法 MOPO(98.7)及其他方法。
  • 在真实世界四足机器人任务中,DARA 仅使用少量目标数据即实现了强大的策略迁移,展现出超越仿真的鲁棒性。
  • 在各种动力学漂移(包括质量变化和关节噪声)条件下,DARA 在所有 D4RL 任务(Walker2d、Hopper、HalfCheetah)中均持续提升了性能。
  • 当目标数据稀缺时,DARA 显著降低了性能退化,表明动力学感知的奖励塑造能有效缓解动态漂移带来的负面影响。
  • 该框架在模拟和真实世界任务中均取得了最先进水平的结果,即使在目标数据极少的情况下也保持了优异性能,证实了其有效性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。