[论文解读] Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL
该论文提出 MABE,一种基于模型的离线强化学习算法,通过将自适应行为先验与学习到的动力学模型相结合,在无需不确定性量化的情况下提升性能和领域泛化能力。MABE 在 D4RL 基准上达到最先进性能,并在跨领域迁移任务中表现优异,通过显式地利用 KL 散度对策略进行正则化以匹配自适应行为先验,优于先前的无模型和基于模型的方法。
Offline Reinforcement Learning (RL) aims to extract near-optimal policies from imperfect offline data without additional environment interactions. Extracting policies from diverse offline datasets has the potential to expand the range of applicability of RL by making the training process safer, faster, and more streamlined. We investigate how to improve the performance of offline RL algorithms, its robustness to the quality of offline data, as well as its generalization capabilities. To this end, we introduce Offline Model-based RL with Adaptive Behavioral Priors (MABE). Our algorithm is based on the finding that dynamics models, which support within-domain generalization, and behavioral priors, which support cross-domain generalization, are complementary. When combined together, they substantially improve the performance and generalization of offline RL policies. In the widely studied D4RL offline RL benchmark, we find that MABE achieves higher average performance compared to prior model-free and model-based algorithms. In experiments that require cross-domain generalization, we find that MABE outperforms prior methods. Our website is available at https://sites.google.com/berkeley.edu/mabe .
研究动机与目标
- 在低质量或非专家的离线数据存在的情况下,提升离线强化学习算法的性能与鲁棒性。
- 在不依赖不确定性量化的情况下,增强离线强化学习中的领域泛化与迁移学习能力。
- 开发一种基于模型的强化学习框架,同时利用动力学模型实现域内泛化,以及利用行为先验实现跨域泛化。
- 证明通过自适应行为先验显式正则化策略,可优于基于不确定性的保守性方法在离线强化学习中的表现。
提出的方法
- MABE 使用监督学习从离线数据集中学习动力学模型和奖励函数。
- 它构建一个自适应行为先验,为数据集中高回报轨迹分配更高的重要性。
- 该算法通过使用学习到的动力学模型生成合成轨迹,执行基于模型的强化学习。
- 策略通过 SAC 训练,并施加显式的 KL 散度惩罚,以促使策略保持在自适应行为先验附近,从而确保保守性。
- 自适应行为先验通过强化学习微调端到端学习,相比未加权先验,显著提升稳定性和最终性能。
- 该方法通过使用自适应行为先验作为直接正则化信号,避免不确定性量化,降低对复杂不确定性估计的依赖。
实验结果
研究问题
- RQ1将动力学模型与自适应行为先验结合,是否能超越现有无模型和基于模型的方法,进一步提升离线强化学习性能?
- RQ2与未加权或非自适应先验相比,基于轨迹回报加权的自适应行为先验是否能提升训练稳定性与最终策略性能?
- RQ3MABE 是否能在不依赖动力学模型不确定性估计的情况下,实现强大的零样本领域迁移性能?
- RQ4在 D4RL 基准上,MABE 与最先进离线强化学习算法相比,在样本效率和对数据质量鲁棒性方面表现如何?
主要发现
- MABE 在 D4RL 基准的 9 个环境上实现最高平均性能,在 9 个数据集中有 7 个排名第一。
- 在跨领域泛化任务中,MABE 显著优于先前方法,展现出强大的跨领域迁移能力。
- 使用自适应行为先验相比未加权或未正则化的先验,能带来更稳定的训练过程和更优的最终性能。
- MABE 在无需动力学模型不确定性估计的情况下实现最先进结果,使其适用于高维或混杂场景中不确定性估计困难的情形。
- 消融实验确认,对行为先验进行强化学习微调对性能至关重要,未加权先验表现明显更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。