Skip to main content
QUICK REVIEW

[论文解读] A Policy-Guided Imitation Approach for Offline Reinforcement Learning

Haoran Xu, Lì Jiāng|arXiv (Cornell University)|Oct 15, 2022
Reinforcement Learning in Robotics被引用 10
一句话总结

本文提出了一种新型离线强化学习框架——策略引导离线强化学习(POR),该框架将策略学习解耦为引导策略(预测最优下一状态)和执行策略(将状态映射到动作)。通过实现状态组合性而非动作组合性,POR在D4RL基准上实现了最先进性能,尤其在低质量数据集上表现优异,同时可通过重训练引导策略实现对新任务的高效适应,并借助补充的次优数据提升泛化能力。

ABSTRACT

Offline reinforcement learning (RL) methods can generally be categorized into two types: RL-based and Imitation-based. RL-based methods could in principle enjoy out-of-distribution generalization but suffer from erroneous off-policy evaluation. Imitation-based methods avoid off-policy evaluation but are too conservative to surpass the dataset. In this study, we propose an alternative approach, inheriting the training stability of imitation-style methods while still allowing logical out-of-distribution generalization. We decompose the conventional reward-maximizing policy in offline RL into a guide-policy and an execute-policy. During training, the guide-poicy and execute-policy are learned using only data from the dataset, in a supervised and decoupled manner. During evaluation, the guide-policy guides the execute-policy by telling where it should go so that the reward can be maximized, serving as the extit{Prophet}. By doing so, our algorithm allows extit{state-compositionality} from the dataset, rather than extit{action-compositionality} conducted in prior imitation-style methods. We dumb this new approach Policy-guided Offline RL ( exttt{POR}). exttt{POR} demonstrates the state-of-the-art performance on D4RL, a standard benchmark for offline RL. We also highlight the benefits of exttt{POR} in terms of improving with supplementary suboptimal data and easily adapting to new tasks by only changing the guide-poicy.

研究动机与目标

  • 解决现有离线强化学习方法的局限性:基于强化学习的方法存在离策略评估误差,而基于模仿的方法过于保守,无法泛化到数据集之外。
  • 开发一种方法,继承基于模仿方法的训练稳定性,同时实现逻辑上的分布外泛化。
  • 从数据集中实现状态组合性,使策略学习比以往方法中的动作组合性更具灵活性和泛化能力。
  • 通过仅重训练引导策略而非重训练执行策略,实现对新任务的高效适应。
  • 通过解耦训练方案利用补充的次优数据,提升在低质量数据集上的性能。

提出的方法

  • 将离线强化学习任务分解为两个独立策略:引导策略(根据当前状态预测最优下一状态),以及执行策略(将状态映射到动作)。
  • 仅使用离线数据集中的转移样本,以解耦的监督方式训练引导策略和执行策略,避免离策略评估和分布偏移问题。
  • 采用两阶段训练流程:首先在专家数据上训练执行策略,然后在专家或次优数据上训练引导策略,以引导执行策略向高回报状态前进。
  • 引入一种“混合”训练方案,结合专家数据与无动作的次优数据(如视频演示),以提升引导策略的泛化能力和性能。
  • 推理时,引导策略为执行策略提供目标下一状态,通过状态组合实现逻辑上的分布外泛化。
  • 通过仅用新奖励函数重训练引导策略而保持执行策略固定,实现对新任务的快速部署。

实验结果

研究问题

  • RQ1我们能否在不依赖离策略价值函数评估的情况下,实现离线强化学习中的稳定训练和分布外泛化?
  • RQ2状态组合性——即从数据集中学习组合最优下一状态——是否比基于模仿方法中的动作组合性能带来更好的泛化能力?
  • RQ3解耦的引导策略与执行策略框架是否能提升在低质量或次优数据集上的离线强化学习性能?
  • RQ4引导策略能否通过仅重训练实现高效适应新任务,而无需修改执行策略?
  • RQ5补充的次优数据(如视频或第三人称演示)能否通过解耦训练方案有效提升策略性能?

主要发现

  • POR在D4RL基准上实现了最先进性能,尤其在低质量数据集上表现突出,此时分布外泛化能力至关重要。
  • ‘混合’训练方案结合专家数据与次优数据,使POR在hopper环境中达到99的归一化得分,接近性能上限。
  • 在四房间环境中,POR通过仅重训练引导策略(保持执行策略不变),成功解决了新任务(如绕过河流或获取钥匙)。
  • 引导策略展现出强大的泛化能力,正确引导智能体在任务B中避开河流,在任务C中优先收集钥匙。
  • 在hopper和walker2d环境中,POR在采用‘混合’训练方案时全面超越所有基线方法,而该方案仅因引导策略与执行策略的解耦训练才得以实现。
  • 该方法对数据质量具有鲁棒性,并可通过轻量级引导策略微调实现高效的少样本任务适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。