Skip to main content
QUICK REVIEW

[论文解读] Supported Policy Optimization for Offline Reinforcement Learning

Jialong Wu, Haixu Wu|arXiv (Cornell University)|Feb 13, 2022
Reinforcement Learning in Robotics被引用 11
一句话总结

本文提出支持策略优化(SPOT),一种可插拔的离线强化学习正则化方法,通过基于变分自编码器(VAE)的估计器显式建模行为策略的密度,以实现支持约束。SPOT在D4RL基准上取得最先进性能,并通过与标准off-policy算法兼容,实现强大的在线微调。

ABSTRACT

Policy constraint methods to offline reinforcement learning (RL) typically utilize parameterization or regularization that constrains the policy to perform actions within the support set of the behavior policy. The elaborative designs of parameterization methods usually intrude into the policy networks, which may bring extra inference cost and cannot take full advantage of well-established online methods. Regularization methods reduce the divergence between the learned policy and the behavior policy, which may mismatch the inherent density-based definition of support set thereby failing to avoid the out-of-distribution actions effectively. This paper presents Supported Policy OpTimization (SPOT), which is directly derived from the theoretical formalization of the density-based support constraint. SPOT adopts a VAE-based density estimator to explicitly model the support set of behavior policy and presents a simple but effective density-based regularization term, which can be plugged non-intrusively into off-the-shelf off-policy RL algorithms. SPOT achieves the state-of-the-art performance on standard benchmarks for offline RL. Benefiting from the pluggable design, offline pretrained models from SPOT can also be applied to perform online fine-tuning seamlessly.

研究动机与目标

  • 解决现有策略约束方法在离线强化学习中的局限性,特别是推理效率与有效避免分布外动作之间的权衡。
  • 开发一种非侵入式、可插拔的正则化技术,直接强制执行行为策略的理论密度支持约束。
  • 实现高性能的离线预训练,并通过成熟的在线强化学习算法实现无缝的在线微调。
  • 减少对侵入式网络结构修改或无法有效约束分布外动作的不匹配差异正则化方法的依赖。

提出的方法

  • 从支持集的理论形式化中推导出基于密度的正则化项,直接约束策略仅在行为策略支持范围内采取动作。
  • 采用基于变分自编码器(VAE)的密度估计器,显式建模行为策略的密度,从而从离线数据中准确估计支持集。
  • 以非侵入式、即插即用的方式将密度正则化项集成到现成的off-policy强化学习算法(如TD3)中,推理时仅需一次前向传播。
  • 使用可学习的正则化权重来平衡策略优化目标与密度约束,并在在线微调过程中采用衰减调度。
  • 通过最小化离线与在线学习目标之间的差距,确保与标准在线强化学习目标的兼容性,从而实现有效的在线迁移。
  • 在训练过程中利用基于VAE的密度估计器计算正则化损失,对低估计行为策略密度的动作施加惩罚。

实验结果

研究问题

  • RQ1非侵入式、基于密度的正则化方法是否能在离线强化学习中超越现有的参数化方法与基于差异的正则化方法?
  • RQ2通过基于VAE的密度估计器显式建模行为策略的支持集,是否能提升在具有挑战性的离线强化学习基准上的泛化能力与鲁棒性?
  • RQ3SPOT是否能在标准D4RL离线强化学习基准上实现最先进性能,同时支持有效的在线微调?
  • RQ4与现有的基于参数化方法和基于正则化的方法相比,SPOT在推理效率与训练开销方面表现如何?
  • RQ5正则化权重的选择在多大程度上影响性能?是否可以在无需大量在线评估的情况下进行选择?

主要发现

  • SPOT在D4RL离线强化学习基准上达到最先进性能,在MuJoCo和AntMaze环境上均优于IQL和TD3+BC等强基线方法。
  • 在AntMaze环境中,SPOT在大型迷宫上达到最终回报90.8,显著优于最强基线IQL(73.4),并超过从零开始的在线训练性能。
  • SPOT在离线预训练后可实现无缝的在线微调,在AntMaze大型迷宫上相比初始离线性能提升17.4分。
  • SPOT的推理计算效率高,仅需一次策略网络前向传播,速度比BCQ快两倍以上,与TD3+BC相当。
  • SPOT的训练时间仅略高于TD3+BC,远低于基于参数化的方法(如BCQ),展现出性能与效率之间的有利权衡。
  • 消融实验表明,基于密度的正则化比基于差异的正则化在避免分布外动作方面更有效,验证了SPOT的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。