[论文解读] Offline Reinforcement Learning with Pseudometric Learning
本文提出PLOff,一种离线强化学习方法,通过从记录的转移数据中学习状态-动作伪度量,以减少分布外动作外推。通过在演员-评论家框架中使用该学习到的伪度量计算基于查找的奖励,PLOff在D4RL手部操作和运动控制任务上提升了策略性能,以一种新颖且与任务相关的接近度度量,达到或超越了当前最先进结果。
Offline Reinforcement Learning methods seek to learn a policy from logged transitions of an environment, without any interaction. In the presence of function approximation, and under the assumption of limited coverage of the state-action space of the environment, it is necessary to enforce the policy to visit state-action pairs close to the support of logged transitions. In this work, we propose an iterative procedure to learn a pseudometric (closely related to bisimulation metrics) from logged transitions, and use it to define this notion of closeness. We show its convergence and extend it to the function approximation setting. We then use this pseudometric to define a new lookup based bonus in an actor-critic algorithm: PLOFF. This bonus encourages the actor to stay close, in terms of the defined pseudometric, to the support of logged transitions. Finally, we evaluate the method on hand manipulation and locomotion tasks.
研究动机与目标
- 为解决在使用函数逼近时,离线强化学习中的分布外动作外推问题。
- 从记录的转移数据中学习一种与任务相关的状态-动作对伪度量,将先前关于双生度量的工作扩展至离线和状态-动作设置。
- 设计一种基于该伪度量的奖励机制,以鼓励策略保持在记录转移数据的支持范围内。
- 将基于伪度量的奖励整合到标准演员-评论家算法中,以提升样本效率和性能。
- 在具有挑战性的D4RL基准任务上实证验证该方法,证明其与当前最先进离线强化学习方法具有竞争力。
提出的方法
- 该方法使用受孪生网络启发的神经网络架构,通过基于预期回报差异的对比损失,学习状态-动作对上的伪度量。
- 伪度量被定义为一种类似贝尔曼算子的固定点,其基于共享动作序列上的累积奖励差异来度量相似性。
- 利用学习到的伪度量计算基于查找的奖励,对远离记录转移数据支持范围的动作进行惩罚。
- 该奖励以两种方式应用:在演员更新期间过滤非可接受动作,以及在评论家评估期间惩罚对分布外动作的高价值预测。
- 通过一种联合嵌入状态-动作对并计算伪度量的神经网络架构,将该方法扩展至函数逼近。
- 训练过程为迭代式,通过在离线数据集上多次遍历来逐步优化伪度量。
实验结果
研究问题
- RQ1在离线强化学习中,从记录转移数据中学习到的状态-动作对伪度量能否有效衡量与记录转移数据支持范围的接近程度?
- RQ2如何利用此类伪度量设计一种实用的奖励机制,以在函数逼近设置中减少外推误差?
- RQ3所提出的PLOff方法是否在标准基准环境上优于现有离线强化学习算法?
- RQ4该伪度量学习过程在表格设置和深度学习设置中是否稳定且收敛?
- RQ5与使用行为克隆或分布约束的方法相比,PLOff的性能如何?
主要发现
- PLOff在D4RL基准的手部操作套件中实现了最先进性能,优于现有方法。
- 在运动控制任务中,PLOff在对比方法中排名第二,展现出在多样化控制环境中的强大泛化能力。
- 学习到的伪度量成功捕捉了MDP中的结构相似性,实现了对分布外动作的有效过滤。
- 该方法在表格设置中表现出收敛性,并能良好泛化至通过神经网络实现的函数逼近。
- 在离线设置中,基于伪度量的奖励提供了比分布约束或行为克隆更有效的归纳偏差。
- 查找奖励的计算成本通过提升鲁棒性和性能得到合理化,尤其在低数据场景下表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。