Skip to main content
QUICK REVIEW

[论文解读] PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning Algorithm

Toygun Başaklar, Suat Gümüşsoy|arXiv (Cornell University)|Aug 16, 2022
Reinforcement Learning in Robotics被引用 8
一句话总结

该论文提出PD-MORL,一种偏好驱动的多目标强化学习算法,通过训练单一通用策略网络覆盖连续控制任务中的整个偏好空间。通过将偏好向量作为输入,使用修改后的贝尔曼更新中的余弦相似度,并实现偏好子空间的并行探索,PD-MORL在性能上实现高达25%的超体积提升,且参数量较先前方法减少一个数量级。

ABSTRACT

Multi-objective reinforcement learning (MORL) approaches have emerged to tackle many real-world problems with multiple conflicting objectives by maximizing a joint objective function weighted by a preference vector. These approaches find fixed customized policies corresponding to preference vectors specified during training. However, the design constraints and objectives typically change dynamically in real-life scenarios. Furthermore, storing a policy for each potential preference is not scalable. Hence, obtaining a set of Pareto front solutions for the entire preference space in a given domain with a single training is critical. To this end, we propose a novel MORL algorithm that trains a single universal network to cover the entire preference space scalable to continuous robotic tasks. The proposed approach, Preference-Driven MORL (PD-MORL), utilizes the preferences as guidance to update the network parameters. It also employs a novel parallelization approach to increase sample efficiency. We show that PD-MORL achieves up to 25% larger hypervolume for challenging continuous control tasks and uses an order of magnitude fewer trainable parameters compared to prior approaches.

研究动机与目标

  • 解决多目标强化学习(MORL)中目标与约束频繁变化所带来的可扩展性与动态重构挑战。
  • 通过学习单一策略以泛化于所有可能的偏好向量,消除重新训练的需求。
  • 通过偏好引导训练与并行探索,提升连续控制任务中的样本效率与帕累托前沿覆盖度。
  • 在保持或提升性能的同时,降低模型复杂度,适用于多样化的MORL基准测试。
  • 提供一种可扩展的统一解决方案,支持推理时实时指定偏好而无需重新训练。

提出的方法

  • 该算法使用一个同时接收状态与偏好向量作为输入的神经网络,使单一策略能够泛化于所有偏好。
  • 提出一种偏好驱动的贝尔曼最优算子,利用偏好向量与Q值向量之间的余弦相似度来引导学习过程。
  • 多维插值器将原始偏好向量投影到归一化解空间,以使偏好与帕累托最优解对齐。
  • 采用事后经验回放(HER)以缓解不同偏好子空间间的数据不平衡问题。
  • 将偏好空间划分为子空间,并通过并行子进程独立收集转移数据,以确保无偏且高效的探索。
  • 该方法兼容离策略算法,针对离散动作实现为MO-DDQN-HER,针对连续控制任务实现为MO-TD3-HER。

实验结果

研究问题

  • RQ1能否训练单一神经网络策略,使其在多目标强化学习中泛化于整个连续偏好空间?
  • RQ2将偏好向量与Q值之间的余弦相似度引入,如何提升策略与帕累托前沿的对齐程度?
  • RQ3在偏好子空间中进行并行探索在多大程度上提升了样本效率并减少了训练偏差?
  • RQ4与PG-MORL及缺少关键组件的PD-MORL等先前方法相比,所提方法在超体积与稀疏性指标上的表现如何?
  • RQ5使用多维插值器进行偏好投影是否能实现与真实帕累托前沿更好的对齐?

主要发现

  • 在具有挑战性的连续控制任务(如MO-HalfCheetah-v2、MO-Hopper-v2)中,PD-MORL实现的超体积较先前方法最高提升25%。
  • 该算法使用的可训练参数量较现有方法减少一个数量级,同时保持或提升了性能。
  • 在损失函数中移除方向角项会显著降低性能,尤其是在帕累托前沿密集区域,表现为稀疏性增加与超体积下降。
  • 并行探索至关重要:禁用该机制导致所有基准测试中超体积显著下降,稀疏性显著上升。
  • 消融研究证实,余弦相似度、HER与并行探索的组合对实现卓越性能至关重要,PD-MORL在缺少这些组件的变体中表现更优。
  • 在MO-Hopper-v2任务中,PD-MORL实现1.88×10⁷的超体积,超过PG-MORL(2.02×10⁷)在相同参考点下的表现,且稀疏性最低(0.3×10⁴),表明其帕累托前沿覆盖更密集且更广泛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。