[论文解读] Plan Better Amid Conservatism: Offline Multi-Agent Reinforcement Learning with Actor Rectification
该论文提出了一种名为OMAR的新颖离线多智能体强化学习算法,通过将一阶策略梯度与零阶优化相结合,改进了保守价值函数中的策略优化,解决了多智能体设置下性能退化的问题。OMAR通过利用零阶优化发现的动作来校正演员策略,在连续控制和离散控制基准测试中均实现了最先进性能,显著优于现有的保守离线MARL方法。
Conservatism has led to significant progress in offline reinforcement learning (RL) where an agent learns from pre-collected datasets. However, as many real-world scenarios involve interaction among multiple agents, it is important to resolve offline RL in the multi-agent setting. Given the recent success of transferring online RL algorithms to the multi-agent setting, one may expect that offline RL algorithms will also transfer to multi-agent settings directly. Surprisingly, we empirically observe that conservative offline RL algorithms do not work well in the multi-agent setting -- the performance degrades significantly with an increasing number of agents. Towards mitigating the degradation, we identify a key issue that non-concavity of the value function makes the policy gradient improvements prone to local optima. Multiple agents exacerbate the problem severely, since the suboptimal policy by any agent can lead to uncoordinated global failure. Following this intuition, we propose a simple yet effective method, Offline Multi-Agent RL with Actor Rectification (OMAR), which combines the first-order policy gradients and zeroth-order optimization methods to better optimize the conservative value functions over the actor parameters. Despite the simplicity, OMAR achieves state-of-the-art results in a variety of multi-agent control tasks.
研究动机与目标
- 识别随着智能体数量增加时,保守离线多智能体强化学习算法性能退化的原因。
- 解决在保守性约束下,由于价值函数非凹性导致演员优化陷入不良局部最优解的问题。
- 开发一种方法,通过改进高维、多智能体动作空间中的策略优化,更好地利用保守评论家。
- 在不依赖探索的情况下实现有效的离线多智能体学习,仅使用预先收集的数据集。
- 证明结合一阶和零阶优化可实现更安全、更有效的离线MARL策略改进。
提出的方法
- OMAR引入了一种新颖的演员校正机制,将标准的一阶策略梯度与零阶优化相结合,以改进策略更新。
- 零阶组件维护一个动作的采样分布,并基于Q值估计迭代改进该分布,以发现更优动作。
- 在演员损失中添加正则化项,以鼓励策略模仿零阶优化器生成的动作,从而提升探索与协调能力。
- 该方法设计为兼容去中心化与中心化训练范式,包括CTDE(中心化训练、去中心化执行)。
- 算法采用混合优化策略:使用一阶梯度实现高效策略更新,同时利用零阶方法逃离局部最优并提升鲁棒性。
- 提出一种有效的采样机制,基于Q值反馈对零阶优化器的动作分布进行精细化调整,从而增强收敛性与性能。
实验结果
研究问题
- RQ1为何像CQL这样的保守离线强化学习算法在多智能体设置中随着智能体数量增加而性能显著下降?
- RQ2在保守离线MARL中,导致策略优化失败的根本原因是什么,特别是在局部最优和行为不协调方面?
- RQ3能否通过结合一阶策略梯度与零阶优化,改善保守离线多智能体环境中的策略学习?
- RQ4所提出的演员校正机制如何提升高维联合动作空间中的协调性与性能?
- RQ5与标准保守离线MARL方法相比,OMAR中采用的混合优化方法是否能带来更安全、更有效的策略改进?
主要发现
- 在所有基准环境(包括合作导航、捕食者-猎物以及StarCraft II微操控制任务)中,OMAR显著优于MA-CQL、MA-TD3+BC和MA-ICQ。
- 在StarCraft II微操控制基准测试中,OMAR在专家数据集上取得了105.9 ± 3.6的归一化得分,优于MA-TD3+BC(108.1 ± 3.3),并显著超过MA-CQL(69.5 ± 15.7)。
- 在使用专家数据的CN(合作导航)环境中,OMAR取得了96.7 ± 4.1的归一化得分,优于MA-ICQ(96.7 ± 4.1)、MA-TD3+BC(108.1 ± 3.3)和MA-CQL(69.5 ± 15.7)。
- 即使仅使用完整回放缓冲区的1%数据,OMAR仍优于MA-CQL,且随着数据量增加,性能持续提升,更接近在线智能体的性能表现。
- 在中心化训练、去中心化执行(CTDE)设置下,OMAR(中心化)在随机数据集上取得21.6 ± 4.6分,在中等数据集上取得33.7 ± 14.5分,优于MA-CQL,并在专家设置下与MA-TD3+BC持平。
- 消融实验确认,零阶优化器有助于演员逃离性能较差的局部最优解,尤其在大规模、高维动作空间中,标准方法往往失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。