[论文解读] Multi-Agent Reinforcement Learning with Multi-Step Generative Models
本文提出了一种基于解耦多步生成模型的多智能体强化学习框架,以提升样本效率,并在连续控制任务中实现合作与竞争行为的学习。通过在解耦的潜在空间中建模轨迹片段,该方法实现了对智能体行为的解耦,从而支持独立优化,在数据有限的情况下仍优于无模型基线方法。
We consider model-based reinforcement learning (MBRL) in 2-agent, high-fidelity continuous control problems -- an important domain for robots interacting with other agents in the same workspace. For non-trivial dynamical systems, MBRL typically suffers from accumulating errors. Several recent studies have addressed this problem by learning latent variable models for trajectory segments and optimizing over behavior in the latent space. In this work, we investigate whether this approach can be extended to 2-agent competitive and cooperative settings. The fundamental challenge is how to learn models that capture interactions between agents, yet are disentangled to allow for optimization of each agent behavior separately. We propose such models based on a disentangled variational auto-encoder, and demonstrate our approach on a simulated 2-robot manipulation task, where one robot can either help or distract the other. We show that our approach has better sample efficiency than a strong model-free RL baseline, and can learn both cooperative and adversarial behavior from the same data.
研究动机与目标
- 解决多智能体连续控制问题中基于模型的强化学习(MBRL)的误差累积问题。
- 开发一种能够捕捉智能体间交互作用,同时支持各智能体行为独立优化的生成模型。
- 证明单一多步生成模型在混合合作或竞争数据上进行训练后,可同时支持合作与对抗性策略学习。
- 在高保真机器人操作任务中,相比无模型强化学习基线,提升样本效率。
提出的方法
- 该方法采用解耦变分自编码器(VAE)学习一个联合潜在空间,用于建模两个智能体的多步轨迹片段。
- 使用条件VAE基于初始状态和动作预测未来轨迹片段,潜在空间编码每个智能体的“策略空间”。
- 通过变分下界估计互信息,强制两个智能体潜在变量之间的解耦,从而支持独立优化。
- 在潜在空间中使用模型预测控制(MPC)进行轨迹优化,选择首个动作片段在环境中执行。
- 该方法在合作与竞争场景的数据上端到端进行训练,实现任务间的共享模型学习。
- 通过推理阶段重加权奖励,使同一数据集支持合作与对抗行为的学习。
实验结果
研究问题
- RQ1多步生成模型能否被扩展至两智能体连续控制任务,同时保持智能体间的解耦?
- RQ2如何在潜在空间中捕捉智能体间的交互作用,同时仍支持各智能体行为的独立优化?
- RQ3在混合合作与竞争数据上训练的单一模型能否同时支持合作与对抗性策略学习?
- RQ4所提方法在多智能体设置下是否相比无模型强化学习实现更好的样本效率?
- RQ5解耦的潜在表示能否有效编码多智能体环境中的策略行为?
主要发现
- 所提出的MBRL方法在合作与竞争的双机器人操作任务中均优于MFRL基线方法(MADDPG),获得了更高的平均奖励。
- 仅使用65万次训练步骤,MBRL模型在合作任务中实现了-0.72 ± 0.44的平均奖励,而MADDPG为-1.79 ± 0.76。
- 在竞争任务中,基于合作数据(co-op)训练的MBRL模型在“keep”任务中得分达到7.77 ± 3.12,优于MADDPG基线的6.43 ± 3.97。
- 基于竞争数据(comp)训练的MBRL模型在“keep”任务中得分达到8.26 ± 2.81,显著优于MADDPG基线。
- 该方法展示了改进的样本效率,在较少数据训练时表现出明显性能优势。
- 生成轨迹的可视化结果表明,潜在空间编码了不同的策略,支持将潜在空间解释为策略空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。