Skip to main content
QUICK REVIEW

[论文解读] Shared Experience Actor-Critic for Multi-Agent Reinforcement Learning

Filippos Christianos, Lukas Schäfer|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 40被引用 22
一句话总结

该论文提出了一种名为共享经验演员-评论家(Shared Experience Actor-Critic, SEAC)的多智能体强化学习算法,通过结合智能体自身经验的梯度与来自其他智能体经验的加权梯度,增强探索能力。在稀疏奖励环境中,SEAC实现了更快的学习速度和更高的回报,训练步数最多减少70%,优于独立学习、共享策略训练以及当前最先进的多智能体强化学习方法(如MADDPG和QMIX),同时计算开销增加不足3%。

ABSTRACT

Exploration in multi-agent reinforcement learning is a challenging problem, especially in environments with sparse rewards. We propose a general method for efficient exploration by sharing experience amongst agents. Our proposed algorithm, called Shared Experience Actor-Critic (SEAC), applies experience sharing in an actor-critic framework. We evaluate SEAC in a collection of sparse-reward multi-agent environments and find that it consistently outperforms two baselines and two state-of-the-art algorithms by learning in fewer steps and converging to higher returns. In some harder environments, experience sharing makes the difference between learning to solve the task and not learning at all.

研究动机与目标

  • 为解决多智能体强化学习中效率低下的探索问题,特别是在智能体难以发现有利联合动作的稀疏奖励环境中。
  • 克服智能体学习速率不一致的问题,该问题会阻碍协调并降低整体样本效率。
  • 开发一种简单且可扩展的经验共享方法,无需复杂架构、额外网络或超参数调优。
  • 评估与其他独立或集中式训练方法相比,共享其他智能体的经验是否能显著提升学习速度和最终性能。
  • 证明经验共享能够更有效地帮助智能体学习协调策略,即使单个智能体的探索能力有限。

提出的方法

  • SEAC在演员-评论家框架内运行,每个智能体使用自身梯度与来自其他智能体经验的加权梯度组合来更新其策略和价值函数。
  • 该方法将每个智能体的本地梯度与来自其他智能体轨迹的重要性加权梯度相结合,实现在不需策略完全一致的情况下实现共享学习。
  • 采用重要性采样以校正离策略更新,确保在使用非相同策略的经验时仍能保持训练稳定性。
  • 算法保持去中心化执行,允许智能体在推理时独立行动,同时在训练阶段受益于集中式经验共享。
  • 与MADDPG或COMA不同,SEAC避免学习联合动作价值函数或复杂评论家网络,从而降低了架构复杂度。
  • 该方法计算轻量化,相比独立学习仅增加不足3%的开销,且无需额外的超参数调优。

实验结果

研究问题

  • RQ1在稀疏奖励的多智能体强化学习中,跨智能体共享经验是否能提升样本效率?
  • RQ2经验共享是否能缓解智能体学习速率不一致的问题,从而避免协调困难和性能下降?
  • RQ3与当前最先进的多智能体强化学习算法(如MADDPG、QMIX和ROMA)相比,SEAC在学习速度和最终回报方面表现如何?
  • RQ4当单个智能体探索能力有限时,经验共享在多大程度上能帮助智能体学习协调策略?
  • RQ5在多智能体设置中,一种简单轻量的经验共享机制是否能超越更复杂的集中式训练方法?

主要发现

  • 在稀疏奖励环境中,SEAC实现最优性能所需的训练步数相比独立学习最多减少70%。
  • 在LBF和RWARE等环境中,SEAC使MADDPG完全无法学习的任务得以成功训练,展现出更高的样本效率和更强的鲁棒性。
  • 在最终回报和学习速度方面,SEAC始终优于共享策略训练以及QMIX和ROMA等先进算法。
  • 使用SEAC训练的智能体学习进度趋于一致,避免了独立学习(IAC)中常见的学习进度发散问题,从而避免了次优性能。
  • 与独立学习相比,该方法仅引入不足3%的额外计算开销,具有高度的效率和实际部署可行性。
  • SEAC中的重要性采样未引起显著的训练不稳定,与标准离策略强化学习不同,表明经过适当加权的经验共享具有稳定性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。