[论文解读] Selectively Sharing Experiences Improves Multi-Agent Reinforcement Learning
本文提出 SUPER(选择性多智能体优先经验中继),一种去中心化的多智能体强化学习框架,通过仅在智能体之间选择性地共享最高时间差分(TD)误差的经验来提升学习效率。通过优先处理并中继最具信息量的转移——以 TD 误差作为相关性代理——SUPER 在仅使用极少通信带宽的情况下,实现了比非共享 DQN 和当前最先进多智能体算法更快的收敛速度和更优的性能表现。
We present a novel multi-agent RL approach, Selective Multi-Agent Prioritized Experience Relay, in which agents share with other agents a limited number of transitions they observe during training. The intuition behind this is that even a small number of relevant experiences from other agents could help each agent learn. Unlike many other multi-agent RL algorithms, this approach allows for largely decentralized training, requiring only a limited communication channel between agents. We show that our approach outperforms baseline no-sharing decentralized training and state-of-the art multi-agent RL algorithms. Further, sharing only a small number of highly relevant experiences outperforms sharing all experiences between agents, and the performance uplift from selective experience sharing is robust across a range of hyperparameters and DQN variants. A reference implementation of our algorithm is available at https://github.com/mgerstgrasser/super.
研究动机与目标
- 通过利用智能体间的经验共享,解决多智能体强化学习中的非平稳性与高方差问题。
- 在无需集中式训练基础设施的前提下,提升去中心化训练环境中的样本效率与学习速度。
- 探究基于 TD 误差的选择性、优先级经验共享是否能在多智能体 DQN 环境中优于无差别或均匀的经验共享。
- 开发一种通信高效的半去中心化训练范式,在保持智能体自主性的同时实现协作学习。
提出的方法
- 各智能体独立使用 DQN 及其自身的经验回放缓冲区进行训练。
- 每个智能体计算其经验回放缓冲区中每个转移的时间差分(TD)误差,以评估学习不确定性。
- 仅选择 TD 误差最高的前 k 个经验进行与其他智能体的共享。
- 共享的经验被直接插入接收智能体的经验回放缓冲区,从而实现基于优先数据的离策略学习。
- 该方法兼容个体智能体中是否使用优先经验回放(PER)的设置。
- 通信仅限于最相关经验,最大限度减少带宽消耗,同时最大化学习影响。
实验结果
研究问题
- RQ1与不共享或全部共享相比,选择性共享高影响力经验是否能提升多智能体强化学习性能?
- RQ2使用 TD 误差作为经验选择启发式方法,是否能带来比均匀或随机选择更高的学习效率与最终性能?
- RQ3即使通信量极少,去中心化训练框架是否仍能达到与集中式训练方法相当的性能?
- RQ4选择性经验共享的性能增益在不同超参数与 DQN 变体下是否具有鲁棒性?
- RQ5确定性与随机性经验选择方式对性能有何影响,原因是什么?
主要发现
- SUPER 在所有评估环境与超参数设置下,均优于非共享的去中心化 DQN 训练。
- 仅共享最高 TD 误差经验的选择性共享方式显著优于共享所有经验,表明无差别共享具有破坏性影响。
- 选择性经验共享带来的性能增益在不同 DQN 变体与超参数配置下均表现稳健。
- 采用确定性方式选择前几项经验(而非随机选择)可获得略优结果,可能是因为共享仅发生一次,减少了遗漏关键经验的风险。
- 即使在极低通信带宽条件下,该方法仍表现出强劲性能,证明其在资源受限环境中的可行性。
- SUPER 在稀疏奖励环境中显著优于当前最先进算法(如 MADDPG 和 SEAC)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。