[论文解读] Weighted Double Deep Multiagent Reinforcement Learning in Stochastic Cooperative Environments
本文提出加权双Deep Q-Network(WDDQN),一种多智能体深度强化学习框架,通过结合加权双估计算法、宽松奖励网络和调度回放策略,解决合作环境中非平稳性和随机性问题。WDDQN在复杂、视觉丰富且具有随机性的环境中,相较于DDQN和宽松Q-learning,实现了更快的收敛速度和更高的平均奖励。
Recently, multiagent deep reinforcement learning (DRL) has received increasingly wide attention. Existing multiagent DRL algorithms are inefficient when facing with the non-stationarity due to agents update their policies simultaneously in stochastic cooperative environments. This paper extends the recently proposed weighted double estimator to the multiagent domain and propose a multiagent DRL framework, named weighted double deep Q-network (WDDQN). By utilizing the weighted double estimator and the deep neural network, WDDQN can not only reduce the bias effectively but also be extended to scenarios with raw visual inputs. To achieve efficient cooperation in the multiagent domain, we introduce the lenient reward network and the scheduled replay strategy. Experiments show that the WDDQN outperforms the existing DRL and multiaent DRL algorithms, i.e., double DQN and lenient Q-learning, in terms of the average reward and the convergence rate in stochastic cooperative environments.
研究动机与目标
- 解决合作型多智能体强化学习环境中非平稳性和随机性带来的挑战。
- 克服现有深度Q网络(DQN)和双DQN(DDQN)在具有原始视觉输入的多智能体设置下存在的不稳定性和收敛性差的问题。
- 通过集成加权双估计算法和优先经验回放等先进组件,提升学习效率和策略质量。
- 使独立学习者在不观察其他智能体动作或奖励的情况下仍能有效协调,同时最大化共享回报。
- 通过针对多智能体动态特性设计的辅助机制,稳定高维、随机环境中的训练过程。
提出的方法
- 将单智能体强化学习中的加权双Q学习(WDQ)估计算法扩展至多智能体深度强化学习领域,以减少Q值过估计偏差。
- 引入宽松奖励网络(LRN),通过软化奖励信号,降低对噪声或次优即时奖励的敏感性。
- 提出调度回放策略(SRS),通过动态调整回放优先级,稳定学习过程并加速收敛。
- 将加权双估计算法与深度神经网络结合,以处理原始视觉观测和大规模状态空间。
- 修改优先经验回放机制,使其适用于多智能体环境,确保在非平稳策略下训练的稳定性。
- 采用独立学习者(ILs),共享同一奖励函数但不观察彼此的动作,从而实现可扩展的合作。
实验结果
研究问题
- RQ1单智能体强化学习中的加权双估计算法能否有效扩展至合作型多智能体深度强化学习?
- RQ2宽松奖励网络在随机合作环境中如何提升学习稳定性和收敛性?
- RQ3调度回放策略在具有原始视觉输入的多智能体DRL中,能在多大程度上提升训练速度和策略质量?
- RQ4将WDQ与LRN和SRS结合后,是否在平均奖励和收敛速度方面显著优于DDQN和宽松Q-learning?
- RQ5WDDQN能否在具有随机奖励和大规模状态空间的环境中可靠地学习到最优合作策略?
主要发现
- 在双捕食者追捕任务中,WDDQN在平均奖励方面优于DDQN和宽松Q-learning,实现了80的稳定平均回报,对应最优策略。
- 不包含宽松奖励网络和调度回放策略的WDDQN变体(WDDQN w.o. LRN+SRS)即使经过长时间训练也未能收敛,凸显了这两个辅助组件的必要性。
- 同时采用LRN和SRS的WDDQN相比其他变体收敛更快且更稳定,证明了所提机制之间的协同效应。
- 宽松奖励网络可加快智能体间的协调,减少过早收敛至次优策略的情况,尤其在具有随机奖励的环境中效果显著。
- 在Pac-Man环境中,WDDQN相比DDQN和WDDQN w.o. LRN+SRS表现出显著更快的收敛速度和更高的稳定性。
- 实验结果证实,WDDQN对随机性和非平稳性具有鲁棒性,在复杂合作任务中多次运行均表现出一致的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。