[论文解读] Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning
本文提出ICQL,一种用于多智能体强化学习的新框架,通过集中式智能体接收基于不确定性的内在奖励以引导探索,同时各去中心化智能体从共享经验中学习,避免受不可靠内在信号的干扰。该方法显著加速了学习过程,并在具有挑战性的部分可观测环境中实现最优策略的收敛,优于标准的内在奖励方法。
This paper investigates the use of intrinsic reward to guide exploration in multi-agent reinforcement learning. We discuss the challenges in applying intrinsic reward to multiple collaborative agents and demonstrate how unreliable reward can prevent decentralized agents from learning the optimal policy. We address this problem with a novel framework, Independent Centrally-assisted Q-learning (ICQL), in which decentralized agents share control and an experience replay buffer with a centralized agent. Only the centralized agent is intrinsically rewarded, but the decentralized agents still benefit from improved exploration, without the distraction of unreliable incentives.
研究动机与目标
- 为解决去中心化多智能体强化学习(MARL)中不可靠内在奖励的问题,此类奖励可能误导策略并阻碍最优学习。
- 改善在部分可观测环境中具有方向性的探索,此类环境中访问计数因状态-动作空间庞大及部分可观测性而不可靠。
- 设计一种框架,使去中心化智能体能从改进的探索中获益,同时不受不稳定内在奖励的干扰。
- 通过在训练期间利用对全局状态的集中式访问,同时保持去中心化执行,实现MARL中更快、更稳定的学习。
- 在需要超越随机或均匀探索的复杂猎物-捕食者网格世界环境中验证该框架。
提出的方法
- 引入一个集中式智能体,基于不确定性估计(例如,来自最后一层激活)接收内在奖励,以引导探索。
- 在集中式智能体与去中心化IQL智能体之间共享一个共同的经验回放缓冲区,实现知识迁移。
- 在每集开始时以50%的概率在集中式智能体与去中心化智能体之间随机切换经验采样,以减少分布外采样问题。
- 仅让去中心化智能体基于环境奖励进行训练,确保其最终策略不受可能不可靠的内在信号影响。
- 将集中式智能体的内在奖励基于全局状态进行条件化,相比去中心化智能体,可提高不确定性估计的可靠性。
- 将该框架应用于基于值函数的MARL算法(如IQL),并可扩展至VDN和QMIX。
实验结果
研究问题
- RQ1在多智能体强化学习中,不可靠的内在奖励是否会导致去中心化智能体无法收敛到最优策略?
- RQ2在执行阶段不违反去中心化原则的前提下,集中式访问全局状态在部分可观测MARL设置中如何改善探索?
- RQ3是否可以让集中式智能体接收内在奖励,同时去中心化智能体仍能从改进的探索中受益,而不受相同奖励的干扰?
- RQ4在复杂探索任务中,集中式与去中心化智能体之间共享经验与控制,是否能带来更快、更稳定的学习?
- RQ5在学习速度与策略最优性方面,所提出的ICQL框架在多大程度上优于标准的内在奖励方法?
主要发现
- 在标准IQL中使用内在奖励可加速初始学习,但因内在信号不可靠且具有干扰性,导致无法收敛到最优策略。
- 训练图中的绿色曲线(IQL带内在奖励)显示学习加速但持续不稳定,表明不可靠的内在奖励误导了策略。
- ICQL框架(蓝色曲线)的学习速度优于标准IQL,并成功收敛到最优策略,测试性能更优可作为证据。
- 在训练过程中,ICQL与IQL一样表现出类似不稳定性,这是由于集中式智能体的内在奖励所致,但此现象不影响最终的去中心化策略。
- 测试性能证实,通过ICQL训练的去中心化智能体实现了最优性能,表明集中式智能体的内在奖励并未污染最终策略。
- 在集中式与去中心化控制之间采用50%的随机切换策略,确保了学习的稳定性,并缓解了分布外采样问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。