[论文解读] Reward Machines for Cooperative Multi-Agent Reinforcement Learning
本文提出使用奖励机器(RMs)——一种编码任务结构的Mealy机器——将合作多智能体强化学习(MARL)任务分解为子任务,供各智能体独立处理。通过使用去中心化的Q-learning算法在子任务上独立训练智能体,该方法通过可验证的分解条件确保团队层面的任务完成,其收敛速度比集中式学习快一个数量级,并在离散环境中优于层次化和独立Q-learning基线方法。
In cooperative multi-agent reinforcement learning, a collection of agents learns to interact in a shared environment to achieve a common goal. We propose the use of reward machines (RM) -- Mealy machines used as structured representations of reward functions -- to encode the team's task. The proposed novel interpretation of RMs in the multi-agent setting explicitly encodes required teammate interdependencies, allowing the team-level task to be decomposed into sub-tasks for individual agents. We define such a notion of RM decomposition and present algorithmically verifiable conditions guaranteeing that distributed completion of the sub-tasks leads to team behavior accomplishing the original task. This framework for task decomposition provides a natural approach to decentralized learning: agents may learn to accomplish their sub-tasks while observing only their local state and abstracted representations of their teammates. We accordingly propose a decentralized q-learning algorithm. Furthermore, in the case of undiscounted rewards, we use local value functions to derive lower and upper bounds for the global value function corresponding to the team task. Experimental results in three discrete settings exemplify the effectiveness of the proposed RM decomposition approach, which converges to a successful team policy an order of magnitude faster than a centralized learner and significantly outperforms hierarchical and independent q-learning approaches.
研究动机与目标
- 为解决合作多智能体强化学习(MARL)中的协调与非平稳性挑战。
- 通过将全局团队任务分解为由奖励机器(RMs)编码的子任务,实现去中心化学习。
- 提供可算法验证的条件,确保完成子任务可导致全局任务的成功执行。
- 设计一种去中心化的Q-learning算法,使智能体仅使用本地状态和抽象化的队友信息进行学习。
- 在离散MARL环境中展示可扩展性和样本效率,特别是在稀疏奖励和时序延迟奖励的情况下。
提出的方法
- 将团队的合作任务表示为奖励机器(RM),即一种编码任务规范中时间与逻辑依赖关系的Mealy机器。
- 提出一种新颖的RM分解方法,为每个智能体分配一个子任务RM,显式编码必要的相互依赖关系和队友信息。
- 引入保证条件,确保若每个智能体完成其子任务RM,则联合行为可实现原始全局任务。
- 设计一种去中心化的Q-learning算法,使智能体仅使用本地状态和抽象化的队友信号学习其子任务RM,避免同时训练。
- 对于无折扣奖励,推导出局部价值函数,其可界定全局价值函数,从而支持性能分析与收敛性保证。
- 在离散环境中使用表格Q-learning,同时建议通过扩展至深度网络以适用于连续设置。
实验结果
研究问题
- RQ1能否使用奖励机器将合作多智能体任务分解为子任务,以实现去中心化学习,同时保持团队层面的任务正确性?
- RQ2哪些形式化条件可确保单个智能体完成其子任务后,可成功执行全局合作任务?
- RQ3与集中式、层次化和独立Q-learning基线相比,所提出的去中心化RM学习方法在样本效率和收敛速度方面表现如何?
- RQ4智能体是否能仅使用本地状态和抽象化的队友信息学习有效策略,而无需实时协调或同时训练?
- RQ5在稀疏或延迟奖励的多智能体环境中,将RM分解为子任务在多大程度上提升了可扩展性?
主要发现
- 在双智能体会合任务中,所提出的去中心化算法收敛到成功团队策略的速度比集中式学习快一个数量级以上。
- 在十智能体会合任务中,所提方法成功学习到有效的团队行为,而层次化独立Q-learning(h-IL)和独立Q-learning(IQL)在训练预算内均未能收敛。
- RM分解框架使智能体能够独立学习,消除了因同时训练引发的非平稳性问题。
- 在三个离散环境中,该方法在性能上显著优于层次化和独立Q-learning方法。
- 对于无折扣奖励,从子任务RM推导出的局部价值函数可为全局价值函数提供可证明的下界和上界,从而支持理论分析。
- 该方法在稀疏和时序延迟奖励的任务中表现出强大的可扩展性和样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。