[论文解读] Provably Efficient Cooperative Multi-Agent Reinforcement Learning with Function Approximation
本文提出 CoopLSVI,一种在有限通信条件下具备线性函数逼近的可证明高效合作多智能体强化学习算法,实现了近似最优的无遗憾学习。该算法引入了一种偏差校正估计器和战略性通信调度,实现了去中心化的异构多智能体学习,在同质环境中达到与集中式性能相当的遗憾边界,并在异质 MDP 中实现帕累托最优策略。
Reinforcement learning in cooperative multi-agent settings has recently advanced significantly in its scope, with applications in cooperative estimation for advertising, dynamic treatment regimes, distributed control, and federated learning. In this paper, we discuss the problem of cooperative multi-agent RL with function approximation, where a group of agents communicates with each other to jointly solve an episodic MDP. We demonstrate that via careful message-passing and cooperative value iteration, it is possible to achieve near-optimal no-regret learning even with a fixed constant communication budget. Next, we demonstrate that even in heterogeneous cooperative settings, it is possible to achieve Pareto-optimal no-regret learning with limited communication. Our work generalizes several ideas from the multi-agent contextual and multi-armed bandit literature to MDPs and reinforcement learning.
研究动机与目标
- 开发一种在有限通信条件下具备函数逼近的去中心化、可证明高效的多智能体强化学习算法。
- 将单智能体的无遗憾学习保证扩展到具备线性函数逼近的合作多智能体设置。
- 通过在通信受限下实现有界通信的帕累托最优策略学习,解决异质 MDP 问题。
- 将多臂赌博机和上下文赌博机技术推广至合作多智能体系统的回合式 MDP。
- 实现与同质设置下集中式性能相匹配的遗憾边界,同时在异质环境中保持效率。
提出的方法
- 提出 CoopLSVI,一种用于具备线性函数逼近的合作多智能体强化学习的去中心化最小二乘值迭代算法。
- 设计一种偏差校正估计器,以补偿智能体 MDP 之间的异质性,提升值函数估计性能。
- 引入一种战略性通信协议,仅在选定回合同步统计信息,将通信量减少至 O(HM³) 轮,且与 T 无关。
- 采用多目标优化中的随机加权法,以恢复多智能体 MDP 中的帕累托最优策略。
- 使用带有置信区间的优势最小二乘值迭代方法,以平衡探索与利用。
- 应用椭球潜力理论和覆盖论证,推导泛化边界并控制估计误差。
实验结果
研究问题
- RQ1在有限通信条件下,能否在合作多智能体强化学习中实现具备函数逼近的无遗憾学习?
- RQ2在去中心化学习中,如何有效建模并补偿智能体 MDP 之间的异质性?
- RQ3能否在合作多智能体 MDP 中,通过函数逼近高效学习帕累托最优策略?
- RQ4何种通信调度可实现在最小通信开销下的近似最优遗憾?
- RQ5所提出的算法是否在同质设置下实现了与集中式学习相匹配的遗憾边界?
主要发现
- CoopLSVI 算法在并行 MDP 设置下的群体遗憾为 Õ((d+k)H²√((d+χ)MT)),其中 χ 衡量 MDP 异质性,k 为异质性维度。
- 在同质情况下,遗憾边界与集中式单智能体的 Õ(H²√(d³MT)) 边界一致,证明了最优性。
- 该算法仅需 O(HM³) 次通信轮次,与回合数 T 无关,实现了高效的去中心化学习。
- 对于异质多智能体 MDP,CoopLSVI 实现了 Õ(H²√(d³T)) 的累积贝叶斯遗憾,是首个针对帕累托最优策略学习的此类无遗憾边界。
- 分析表明,该估计器能有效控制 MDP 异质性带来的偏差,实现跨智能体的稳定学习。
- 覆盖论证与矩阵集中不等式确保了泛化性能,其覆盖数的对数边界依赖于模型参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。