Skip to main content
QUICK REVIEW

[论文解读] Policy Gradient With Value Function Approximation For Collective Multiagent Planning

Duc Thien Nguyen, Akshat Kumar|arXiv (Cornell University)|Apr 9, 2018
Reinforcement Learning in Robotics参考文献 30被引用 14
一句话总结

本文提出了一种基于值函数近似的因子化演员-评论家强化学习方法,用于$ℂ$ Dec-POMDPs中的集体多智能体规划,其中智能体交互由集体行为而非个体身份决定。通过分解动作值函数并使用局部值函数训练评论家,该方法在收敛速度和解决方案质量方面优于基线演员-评论家方法及先前的表格化方法,在包含最多8,000个智能体的真实出租车车队问题中展现出良好的可扩展性。

ABSTRACT

Decentralized (PO)MDPs provide an expressive framework for sequential decision making in a multiagent system. Given their computational complexity, recent research has focused on tractable yet practical subclasses of Dec-POMDPs. We address such a subclass called CDEC-POMDP where the collective behavior of a population of agents affects the joint-reward and environment dynamics. Our main contribution is an actor-critic (AC) reinforcement learning method for optimizing CDEC-POMDP policies. Vanilla AC has slow convergence for larger problems. To address this, we show how a particular decomposition of the approximate action-value function over agents leads to effective updates, and also derive a new way to train the critic based on local reward signals. Comparisons on a synthetic benchmark and a real-world taxi fleet optimization problem show that our new AC approach provides better quality solutions than previous best approaches.

研究动机与目标

  • 解决在不确定性环境下基于表格化策略表示的集体多智能体规划所面临的可扩展性限制。
  • 提升大规模Dec-POMDPs中演员-评论家强化学习的样本效率和收敛速度。
  • 开发一种利用集体智能体交互的值函数近似方法,同时支持去中心化策略学习。
  • 实现在城市出租车车队等真实世界大规模多智能体系统中的有效策略优化。
  • 在高智能体数量的合成与真实世界基准上验证该方法的有效性。

提出的方法

  • 提出一种因子化演员-评论家(fAfC)框架,基于$ℂ$ Dec-POMDPs中的集体智能体交互分解动作值函数。
  • 基于相容值函数近似推导出策略梯度更新,以降低方差并提升学习稳定性。
  • 提出一种新颖的评论家训练方法,利用单个智能体的值函数指导全局值估计,从而提升样本效率。
  • 采用函数逼近(如神经网络)表示策略和值函数,避免使用表格化表示,从而实现可扩展性。
  • 应用值函数因子化,将联合动作值函数建模为基于局部观测和计数的个体贡献之和。
  • 利用单个智能体的局部奖励信号训练评论家,减少对全局回报估计的依赖,从而提升收敛性。

实验结果

研究问题

  • RQ1在大规模集体多智能体规划中,基于值函数近似的因子化演员-评论家方法是否能优于基线演员-评论家方法?
  • RQ2在$ℂ$ Dec-POMDPs中,使用单个智能体值函数训练评论家是否能带来更快的收敛速度和更优的策略质量?
  • RQ3基于集体智能体行为的值函数因子化如何提升高维观测空间中的可扩展性和性能?
  • RQ4所提出的方法是否能有效优化真实世界大规模系统(如8,000个智能体的出租车车队)中的策略?
  • RQ5当观测空间增大时,该方法在解决方案质量和收敛性方面与表格化策略优化方法(如EM)相比表现如何?

主要发现

  • 在基于邻域观测的8,000辆出租车问题中,fAfC方法在解决方案质量上相比基线fAfC-o0提升了64%。
  • fAfC-oN相比fAfC-o1提升了20%,证实多邻域观测建模可提升策略质量。
  • 尽管EM-`oN'采用分段策略,但其在30,000次迭代内未能收敛且结果更差,而fAfC-oN表现更优。
  • 因子化评论家训练策略相比使用全局经验回报的训练方式收敛更快,验证了其在降低样本方差方面的有效性。
  • 在相同设置下,基线演员-评论家(Vanilla AC)和fAC变体均未收敛,证明了所提出的因子化架构与训练方法的必要性。
  • 在合成机器人导航任务中,fAfC-oN实现了最佳解决方案质量,优于EM和SMFU,尤其在高拥堵场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。