Skip to main content
QUICK REVIEW

[论文解读] Scalable Anytime Planning for Multi-Agent MDPs

Shushman Choudhury, Jayesh K. Gupta|arXiv (Cornell University)|Jan 12, 2021
Artificial Intelligence in Games参考文献 41被引用 8
一句话总结

本文提出了一种名为带最大加法的因子值MCTS(FV-MCTS-MP)的可扩展、任意时间规划算法,用于多智能体MDP问题。该算法采用迭代最大加法动作协调机制替代精确的变量消除法,从而实现动态协调图结构,并显著降低计算开销。在静态协调图上,其性能与基线方法相当或更优;在动态协调图结构下,可扩展至此前难以处理的大规模问题,如48架无人机配送任务。

ABSTRACT

We present a scalable tree search planning algorithm for large multi-agent sequential decision problems that require dynamic collaboration. Teams of agents need to coordinate decisions in many domains, but naive approaches fail due to the exponential growth of the joint action space with the number of agents. We circumvent this complexity through an anytime approach that allows us to trade computation for approximation quality and also dynamically coordinate actions. Our algorithm comprises three elements: online planning with Monte Carlo Tree Search (MCTS), factored representations of local agent interactions with coordination graphs, and the iterative Max-Plus method for joint action selection. We evaluate our approach on the benchmark SysAdmin domain with static coordination graphs and achieve comparable performance with much lower computation cost than our MCTS baselines. We also introduce a multi-drone delivery domain with dynamic, i.e., state-dependent coordination graphs, and demonstrate how our approach scales to large problems on this domain that are intractable for other MCTS methods. We provide an open-source implementation of our algorithm at https://github.com/JuliaPOMDP/FactoredValueMCTS.jl.

研究动机与目标

  • 解决多智能体MDP中联合动作空间随智能体数量呈指数级增长所带来的可扩展性挑战。
  • 克服蒙特卡洛树搜索(MCTS)中基于精确协调方法(如变量消除法,Var-El)的局限性,后者缺乏任意时间属性,且在动态协调图结构上表现不佳。
  • 通过用迭代最大加法方法替代Var-El,实现高效的、任意时间的联合动作选择,支持状态相关的协调图结构。
  • 在标准(系统管理员)和新型(多无人机配送)MMDP领域中,验证其在可扩展性与性能上的优势,包括先前MCTS变体无法处理的大规模问题。
  • 提供实用的开源实现,以支持可复现性及可扩展多智能体规划领域的进一步研究。

提出的方法

  • 将最大加法法(一种用于联合动作选择的迭代近似方法)集成到因子值MCTS框架中,以替代精确的变量消除法(Var-El)。
  • 通过协调图结构使用因子化表示来建模智能体间的局部交互,从而降低联合值估计的计算负担。
  • 采用在线规划结合蒙特卡洛树搜索(MCTS),在实时环境中探索有希望的联合动作序列,实现任意时间行为。
  • 在每个决策步骤动态构建与状态相关的协调图,仅在距离阈值内或被分配至同一目标区域的智能体之间添加边。
  • 利用最大加法法的迭代特性,实现计算时间与解质量之间的权衡,支持任意时间规划。
  • 在JuliaPOMDP/FactoredValueMCTS.jl中实现该算法,支持高效、分布式执行,并适用于大规模MMDP问题。

实验结果

研究问题

  • RQ1最大加法法能否有效集成到因子值MCTS中,以实现具有动态协调图结构的多智能体MDP的任意时间规划?
  • RQ2在静态协调图基准测试中,FV-MCTS-MP与使用变量消除法(Var-El)的FV-MCTS相比,在性能与计算效率方面表现如何?
  • RQ3FV-MCTS-MP能否扩展至现有基于MCTS的方法无法处理的大规模多智能体问题(具有动态协调图结构)?
  • RQ4与静态或固定图相比,动态协调图对规划性能与内存使用的影响如何?
  • RQ5FV-MCTS-MP在处理大规模多智能体协调任务(如48架无人机配送)方面的能力如何,这些任务因内存或计算限制而使先前方法失效?

主要发现

  • 在具有静态协调图的SysAdmin基准测试中,FV-MCTS-MP的性能与FV-MCTS-Var-El相当或更优,同时显著更快——将8个智能体的平均规划时间从约40秒降低至约1秒。
  • FV-MCTS-MP成功扩展至多无人机配送领域中的48个智能体问题,该规模对FV-MCTS-Var-El和标准MCTS而言均属不可行,因受内存与计算限制。
  • 在多无人机配送领域中,FV-MCTS-MP在累积奖励与成功率方面优于所有基线方法,包括MCTS与FV-MCTS-Var-El,尤其在更大规模问题上表现更优。
  • FV-MCTS-MP中使用动态协调图可获得优于静态图的性能,因其仅在需要时捕获相关智能体交互,从而减少不必要的协调开销。
  • FV-MCTS-MP在所有测试问题规模(8至48个智能体)下均保持优异性能,平均协调图度数在2.4至11.8之间,展现出强大的可扩展性。
  • 该算法在大规模问题上避免了内存溢出问题,而FV-MCTS-Var-El与标准MCTS即使在较小实例(如8个智能体)上也因内存限制而失败,而FV-MCTS-MP始终保持稳定与高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。