Skip to main content
QUICK REVIEW

[论文解读] POGEMA: Partially Observable Grid Environment for Multiple Agents

Alexey Skrynnik, Anton Andreychuk|arXiv (Cornell University)|Jun 22, 2022
Natural Language Processing Techniques被引用 5
一句话总结

POGEMA 是一个快速、可扩展且可定制的网格世界环境,用于基准测试部分可观测多智能体路径规划(PO-MAPF)问题,支持高效测试规划与强化学习方法。该环境支持集中式与分布式策略,实验结果表明,在复杂、高密度场景下,混合规划与学习方法优于纯基线方法。

ABSTRACT

We introduce POGEMA (https://github.com/AIRI-Institute/pogema) a sandbox for challenging partially observable multi-agent pathfinding (PO-MAPF) problems . This is a grid-based environment that was specifically designed to be a flexible, tunable and scalable benchmark. It can be tailored to a variety of PO-MAPF, which can serve as an excellent testing ground for planning and learning methods, and their combination, which will allow us to move towards filling the gap between AI planning and learning.

研究动机与目标

  • 通过提供一个灵活的基准测试平台,弥合人工智能规划与强化学习之间的差距,用于部分可观测多智能体路径规划(PO-MAPF)问题。
  • 在去中心化、部分可观测环境中,支持混合规划与学习方法的快速原型设计与评估。
  • 通过基于网格的、以智能体为中心的观测设置,并支持可配置的地图配置,实现强化学习智能体的可扩展、高速训练。
  • 提供一个标准化的开源平台,内置基线方法与主流强化学习框架的接口,以加速多智能体决策研究。
  • 通过使用具有不同智能体密度与观测半径的程序化生成地图,促进泛化与迁移学习。

提出的方法

  • POGEMA 使用四连通网格世界,包含自由单元与障碍物单元,智能体通过用户定义的以智能体为中心的观测补丁(例如 11×11 视野)实现部分可观测。
  • 每个智能体根据其局部观测结果,基于用户定义的策略选择动作,支持移动到相邻单元或等待,且仅在无碰撞时执行动作。
  • 该环境支持基于规划的基线方法(如基于 A* 的重规划并结合启发式方法)与通过与强化学习框架(如 SampleFactory 和 PyMARL)集成的可学习策略。
  • 即使在多智能体设置下,也能实现高达 83,000 FPS 的样本效率,支持基于深度神经网络的价值函数与策略函数近似器的快速训练。
  • 可通过字符串或 YAML 格式自定义地图,支持配置的参数包括网格大小、障碍物密度、智能体数量、观测半径与回合长度。
  • 环境包含四个难度等级(简单至超难),基于智能体密度划分,所有等级均保持一致的观测半径(R=5)。

实验结果

研究问题

  • RQ1在不同智能体密度与观测约束条件下,基于启发式搜索的规划器在求解 PO-MAPF 问题方面的有效性如何?
  • RQ2深度强化学习方法(如 APPO 与 QMIX)在高密度、部分可观测环境中求解复杂 PO-MAPF 任务的能力有多强?
  • RQ3在需要协作行为的 PO-MAPF 场景中,集中式与分布式 MARL 算法的性能表现有何差异?
  • RQ4POGEMA 中的程序化生成地图能否支持多智能体路径规划策略的泛化与迁移学习?
  • RQ5地图尺寸与智能体密度的增加对基于规划与学习的 PO-MAPF 解决方案的可扩展性与性能有何影响?

主要发现

  • 基于 A* 的重规划与临时增强策略(如目标导向移动与振荡时的等待动作)的规划基线方法在低密度设置下成功解决了部分 PO-MAPF 实例。
  • 在 8×8 的超难配置中,集中式 MARL 算法(如 QMIX 与 VDN)优于去中心化 IQL,表明在高密度环境中协作行为至关重要。
  • 在单张 GPU 上,APPO 在 32×32 的超难地图(每环境 128 个智能体)上训练仅用数小时即实现收敛,展现出极高的可扩展性与效率。
  • 随着智能体密度与地图尺寸的增加,性能显著下降,凸显了在复杂场景中路径规划与冲突解决的双重重要性。
  • 该环境在单智能体模式下最高支持 83,000 FPS,且在多智能体设置中仍保持高度高效,支持强化学习与规划研究的快速迭代。
  • POGEMA 的程序化生成与可配置参数确保了强大的泛化能力,适用于评估多智能体系统中的迁移学习与零样本泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。