[论文解读] Learning for Multi-robot Cooperation in Partially Observable Stochastic Environments with Macro-actions
该论文提出iSEM,一种基于迭代采样的期望最大化算法,通过仅使用轨迹数据,在部分可观察的随机环境中学习多智能体协调的宏观动作有限状态控制器(FSCs)。通过实现并发EM迭代并动态重新分配资源,iSEM克服了以往方法(如PoEM)的局部收敛问题,在仿真和基于硬件的搜救任务中均实现了更优性能,适用于异构机器人系统。
This paper presents a data-driven approach for multi-robot coordination in partially-observable domains based on Decentralized Partially Observable Markov Decision Processes (Dec-POMDPs) and macro-actions (MAs). Dec-POMDPs provide a general framework for cooperative sequential decision making under uncertainty and MAs allow temporally extended and asynchronous action execution. To date, most methods assume the underlying Dec-POMDP model is known a priori or a full simulator is available during planning time. Previous methods which aim to address these issues suffer from local optimality and sensitivity to initial conditions. Additionally, few hardware demonstrations involving a large team of heterogeneous robots and with long planning horizons exist. This work addresses these gaps by proposing an iterative sampling based Expectation-Maximization algorithm (iSEM) to learn polices using only trajectory data containing observations, MAs, and rewards. Our experiments show the algorithm is able to achieve better solution quality than the state-of-the-art learning-based methods. We implement two variants of multi-robot Search and Rescue (SAR) domains (with and without obstacles) on hardware to demonstrate the learned policies can effectively control a team of distributed robots to cooperate in a partially observable stochastic environment.
研究动机与目标
- 解决在未知模型的、部分可观察的随机环境中,缺乏鲁棒且可扩展的学习型多智能体协调方法的问题。
- 克服现有强化学习方法(如PoEM)在复杂现实场景中存在局部最优和初始化敏感的问题。
- 实现在无需完整仿真器或对Dec-POMDP模型先验知识的前提下,从轨迹数据中有效学习。
- 在大规模异构机器人团队(UGVs和UAVs)上,于长规划时域内,验证所学策略在硬件上的可行性和有效性。
- 验证所提方法在复杂搜救场景中,能够获得高于当前最先进学习型方法的期望奖励。
提出的方法
- iSEM采用基于迭代采样的期望最大化框架,从包含观测、宏观动作和奖励的轨迹数据中,学习MacDec-POMDP中宏观动作的有限状态控制器(FSCs)。
- 该算法采用并发(多线程)EM迭代机制,各线程共享反馈信息,并动态重新分配计算资源给收敛至较差解的线程。
- 引入基于其他线程反馈的策略参数重采样机制,以提升策略空间的探索能力,避免陷入局部最优。
- 该方法适用于批量学习设置,适合从示范中学习,并可扩展至具有长规划时域的大型复杂领域。
- iSEM在仿真和硬件实验中均进行了评估,实验基于包含地面与空中车辆的多智能体搜救领域。
- 该算法使用自定义仿真环境,结合动作捕捉系统和基于投影的可视化技术,以验证和展示策略性能。
实验结果
研究问题
- RQ1基于EM的学习算法是否能在无需已知模型或完整仿真器的前提下,有效学习部分可观察随机环境中的高质量多智能体策略?
- RQ2与标准EM方法(如PoEM)相比,并行EM迭代结合动态资源分配在收敛性和解质量方面有何改进?
- RQ3所提方法是否能泛化至包含异构机器人和长规划时域的真实硬件部署?
- RQ4在复杂搜救场景中,iSEM在期望奖励和鲁棒性方面相较于最先进学习型方法的性能提升程度如何?
- RQ5策略初始化和采样策略对真实机器人任务中学习算法收敛性和性能的影响如何?
主要发现
- 在长规划时域的大规模多智能体搜救领域中,iSEM获得的期望奖励高于当前最先进方法PoEM。
- 该算法在更少示范数据下即表现出更优性能,表明其在学习复杂协调策略方面具备更高的样本效率。
- 在由Duckiebots(UGVs)和DJI F330四旋翼无人机(UAV)组成的机器人团队进行的硬件实验中,iSEM策略在多数试验中成功救下所有遇险者,仅在多个遇险者初始生命值极低的情况下损失一名遇险者。
- 当遇险者初始生命值未处于临界低水平时,策略始终能救下所有遇险者,证实其在有限通信和避碰等现实约束下的鲁棒性。
- 通过引入具备反馈机制和动态资源分配的并发EM线程,实现了对策略空间更优的探索,降低了对初始化的敏感性,并避免了陷入较差的局部最优。
- 硬件试验的视频演示表明,所学策略能够有效实现分布式机器人在部分可观察随机环境中的协作,验证了该方法在真实场景中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。