[论文解读] Decentralized Task and Path Planning for Multi-Robot Systems
本文提出了一种用于多机器人系统的完全去中心化任务与路径规划(DTPP)框架,联合优化任务分配与无碰撞路径规划。通过将马尔可夫决策过程(MDPs)或部分可观测MDPs(MOMDPs)表示为因子图,最大和算法实现了去中心化的任务分配,以最大化期望纯收益(收益减去成本),同时采用局部前向动态规划方案实时解决代理间的冲突。该方法在ROS仿真及使用Segway和Turtlebot平台的真实世界实验中得到验证。
We consider a multi-robot system with a team of collaborative robots and multiple tasks that emerges over time. We propose a fully decentralized task and path planning (DTPP) framework consisting of a task allocation module and a localized path planning module. Each task is modeled as a Markov Decision Process (MDP) or a Mixed Observed Markov Decision Process (MOMDP) depending on whether full states or partial states are observable. The task allocation module then aims at maximizing the expected pure reward (reward minus cost) of the robotic team. We fuse the Markov model into a factor graph formulation so that the task allocation can be decentrally solved using the max-sum algorithm. Each robot agent follows the optimal policy synthesized for the Markov model and we propose a localized forward dynamic programming scheme that resolves conflicts between agents and avoids collisions. The proposed framework is demonstrated with high fidelity ROS simulations and experiments with multiple ground robots.
研究动机与目标
- 解决多机器人系统中任务随时间动态出现且需协调的去中心化任务与路径规划挑战。
- 以去中心化方式最大化机器人团队的期望纯收益(收益减去成本)。
- 在无中心协调或全局状态知识的情况下,解决路径执行过程中的代理间冲突。
- 通过局部分布式计算,实现多机器人系统实时、可扩展的协调。
提出的方法
- 每个机器人被建模为MDP或MOMDP,以表示其随机动力学和部分可观测性。
- 总期望纯收益被表述为一个因子图,其中节点代表任务,边代表代理间的依赖关系。
- 在因子图上应用最大和算法,以完全去中心化的方式求解最优任务分配。
- 采用局部前向动态规划方案,通过实时重新规划局部轨迹来解决代理间的潜在碰撞。
- 高层命令发送至低层控制器(如MPC或PID),后者基于航点和约束生成实时控制输入。
- 系统在分层分布式架构中集成任务分配、冲突解决与低层控制。
实验结果
研究问题
- RQ1如何在完全去中心化的多机器人系统中联合优化任务分配与路径规划?
- RQ2最大和算法能否在具有部分可观测性的去中心化MDP/MOMDP框架中有效求解最优任务分配?
- RQ3如何在无全局协调或未来动作先验知识的情况下,实现代理间冲突的本地化解决?
- RQ4DTPP框架在动态真实场景下的期望纯收益与碰撞避免性能如何?
主要发现
- DTPP框架成功利用最大和算法实现去中心化任务分配,在多台机器人之间最大化期望纯收益。
- 局部前向动态规划方案能有效实时防止代理间的碰撞,即使轨迹发生冲突亦能应对。
- 在三台Segway机器人参与的ROS仿真中,系统在任务到期时动态重新分配任务,并通过冲突解决确保安全导航。
- 在5×5网格上使用两台Turtlebots的实验中,当分配不同任务有利时,最大和算法正确地将机器人指派至不同任务,且在降低总成本时允许一台机器人保持空闲。
- 期望纯收益曲线(图8)展示了对新任务的动态适应能力,当高收益任务出现时,收益值迅速上升并实现高效分配。
- 系统通过MPC和PID控制器保持实时性能,支持在物理机器人上稳定执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。