[论文解读] Model-based Reinforcement Learning for Decentralized Multiagent Rendezvous
本文提出分层预测规划(HPP),一种基于模型的强化学习方法,用于去中心化多智能体会合,通过自监督运动预测使智能体在无通信的情况下协调目标。HPP 通过使用学习到的运动模型动态对齐计划并结合迭代子目标规划,在复杂、未见过的仿真环境和真实世界环境中均优于基线方法。
Collaboration requires agents to align their goals on the fly. Underlying the human ability to align goals with other agents is their ability to predict the intentions of others and actively update their own plans. We propose hierarchical predictive planning (HPP), a model-based reinforcement learning method for decentralized multiagent rendezvous. Starting with pretrained, single-agent point to point navigation policies and using noisy, high-dimensional sensor inputs like lidar, we first learn via self-supervision motion predictions of all agents on the team. Next, HPP uses the prediction models to propose and evaluate navigation subgoals for completing the rendezvous task without explicit communication among agents. We evaluate HPP in a suite of unseen environments, with increasing complexity and numbers of obstacles. We show that HPP outperforms alternative reinforcement learning, path planning, and heuristic-based baselines on challenging, unseen environments. Experiments in the real world demonstrate successful transfer of the prediction models from sim to real world without any additional fine-tuning. Altogether, HPP removes the need for a centralized operator in multiagent systems by combining model-based RL and inference methods, enabling agents to dynamically align plans.
研究动机与目标
- 解决去中心化多智能体会合的挑战,即智能体必须在无显式通信或集中控制的情况下对齐目标。
- 使智能体能够在具有噪声高维传感器输入(如 LiDAR)和不完美导航策略的真实世界环境中进行协调。
- 开发一种可泛化至未见过环境并实现从仿真到真实世界部署的零样本迁移而无需微调的系统。
- 通过建模和预测其他智能体的运动,克服诸如智能体朝相反会合点移动等误协调问题。
- 通过使用学习到的运动预测器将规划与控制闭环连接,实现在动态、障碍物丰富的环境中自适应、目标对齐的行为。
提出的方法
- 仅使用每个智能体自身的观测和假设目标,通过自监督方式训练运动预测模型,预测队友在智能体本地坐标系中的相对运动。
- 利用学习到的运动模型,在分层规划过程中评估潜在的会合子目标,同时保持对可能目标的信念分布。
- 在规划模块中实现联合目标函数,利用运动模型的预测结果平衡可行性、协调性与障碍物规避。
- 将预训练的点对点导航策略作为控制模块,HPP 根据预测规划选择并更新会合目标。
- 通过结合运动预测的迭代重规划,解决误协调问题,例如智能体朝冲突的会合点行进。
- 通过学习反映底层导航策略动力学和限制的运动模型,将智能体能力与任务解耦。
实验结果
研究问题
- RQ1去中心化多智能体系统如何在无显式通信或集中协调的情况下实现会合?
- RQ2在具有高维、噪声传感器输入的真实世界环境中,于仿真中训练的自监督运动预测模型能否泛化?
- RQ3基于模型的强化学习如何提升多智能体导航任务中的协调性并减少误协调?
- RQ4带有预测模型的分层规划在帮助智能体选择可行、协调且无遮挡的会合点方面发挥何种作用?
- RQ5在复杂、障碍物丰富的环境中,于仿真中训练的运动预测模型在多大程度上能实现零样本仿真到真实世界的迁移?
主要发现
- 在复杂、未见过的仿真环境中,HPP 显著优于其他强化学习、路径规划和启发式基线方法,尤其在障碍物密集和对称布局中表现更优。
- HPP 实现了零样本仿真到真实世界的迁移,在真实世界环境中无需对运动预测模型进行任何额外微调即可成功完成会合任务。
- 在真实世界测试中,HPP 稳定完成会合任务,而 MADDPG 智能体常因 LiDAR 利用不足和误协调而原地打转。
- 在复杂环境中,HPP 的性能随规划频率和规划时域的增加而显著提升,表明其在高挑战性场景中具有强大可扩展性。
- 消融实验表明,在智能体本地坐标系中预测相对位姿变化的运动模型优于绝对位姿或全局坐标系预测。
- HPP 通过使用运动预测更新信念并动态重规划,有效解决了误协调问题,例如智能体朝相反会合点移动的情况。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。