[论文解读] Deep-Learned Collision Avoidance Policy for Distributed Multi-Agent Navigation
本文提出了一种基于深度强化学习的端到端多智能体避碰策略,通过训练深度神经网络将噪声传感器输入映射为无碰撞的转向速度。该方法在未见过的场景中泛化良好,包括静态障碍物和尺寸不同的智能体,其鲁棒性优于ORCA,且无需手动调参。
High-speed, low-latency obstacle avoidance that is insensitive to sensor noise is essential for enabling multiple decentralized robots to function reliably in cluttered and dynamic environments. While other distributed multi-agent collision avoidance systems exist, these systems require online geometric optimization where tedious parameter tuning and perfect sensing are necessary. We present a novel end-to-end framework to generate reactive collision avoidance policy for efficient distributed multi-agent navigation. Our method formulates an agent's navigation strategy as a deep neural network mapping from the observed noisy sensor measurements to the agent's steering commands in terms of movement velocity. We train the network on a large number of frames of collision avoidance data collected by repeatedly running a multi-agent simulator with different parameter settings. We validate the learned deep neural network policy in a set of simulated and real scenarios with noisy measurements and demonstrate that our method is able to generate a robust navigation strategy that is insensitive to imperfect sensing and works reliably in all situations. We also show that our method can be well generalized to scenarios that do not appear in our training data, including scenes with static obstacles and agents with different sizes. Videos are available at https://sites.google.com/view/deepmaca.
研究动机与目标
- 解决现有去中心化多智能体避碰系统依赖完美感知和大量参数调优的局限性。
- 开发一种可扩展、实时的导航策略,使其在存在不完美传感器数据的复杂动态环境中可靠运行。
- 实现对未见场景(如静态障碍物和不同尺寸的智能体)的泛化,而无需重新训练。
- 实现完全去中心化的导航,无需集中协调或运动捕捉系统。
提出的方法
- 训练深度神经网络,实时将噪声2D激光雷达观测和目标信息映射为反应式转向速度指令。
- 使用包含多种配置(如不同数量的智能体和障碍物布局)的多智能体仿真器生成大规模数据集。
- 通过合成传感器噪声和对称变换进行数据增强,以提升鲁棒性和泛化能力。
- 使用收集的避碰轨迹,在离线状态下以监督学习方式端到端训练网络。
- 仅使用机载2D激光雷达,在真实机器人上直接部署训练好的策略,无需AR标签或外部定位系统。
- 利用相同智能体间策略的对称性,诱导出如对称场景中同步旋转等涌现协作行为。
实验结果
研究问题
- RQ1深度神经网络能否从仿真数据中学习到鲁棒、反应式的避碰策略,并泛化到真实世界中的噪声传感器输入?
- RQ2所学策略在未见场景(如静态障碍物和不同尺寸的智能体)中的泛化程度如何,尤其是在训练数据中未出现的情况下?
- RQ3在传感器噪声条件下,所学策略在成功率、平滑性和鲁棒性方面与SOTA方法(如ORCA)相比表现如何?
- RQ4该方法能否实现无需集中协调或完美感知的完全去中心化导航?
主要发现
- 在8个智能体的Circle场景中,该策略在噪声传感器条件下实现了100%的成功率,而ORCA因智能体停滞而失败。
- 该方法能有效泛化到包含静态障碍物的场景,无需重新训练即可保持安全导航。
- 在不同尺寸智能体的场景中,策略会根据相对尺寸动态调整路径,较大智能体会更大幅度偏移以确保安全。
- 系统在仅使用机载2D激光雷达的真实世界实验中成功运行,四台物理机器人实现了完全去中心化导航。
- 由于对称策略部署,该策略表现出如同步旋转等涌现协作行为,而ORCA则呈现独立且生硬的运动。
- 尽管在训练集上的准确率约为64%,模型仍表现出良好泛化能力,表明通过更复杂的架构有望进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。