[论文解读] Reciprocal Collision Avoidance for General Nonlinear Agents using Reinforcement Learning
本文提出了一种基于强化学习(RL)的去中心化碰撞避让方法,适用于具有连续动作空间的一般非线性智能体,结合RL训练的双智能体策略与ORCA衍生的安全约束,确保无碰撞且平滑的轨迹。该方法实现了无需实时通信的快速、可扩展的多智能体导航,在具有非线性动力学的复杂动态场景中,其安全性与泛化能力优于以往的RL方法。
Finding feasible and collision-free paths for multiple nonlinear agents is challenging in the decentralized scenarios due to limited available information of other agents and complex dynamics constraints. In this paper, we propose a fast multi-agent collision avoidance algorithm for general nonlinear agents with continuous action space, where each agent observes only positions and velocities of nearby agents. To reduce online computation, we first decompose the multi-agent scenario and solve a two agents collision avoidance problem using reinforcement learning (RL). When extending the trained policy to a multi-agent problem, safety is ensured by introducing the optimal reciprocal collision avoidance (ORCA) as linear constraints and the overall collision avoidance action could be found through simple convex optimization. Most existing RL-based multi-agent collision avoidance algorithms rely on the direct control of agent velocities. In sharp contrasts, our approach is applicable to general nonlinear agents. Realistic simulations based on nonlinear bicycle agent models are performed with various challenging scenarios, indicating a competitive performance of the proposed method in avoiding collisions, congestion and deadlock with smooth trajectories.
研究动机与目标
- 解决具有有限智能体间通信的通用非线性智能体在去中心化、实时碰撞避让方面的挑战。
- 克服现有基于RL的方法所存在的局限性,这些方法假设可直接控制速度且缺乏安全保证。
- 在涉及多个具有非线性动力学的智能体(如自行车模型)的复杂场景中,实现可扩展且安全的导航。
- 确保系统整体安全性,避免在对称或高密度配置下发生死锁或拥堵。
- 通过ORCA约束将样本高效的RL训练与凸优化相结合,实现实时、可靠的动作选择。
提出的方法
- 仅使用相对位置和相对速度作为观测,在双智能体碰撞避让任务上训练深度确定性策略梯度(DDPG)智能体。
- 将多智能体问题分解为成对交互,并对每对应用训练好的RL策略以生成候选避让动作。
- 通过从最优相互碰撞避让(ORCA)框架推导出的线性速度约束来强制实现安全性,确保无碰撞运动。
- 将整体多智能体动作表述为一个凸优化问题,结合个体RL动作的同时尊重ORCA约束。
- 在推理阶段使用简单高效的优化步骤计算最终动作,最小化在线计算量。
- 将训练好的策略扩展至包含不同数量智能体的多智能体场景,包括最多42个智能体的大规模设置。
实验结果
研究问题
- RQ1针对双智能体碰撞避让的已学习RL策略能否有效泛化至具有非线性动力学的多智能体系统?
- RQ2在无实时通信的去中心化RL多智能体导航系统中,如何系统性地保证安全性?
- RQ3与纯RL或纯ORCA相比,将RL与ORCA约束结合在安全性与性能方面提升了多少?
- RQ4所提出的方法能否避免在对称或高密度智能体配置下的死锁与拥堵?
- RQ5ORCA约束的集成在生成轨迹的平滑性与真实性方面产生了何种影响?
主要发现
- 所提方法在对称、高风险配置下成功生成了最多八名智能体的无碰撞、平滑轨迹,包括经典的ORCA死锁场景。
- 在42名智能体的环形构型中,系统通过让智能体向右转并从左侧经过原点实现安全导航,借助ORCA约束动作避免了碰撞。
- 在涉及20名智能体的同心圆运动任务中,尽管智能体之间存在复杂的双向交互,该方法仍生成了安全且协调的轨迹。
- 在24名智能体示例中的消融分析表明,ORCA约束至关重要——若无这些约束,仅靠RL策略将导致碰撞,而ORCA通过修改动作成功纠正了该问题。
- 通过凸优化实现快速推理,即使在复杂的非线性智能体动力学下也能实现实时性能。
- 该方法展现出强大的泛化能力,能够处理训练期间未见的动态智能体数量和复杂场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。