[论文解读] Coordinating CAV Swarms at Intersections with a Deep Learning Model
该论文提出 AlphaOrder,一种结合深度学习与树搜索的混合算法,可快速生成无信号交叉口处联网自动驾驶车辆(CAV)车队的近似最优通行顺序。通过在已解决场景上训练指针网络,并利用在线树搜索优化结果,AlphaOrder 实现了实时性能,显著降低了现有方法的延迟,即使在大规模 CAV 流量下也表现优异。
Connected and automated vehicles (CAVs) are viewed as a special kind of robots that have the potential to significantly improve the safety and efficiency of traffic. In contrast to many swarm robotics studies that are demonstrated in labs by employing a small number of robots, CAV studies aims to achieve cooperative driving of unceasing robot swarm flows. However, how to get the optimal passing order of such robot swarm flows even for a signal-free intersection is an NP-hard problem (specifically, enumerating based algorithm takes days to find the optimal solution to a 20-CAV scenario). Here, we introduce a novel cooperative driving algorithm (AlphaOrder) that combines offline deep learning and online tree searching to find a near-optimal passing order in real-time. AlphaOrder builds a pointer network model from solved scenarios and generates near-optimal passing orders instantaneously for new scenarios. Furthermore, our approach provides a general approach to managing preemptive resource sharing between swarm robotics (e.g., scheduling multiple automated guided vehicles (AGVs) and unmanned aerial vehicles (UAVs) at conflicting areas
研究动机与目标
- 为解决无信号交叉口处持续流动的 CAV 车队最优通行顺序这一 NP-难问题。
- 通过结合深度学习与在线搜索,克服现有方法的局限性——如计算成本高、可扩展性差或依赖启发式规则。
- 实现实时、低复杂度的大规模 CAV 车队在动态交通环境中的协调。
- 在多样化交通需求模式和交叉口配置下具备泛化能力,确保在异构条件下的稳健性能。
- 为集群机器人和智能交通系统中的预占资源共享提供可扩展、可迁移的框架。
提出的方法
- AlphaOrder 使用在已解决场景数据集上训练的指针网络 $p_{\theta}$,直接从车辆状态输入预测候选通行顺序。
- 通过集成蒙特卡洛树搜索(MCTS)模块,探索高回报序列,对初始预测进行优化,从而提升解的质量。
- 批评网络 $b_{\delta}$ 在 REINFORCE 强化学习框架中充当基线,以稳定指针网络的训练过程。
- 采用两阶段流程:首先在合成场景上离线预训练指针网络,随后对新出现的未见配置执行在线树搜索。
- 系统设计用于路边单元部署,模型更新通过云端远程执行,以最小化设备端的计算复杂度。
- 该方法支持对任意数量 CAV 及多种交通需求模式的泛化,包括异构流量。
实验结果
研究问题
- RQ1在已解决场景上进行训练的深度学习模型,能否为无信号交叉口处新出现的、未见过的 CAV 车队配置生成近似最优的通行顺序?
- RQ2与传统优化或启发式方法相比,深度学习与在线树搜索的结合在计算效率和解质量方面有何提升?
- RQ3该模型在不同交通需求模式下(包括异构和高流量流)的泛化能力如何?
- RQ4与先到先服务(FIFO)和仅使用 MCTS 的基线相比,AlphaOrder 在降低总延迟方面带来了多大性能提升?
- RQ5该算法能否在资源受限的路边单元上高效部署,同时保持实时响应能力?
主要发现
- 在高需求场景下,AlphaOrder 相较于 FIFO 基线将平均延迟降低高达 40%,在 Pattern 1 中较基于 MCTS 的方法提升 25%。
- 在异构交通需求场景中(如流量差异达 2.5 倍),AlphaOrder 保持优异性能,Pattern 2 中平均延迟为 14.23 秒,而 FIFO 为 22.27 秒。
- 对于最多 40 辆 CAV 的场景,该算法在毫秒级时间内即可获得近似最优解,而基于枚举的方法需数天才能计算出最优顺序。
- 批评网络与 MCTS 优化步骤显著提升了解的质量,最终输出始终优于初始指针网络预测和基线算法。
- AlphaOrder 在多样化交通模式下表现出强大泛化能力,在 Pattern 1 中平均延迟仅 12.81 秒,在 Pattern 2 中为 14.23 秒,表明其对流量不平衡具有鲁棒性。
- 模型的低设备端复杂度使其可实际部署于路边单元,训练与更新由云端远程完成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。