[论文解读] Simulation to Scaled City: Zero-Shot Policy Transfer for Traffic Control via Autonomous Vehicles
该论文展示了将深度强化学习控制器的零样本策略迁移从仿真环境到真实世界缩放城市测试平台(UDSSC)的成果,表明在状态空间和动作空间中注入噪声可使稳定匝道信号控制行为成功涌现,而无需微调。在真实世界测试平台中,注入噪声的策略使平均行程时间减少5%,最大行程时间减少22%,优于未注入噪声的策略,后者无法一致地再现信号控制行为。
Using deep reinforcement learning, we train control policies for autonomous vehicles leading a platoon of vehicles onto a roundabout. Using Flow, a library for deep reinforcement learning in micro-simulators, we train two policies, one policy with noise injected into the state and action space and one without any injected noise. In simulation, the autonomous vehicle learns an emergent metering behavior for both policies in which it slows to allow for smoother merging. We then directly transfer this policy without any tuning to the University of Delaware Scaled Smart City (UDSSC), a 1:25 scale testbed for connected and automated vehicles. We characterize the performance of both policies on the scaled city. We show that the noise-free policy winds up crashing and only occasionally metering. However, the noise-injected policy consistently performs the metering behavior and remains collision-free, suggesting that the noise helps with the zero-shot policy transfer. Additionally, the transferred, noise-injected policy leads to a 5% reduction of average travel time and a reduction of 22% in maximum travel time in the UDSSC. Videos of the controllers can be found at https://sites.google.com/view/iccps-policy-transfer.
研究动机与目标
- 弥合自动驾驶车辆在交通控制中从仿真到现实的差距,采用深度强化学习方法。
- 评估在状态空间和动作空间中注入噪声是否能改善零样本策略迁移至真实世界环境。
- 验证在仿真环境中涌现的匝道信号控制行为向特拉华大学缩放智能城市(UDSSC)测试平台的可迁移性。
- 量化注入噪声策略在减少混合自主交通场景下的行程时间和改善交通流方面的性能提升。
- 研究通过噪声实现的领域随机化在促进低维控制任务中从仿真到现实的策略泛化方面的作用。
提出的方法
- 使用Flow(一个用于微观仿真器的深度强化学习库)训练了两个深度强化学习策略,一个在状态空间和动作空间中注入噪声,另一个则未注入。
- 在仿真中使用智能驾驶员模型(IDM)描述车辆动力学,并通过添加噪声来模拟现实世界中的不确定性。
- 通过状态空间和动作空间的噪声实施领域随机化,以提高策略对仿真到现实分布偏移的鲁棒性。
- 将训练好的策略直接迁移到UDSSC测试平台,未进行任何微调或重新训练。
- 基于匝道信号控制行为的一致性以及平均和最大行程时间等指标评估策略性能。
- 使用视频和定性分析评估迁移策略在真实世界环境中行为保真度。
实验结果
研究问题
- RQ1在状态空间和动作空间中注入噪声是否能改善从仿真到真实世界交通控制的零样本策略迁移?
- RQ2在仿真环境中训练的深度强化学习策略是否能无需微调就在真实世界缩放城市环境中成功协调自动驾驶车辆?
- RQ3注入噪声的策略对真实世界测试中交通效率指标(如平均和最大行程时间)有何影响?
- RQ4缺乏噪声对真实世界迁移中涌现的匝道信号控制行为的一致性和可靠性有何影响?
- RQ5在低维控制任务中,噪声注入在多大程度上通过实现领域随机化来弥合仿真到现实的差距?
主要发现
- 注入噪声的策略成功迁移到UDSSC并一致表现出可接受的匝道信号控制行为,而未注入噪声的策略则无法一致实现此目标。
- 在真实世界测试平台中,注入噪声的策略使平均行程时间减少5%,最大行程时间减少22%。
- 未注入噪声的策略未改善平均行程时间,仅使最大行程时间减少14%,表明其迁移性能较差。
- 注入噪声的策略对现实世界动态(如摩擦、延迟和质量不匹配)表现出鲁棒性,表明其学会了应对模型不确定性。
- 添加噪声扩大了仿真中的有效状态空间,增加了与真实世界状态分布的重叠,从而实现了成功的领域随机化。
- 结果表明,少量的状态空间和动作空间噪声足以在低维、非视觉驱动的机器人控制任务中实现有效的零样本策略迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。