[论文解读] Autonomous Driving with Deep Reinforcement Learning in CARLA Simulation
本文提出了一种基于深度Q网络(DQN)的强化学习方法,用于在CARLA仿真环境中训练自动驾驶车辆实现高速车道保持并避免碰撞。该方法使用原始传感器观测作为输入,通过端到端训练学习策略,在多种天气和交通条件下相比随机基线,实现了68%的碰撞率降低和8.71 km/h的平均速度提升。
Nowadays, autonomous vehicles are gaining traction due to their numerous potential applications in resolving a variety of other real-world challenges. However, developing autonomous vehicles need huge amount of training and testing before deploying it to real world. While the field of reinforcement learning (RL) has evolved into a powerful learning framework to the development of deep representation learning, and it is now capable of learning complicated policies in high-dimensional environments like in autonomous vehicles. In this regard, we make an effort, using Deep Q-Learning, to discover a method by which an autonomous car may maintain its lane at top speed while avoiding other vehicles. After that, we used CARLA simulation environment to test and verify our newly acquired policy based on the problem formulation.
研究动机与目标
- 开发一种深度强化学习策略,使自动驾驶车辆能够在复杂高速公路环境中保持高速行驶的同时避免碰撞。
- 设计针对CARLA中车道保持与碰撞避免任务的定制观测、动作和奖励公式。
- 在多个城镇、天气条件和交通密度下评估训练后DQN智能体的性能。
- 将训练后的DQN智能体(S)与固定随机权重基线(U)进行对比,以验证学习的有效性。
- 评估DQN策略在CARLA中未见过的环境和场景下的泛化能力。
提出的方法
- 智能体使用原始摄像头和类似LiDAR的传感器观测作为输入状态表示,通过卷积神经网络进行处理。
- 使用经验回放和目标网络更新训练深度Q网络(DQN),以稳定学习并最小化时间相关性。
- 动作空间由离散控制指令组成:油门、刹车和转向角,映射为离散动作以实现端到端控制。
- 设计密集奖励函数,以鼓励高速行驶(在20–30 km/h范围内)、惩罚碰撞,并奖励向目标的进展。
- 训练在Town04中于标准天气条件下进行,评估在八个城镇及两组天气设置(简单和困难)下执行。
- 使用四个指标评估性能:碰撞率、平均速度、总回合奖励以及失败前的总时间步数。

实验结果
研究问题
- RQ1在模拟高速公路环境中,仅使用原始传感器输入,DQN智能体能否学会高速、无碰撞的车道保持策略?
- RQ2与固定随机基线相比,训练后的DQN智能体在碰撞率、速度和奖励方面的表现如何?
- RQ3DQN策略在CARLA中不同城镇、天气条件和交通密度下的泛化程度如何?
- RQ4奖励设计是否有效引导智能体实现安全、高速的驾驶行为?
- RQ5DQN训练过程在累积回合奖励方面的收敛行为如何?
主要发现
- 训练后的DQN智能体(S)在所有测试场景中实现了68%的碰撞率,显著低于未训练基线(U)的96%碰撞率。
- DQN智能体在测试场景中平均速度达到8.71 km/h,而未训练基线为6.10 km/h,表明在相同条件下性能更优。
- DQN智能体的总回合奖励平均为1954,远超未训练基线的513,表明策略学习有效。
- DQN智能体在每次回合中平均可运行373个时间步后才发生碰撞或失败,而未训练基线为241个时间步,表明策略更稳定。
- 累积奖励曲线在约3000个训练步后显示出上升趋势并趋于收敛,表明策略学习稳定。
- 该策略在多个城镇(Town01至Town10)、天气预设(包括WetCloudySunset和HardRainNoon)以及交通水平(无、常规、密集)下均表现出良好的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。