Skip to main content
QUICK REVIEW

[论文解读] Carl-Lead: Lidar-based End-to-End Autonomous Driving with Contrastive Deep Reinforcement Learning

Peide Cai, Sukai Wang|arXiv (Cornell University)|Sep 17, 2021
Autonomous Vehicle Technology and Safety参考文献 26被引用 7
一句话总结

Carl-Lead 提出了一种基于激光雷达的端到端自动驾驶策略,通过对比深度强化学习训练,以应对因遮挡和传感器噪声导致部分观测的非监管城市交叉路口。通过将无监督对比学习作为辅助任务,该方法提升了样本效率和泛化能力,在未见过的环境(如环岛)中,其成功率高于最先进(SOTA)的基于学习的方法,且在安全与效率的权衡上优于基于规则的系统。

ABSTRACT

Autonomous driving in urban crowds at unregulated intersections is challenging, where dynamic occlusions and uncertain behaviors of other vehicles should be carefully considered. Traditional methods are heuristic and based on hand-engineered rules and parameters, but scale poorly in new situations. Therefore, they require high labor cost to design and maintain rules in all foreseeable scenarios. Recently, deep reinforcement learning (DRL) has shown promising results in urban driving scenarios. However, DRL is known to be sample inefficient, and most previous works assume perfect observations such as ground-truth locations and motions of vehicles without considering noises and occlusions, which might be a too strong assumption for policy deployment. In this work, we use DRL to train lidar-based end-to-end driving policies that naturally consider imperfect partial observations. We further use unsupervised contrastive representation learning as an auxiliary task to improve the sample efficiency. The comparative evaluation results reveal that our method achieves higher success rates than the state-of-the-art (SOTA) lidar-based end-to-end driving network, better trades off safety and efficiency than the carefully tuned rule-based method, and generalizes better to new scenarios than the baselines. Demo videos are available at https://caipeide.github.io/carl-lead/.

研究动机与目标

  • 开发一种端到端自动驾驶策略,以应对非监管城市交叉路口中常见的不完美、部分观测环境。
  • 解决在存在遮挡和传感器噪声的高维真实驾驶场景中,深度强化学习(DRL)的样本效率低下问题。
  • 通过从原始激光雷达点云中学习鲁棒表征,提升对未见场景(如环岛)的泛化能力。
  • 减少对人工设计规则和真实状态信息的依赖,实现在真实感知条件下的部署。
  • 通过引入无监督对比表征学习作为辅助任务,提升训练效率和驾驶性能。

提出的方法

  • 该方法使用原始激光雷达点云作为输入,形成环境的部分观测,模拟真实传感器限制(包括遮挡和噪声)。
  • 采用 D3QN(具有双-stream架构和噪声网络的深度Q网络)作为核心DRL算法,通过试错法实现端到端策略学习。
  • 引入辅助对比学习分支,从激光雷达观测的时间序列中学习不变表征,提升特征质量与样本效率。
  • 对比学习目标最大化同一序列的增强观测(正样本对)之间的一致性,同时最小化不同序列观测(负样本对)的一致性。
  • 策略以无模型、off-policy方式训练,能够适应其他车辆行为的多样性和不确定性。
  • 使用显著性图解释策略,通过基于梯度的归因方法可视化策略对相关环境要素的关注程度。

实验结果

研究问题

  • RQ1当仅在有限数据和部分观测条件下进行训练时,基于DRL的端到端驾驶策略能否有效泛化到新的、未见过的城市交叉路口场景(如环岛)?
  • RQ2在存在遮挡和噪声的激光雷达自动驾驶场景中,无监督对比表征学习在提升样本效率和性能方面有何作用?
  • RQ3所提出的方法在成功率、安全性与效率方面,是否优于监督模仿学习基线方法和精心调校的基于规则的系统?
  • RQ4该模型在部分观测和时序动态信息下,能否有效推断其他车辆的意图(如激进型 vs. 保守型)?
  • RQ5通过显著性图揭示的模型注意力机制,在复杂场景中是否与以人类为中心的驾驶逻辑保持一致?

主要发现

  • 在未见过的环岛场景中,Carl-Lead 的成功率达到 68.5%,约为基于规则方法 35% 的两倍。
  • 在所有评估任务中(包括无保护左转和变道合并),该方法在成功率方面均优于所有监督模仿学习基线方法。
  • 在 T-Left 任务中,Carl-Lead 的成功率达到 93.5%,显著高于最先进(SOTA)的模仿学习基线。
  • 与基线方法相比,该模型在新环境中的泛化能力更强,对交通模式和几何结构分布偏移表现出更强的鲁棒性。
  • 定性分析表明,该智能体能够根据时序观测序列动态调整行为(如对激进车辆刹车、对让行车辆加速),体现适应性。
  • 显著性图分析确认,策略会根据上下文动态关注相关交通参与者和未来路径,反映出智能决策行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。