[论文解读] DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving
本文提出DriveCoT,一个新型端到端驾驶数据集,包含用于跨驾驶方面和最终决策推理的思维链(CoT)标注,数据通过CARLA模拟器中的规则化专家策略收集。本文还提出了DriveCoT-Agent,一种基于多视角视频的模型,可生成CoT预测以提升可解释性,并在高速驾驶和变道等复杂场景的开环与闭环评估中达到最先进性能。
End-to-end driving has made significant progress in recent years, demonstrating benefits such as system simplicity and competitive driving performance under both open-loop and closed-loop settings. Nevertheless, the lack of interpretability and controllability in its driving decisions hinders real-world deployment for end-to-end driving systems. In this paper, we collect a comprehensive end-to-end driving dataset named DriveCoT, leveraging the CARLA simulator. It contains sensor data, control decisions, and chain-of-thought labels to indicate the reasoning process. We utilize the challenging driving scenarios from the CARLA leaderboard 2.0, which involve high-speed driving and lane-changing, and propose a rule-based expert policy to control the vehicle and generate ground truth labels for its reasoning process across different driving aspects and the final decisions. This dataset can serve as an open-loop end-to-end driving benchmark, enabling the evaluation of accuracy in various chain-of-thought aspects and the final decision. In addition, we propose a baseline model called DriveCoT-Agent, trained on our dataset, to generate chain-of-thought predictions and final decisions. The trained model exhibits strong performance in both open-loop and closed-loop evaluations, demonstrating the effectiveness of our proposed dataset.
研究动机与目标
- 为解决端到端自动驾驶系统中可解释性与可控性不足的问题。
- 构建一个全面的数据集,包含在高风险场景中驾驶决策的详细思维链标签。
- 开发一个基线模型,利用多视角视频输入生成推理轨迹和最终驾驶决策。
- 实现对模型性能的评估,不仅关注最终决策,也关注多个驾驶方面推理的准确性。
- 通过集成CoT的学习方法,提升在高速和复杂驾驶场景下的泛化能力与鲁棒性。
提出的方法
- 使用CARLA模拟器采集DriveCoT数据集,配备多视角摄像头和LiDAR,记录高速行驶与变道场景中的传感器数据。
- 通过规则化专家策略为每个驾驶决策生成真实思维链标签,涵盖碰撞风险、交通灯状态、行人存在等各个方面。
- DriveCoT-Agent模型以多视角视频和目标点作为输入,预测不同驾驶方面的CoT推理。
- 通过推理聚合机制,从CoT预测中推导出最终的驾驶决策(速度与路径点)。
- 采用注入运动信息的视频序列进行数据增强,以提升模型的泛化能力与运动理解能力。
- 在真实数据与增强数据混合的数据集上对模型进行微调,随后在开环与闭环设置下进行评估。
实验结果
研究问题
- RQ1思维链推理能否提升端到端自动驾驶中的可解释性与可控性?
- RQ2基于多视角视频的模型在生成准确且连贯的驾驶推理轨迹方面效果如何?
- RQ3集成CoT的模型能否泛化到未见过的复杂驾驶场景,如高速行驶与变道?
- RQ4与以往端到端方法相比,集成推理轨迹是否能在闭环评估中带来性能提升?
- RQ5在合成CoT数据上微调的模型,其在真实世界驾驶场景中的泛化能力如何?
主要发现
- 在Town05Long基准测试中,DriveCoT-Agent取得73.6分的驾驶得分、96.8%的路线完成率和0.76分的违规得分,优于先前方法。
- 在更具挑战性的CARLA排行榜2.0(包含未见路线)中,DriveCoT-Agent取得51.9分的驾驶得分,显著超越此前方法。
- 该模型在真实世界nuScenes数据上展现出强大的零样本泛化能力,能正确识别交通灯与行人,并做出适当的制动或行驶决策。
- 定性结果表明,DriveCoT-Agent通过分析视频输入中的运动信息,能正确预测与变道车辆、行人及静止物体的潜在碰撞。
- CoT推理的集成使模型在动态与高速场景中能做出更安全、更具可解释性的决策。
- 通过注入运动信息的视频增强数据,模型性能得到提升,尤其在预测移动物体带来的危险方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。