[논문 리뷰] DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving
이 논문은 CARLA 시뮬레이터에서 규칙 기반 전문가 정책을 사용해 수집한 체인 오브 써모(Chain-of-Thought, CoT) 주석을 갖춘 종단 간 주행 데이터셋인 DriveCoT을 소개한다. 이는 주행 측면과 최종 결정에 대한 추론을 위한 것이다. 또한 다중 시야 영상 기반 모델인 DriveCoT-Agent를 제안하여 추론 예측을 생성함으로써 해석 가능성과 성능을 향상시키며, 고속 주행 및 차선 변경과 같은 도전적인 시나리오에서 개방형 및 폐쇄형 평가 모두에서 최신 기술 수준의 성능을 달성한다.
End-to-end driving has made significant progress in recent years, demonstrating benefits such as system simplicity and competitive driving performance under both open-loop and closed-loop settings. Nevertheless, the lack of interpretability and controllability in its driving decisions hinders real-world deployment for end-to-end driving systems. In this paper, we collect a comprehensive end-to-end driving dataset named DriveCoT, leveraging the CARLA simulator. It contains sensor data, control decisions, and chain-of-thought labels to indicate the reasoning process. We utilize the challenging driving scenarios from the CARLA leaderboard 2.0, which involve high-speed driving and lane-changing, and propose a rule-based expert policy to control the vehicle and generate ground truth labels for its reasoning process across different driving aspects and the final decisions. This dataset can serve as an open-loop end-to-end driving benchmark, enabling the evaluation of accuracy in various chain-of-thought aspects and the final decision. In addition, we propose a baseline model called DriveCoT-Agent, trained on our dataset, to generate chain-of-thought predictions and final decisions. The trained model exhibits strong performance in both open-loop and closed-loop evaluations, demonstrating the effectiveness of our proposed dataset.
연구 동기 및 목표
- 종단 간 자율주행 시스템에서의 해석 가능성과 제어 가능성 부족 문제를 해결하기 위해.
- 안전이 중요한 상황에서의 주행 결정을 위한 상세한 체인 오브 써모 레이블을 갖춘 종합적인 데이터셋을 구축하기 위해.
- 다중 시야 영상 입력을 사용하여 추론 트레이스와 최종 주행 결정을 생성하는 기준 모델을 개발하기 위해.
- 최종 결정 외에도 다양한 주행 측면에 걸친 추론 정확도를 평가할 수 있도록 모델 성능 평가를 가능하게 하기 위해.
- CoT 통합 학습을 통해 고속 주행 및 복잡한 주행 상황에서의 일반화 능력과 강건성을 향상시키기 위해.
제안 방법
- DriveCoT 데이터셋은 다중 시야 카메라와 라이다를 활용한 CARLA 시뮬레이터를 사용하여 고속 주행 및 차선 변경 시나리오 동안 센서 데이터를 캡처함으로써 수집된다.
- 규칙 기반 전문가 정책이 각 주행 결정에 대한 지표(충돌 위험, 신호등 상태, 보행자 존재 여부 등)를 포함한 지상 진실 체인 오브 써모 레이블을 생성한다.
- DriveCoT-Agent 모델은 다중 시야 영상과 목표 지점 입력을 받아 다양한 주행 측면에 대한 CoT 추론을 예측한다.
- 최종 주행 결정(속도 및 웨이포인트)은 CoT 예측를 통합하는 추론 집계 메커니즘을 통해 유도된다.
- 모델 일반화 및 운동 이해 능력을 향상시키기 위해 운동 주입 영상 시퀀스를 활용한 데이터 증강 기법이 적용된다.
- 모델는 실제 데이터와 증강 데이터가 혼합된 데이터셋에서 파인튜닝된 후, 개방형 및 폐쇄형 설정 모두에서 평가된다.
실험 결과
연구 질문
- RQ1체인 오브 써모 추론이 종단 간 자율주행에서 해석 가능성과 제어 가능성 향상에 기여하는가?
- RQ2다중 시야 영상 기반 모델이 정확하고 일관성 있는 주행 추론 트레이스를 생성하는 데 얼마나 효과적인가?
- RQ3CoT 통합 모델은 고속 주행 및 차선 변경과 같은 새로운 복잡한 주행 상황에 일반화될 수 있는가?
- RQ4추론 트레이스 통합이 이전 종단 간 방법 대비 폐쇄형 평가에서 성능 향상에 기여하는가?
- RQ5합성 CoT 데이터로 파인튜닝된 모델이 실제 주행 상황으로의 일반화 능력은 어느 정도인가?
주요 결과
- Town05Long 벤치마크에서 DriveCoT-Agent는 주행 점수 73.6, 루트 완료율 96.8%, 위반 점수 0.76를 기록하며 이전 방법들을 능가한다.
- 미리 보지 않은 루트를 포함한 더 도전적인 CARLA 랭킹 2.0에서 DriveCoT-Agent는 주행 점수 51.9를 기록하며 이전 방법들을 크게 앞서 간다.
- 모델는 실세계 nuScenes 데이터에 대해 강력한 zero-shot 일반화 능력을 보이며, 신호등과 보행자를 정확히 식별하고 적절한 브레이킹 또는 주행 결정을 내린다.
- 정성적 결과에서는 영상 입력의 운동을 분석함으로써 합류하는 차량, 보행자, 정지된 물체와의 잠재적 충돌을 정확히 예측함을 보여준다.
- CoT 추론 통합은 특히 다이나믹하고 고속 주행 상황에서 더 안전하고 해석 가능한 결정을 내리는 데 기여한다.
- 운동 주입 영상 증강을 통해 모델 성능이 향상되었으며, 특히 움직이는 물체에서 유래하는 위험을 예측하는 데서 두드러진 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.