Skip to main content
QUICK REVIEW

[論文レビュー] DriveCoT: Integrating Chain-of-Thought Reasoning with End-to-End Driving

Tingkai Wang, Enze Xie|arXiv (Cornell University)|Mar 25, 2024
Semantic Web and Ontologies被引用数 4
ひとこと要約

本稿では、CARLAシミュレータでルールベースのエキスパートポリシーを用いて収集した、走行の各側面および最終意思決定における推論のためのチェーン・オブ・トゥーク(CoT)アノテーションを備えた、エンド・トゥ・エンド走行用の新規データセットDriveCoTを紹介する。本稿では、マルチビュー動画入力を用いたDriveCoT-Agentというモデルを提案し、解釈可能性を向上させるとともに、高速走行やレーン変更などの困難なシナリオにおけるオープンループおよびクローズドループ評価で最先端の性能を達成する。

ABSTRACT

End-to-end driving has made significant progress in recent years, demonstrating benefits such as system simplicity and competitive driving performance under both open-loop and closed-loop settings. Nevertheless, the lack of interpretability and controllability in its driving decisions hinders real-world deployment for end-to-end driving systems. In this paper, we collect a comprehensive end-to-end driving dataset named DriveCoT, leveraging the CARLA simulator. It contains sensor data, control decisions, and chain-of-thought labels to indicate the reasoning process. We utilize the challenging driving scenarios from the CARLA leaderboard 2.0, which involve high-speed driving and lane-changing, and propose a rule-based expert policy to control the vehicle and generate ground truth labels for its reasoning process across different driving aspects and the final decisions. This dataset can serve as an open-loop end-to-end driving benchmark, enabling the evaluation of accuracy in various chain-of-thought aspects and the final decision. In addition, we propose a baseline model called DriveCoT-Agent, trained on our dataset, to generate chain-of-thought predictions and final decisions. The trained model exhibits strong performance in both open-loop and closed-loop evaluations, demonstrating the effectiveness of our proposed dataset.

研究の動機と目的

  • エンド・トゥ・エンド自律走行システムにおける解釈可能性と制御可能性の欠如に対処すること。
  • 安全に重要なシナリオにおける走行意思決定の詳細なチェーン・オブ・トゥークラベルを備えた包括的なデータセットの構築。
  • マルチビュー動画入力を用いて推論トレースと最終走行意思決定を生成するベースラインモデルの開発。
  • 最終意思決定の評価に加え、複数の走行側面にわたる推論の正確性についての評価を可能にすること。
  • CoT統合学習を通じて、高速走行や複雑な走行シナリオにおける一般化性と耐障害性の向上。

提案手法

  • DriveCoTデータセットは、マルチビューカメラとLiDARを備えたCARLAシミュレータを用い、高速走行およびレーン変更シナリオ中にセンサデータを収集することで構築された。
  • ルールベースのエキスパートポリシーが、衝突リスク、信号機の状態、歩行者存在など、走行意思決定の各側面をカバーする真値のチェーン・オブ・トゥークラベルを生成した。
  • DriveCoT-Agentモデルは、マルチビュー動画とターゲットポイントを入力とし、走行の各側面についてCoT推論を予測する。
  • 最終的な走行意思決定(速度とウェイポイント)は、CoT予測を統合する推論集約メカニズムを通じて導出される。
  • モデルの一般化性と運動理解を向上させるために、動きを注入した動画シーケンスを用いたデータ拡張が適用された。
  • モデルは、実データと拡張データの混合データセットでファインチューニングされ、オープンループおよびクローズドループ設定の両方で評価された。

実験結果

リサーチクエスチョン

  • RQ1チェーン・オブ・トゥーク推論は、エンド・トゥ・エンド自律走行における解釈可能性と制御可能性を向上させることができるか?
  • RQ2マルチビュー動画ベースのモデルは、正確で整合性のある走行推論トレースを生成するのにどの程度有効か?
  • RQ3CoT統合モデルは、高速走行やレーン変更などの未観測の複雑な走行シナリオに一般化できるか?
  • RQ4推論トレースの統合は、従来のエンド・トゥ・エンド手法と比較して、クローズドループ評価での性能向上をもたらすか?
  • RQ5合成されたCoTデータでファインチューニングされたモデルは、実世界の走行シナリオにどの程度一般化できるか?

主な発見

  • DriveCoT-Agentは、Town05Longベンチマークで走行スコア73.6、ルート完了率96.8%、インフラクションスコア0.76を達成し、先行手法を上回った。
  • 未観測ルートを含むより挑戦的なCARLAリーダーボード2.0において、DriveCoT-Agentは走行スコア51.9を達成し、顕著に先行手法を上回った。
  • モデルは実世界のnuScenesデータへのゼロショット一般化が強く示され、信号機や歩行者の特定を正しく行い、適切なブレーキングまたは走行意思決定を下した。
  • 定性的な結果から、DriveCoT-Agentは動画入力の運動を分析することで、合流車両、歩行者、停止物体との潜在的衝突を正しく予測した。
  • CoT推論の統合により、特に動的で高速なシナリオにおいて、より安全で解釈可能な意思決定が可能になった。
  • 動きを注入した動画を用いたデータ拡張により、動く物体からの危険の予測性能が向上し、モデル全体の性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。