Skip to main content
QUICK REVIEW

[論文レビュー] Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving

Long Chen, Oleg Sinavski|arXiv (Cornell University)|Oct 3, 2023
Topic Modeling被引用数 6
ひとこと要約

本論文は、物体レベルのベクトル表現と事前学習済み言語モデルを統合することで、説明可能で推論に基づく自動運転を可能にする、新しいマルチモーダルLLMアーキテクチャを提案する。ベクトル記述データで事前学習し、強化学習で生成されたドライブシナリオから得た160kのQAデータセットで微調整することで、LLMドライバーはドライブQAおよび行動予測において優れた性能を発揮し、事前学習を施した場合、GPTによる採点で平均9.1%の向上を達成した。

ABSTRACT

Large Language Models (LLMs) have shown promise in the autonomous driving sector, particularly in generalization and interpretability. We introduce a unique object-level multimodal LLM architecture that merges vectorized numeric modalities with a pre-trained LLM to improve context understanding in driving situations. We also present a new dataset of 160k QA pairs derived from 10k driving scenarios, paired with high quality control commands collected with RL agent and question answer pairs generated by teacher LLM (GPT-3.5). A distinct pretraining strategy is devised to align numeric vector modalities with static LLM representations using vector captioning language data. We also introduce an evaluation metric for Driving QA and demonstrate our LLM-driver's proficiency in interpreting driving scenarios, answering questions, and decision-making. Our findings highlight the potential of LLM-based driving action generation in comparison to traditional behavioral cloning. We make our benchmark, datasets, and model available for further exploration.

研究の動機と目的

  • LLMを推論の「脳」として統合することで、自動運転システムにおける解釈可能性と分布外推論の向上を図ること。
  • 速度や距離などの物体レベルの数値的ベクトルモダリティを事前学習済みLLMと効果的に統合し、より豊かな文脈理解を実現すること。
  • 強化学習エージェントとGPT-3.5を用いて、高品質なドライブシナリオQAペアを自動で生成するスケーラブルなパイプラインの開発。
  • LLMベースの評価と再現可能なベースラインモデルを備えた、ドライブQAのための新基準を確立すること。
  • ベクトルおよびテキスト入力のみを用いて、エンドツーエンドのLLMベースのドライブポリシー学習の可能性を検討すること。

提案手法

  • 数値的ベクトルモダリティをLLM表現と一致させるために、物体レベルのベクトルからテキスト的記述(ベクトル記述)を生成する二段階の事前学習戦略を採用する。
  • カスタム2Dドライブシミュレータが多様なドライブシナリオを生成し、強化学習エージェントがエキスパート制御命令を提供する。
  • 教師LLM(GPT-3.5)が、言語化されたベクトル観測に基づいて160kの質問-回答ペアを生成する。
  • LLMアーキテクチャはアダプタを用いてベクトルとテキストモダリティを統合し、シーン文脈における統合的推論を可能にする。
  • 評価では、GPT-3.5を採点者として用い、テストセットにおける回答品質を評価する。信頼性を確保するため、人間によるアノテーションによる検証も実施する。
  • 最終的なLLMドライバーは、ドライブ行動予測およびシナリオ理解のため、QAデータセットで微調整される。

実験結果

リサーチクエスチョン

  • RQ1テキスト的記述による事前学習によって、物体レベルのベクトルモダリティを事前学習済みLLMに効果的に埋め込むことができるか?
  • RQ2従来の行動クラーニングと比較して、LLMベースのエージェントはドライブQAおよび行動予測においてどの程度の性能を発揮するか?
  • RQ3ベクトル記述による事前学習が、LLMのドライブシナリオに関する推論能力をどの程度向上させるか?
  • RQ4解釈可能性が向上したLLMベースのシステムは、分布外のドライブシナリオにどの程度一般化できるか?
  • RQ5GPT-3.5はドライブQAタスクにおける人間のフィードバックを模倣する評価者として、どの程度有効か?

主な発見

  • 事前学習を施したLLMドライバーは、ドライブQAベンチマークで平均8.39のGPT採点を達成し、非事前学習バージョンと比較して9.1%の向上を示した。
  • 人間によるアノテーション評価により、モデルの性能が確認され、平均7.71のスコアを示し、GPT採点と強い整合性を示した。
  • 定数およびランダム回答のベースラインと比較して、モデルは顕著に優れた性能を発揮し、GPTスコアはそれぞれ2.92および3.88であった。
  • 事前学習戦略により、ベクトルモダリティがLLM表現と効果的に一致し、ドライブシナリオにおけるより良い文脈的推論が可能になった。
  • LLMドライバーは優れた一般化性能と解釈可能性を示し、自律システムにおけるAGIに近い推論の可能性を示唆した。
  • 本研究は、ベクトルモダリティ統合、データセット、評価パイプラインを備えた、最初のエンドツーエンドのLLMベースドライブフレームワークを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。