Skip to main content
QUICK REVIEW

[論文レビュー] Drive as You Speak: Enabling Human-Like Interaction with Large Language Models in Autonomous Vehicles

Can Cui, Yunsheng Ma|arXiv (Cornell University)|Sep 19, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本論文は、自律走行車両における意思決定の『脳』として大規模言語モデル(LLMs)を統合する人間中心のフレームワークを提案する。視認、位置特定、車内モニタリングを『感覚入力』として活用し、車両制御を『行動』として用いる。LLMsにより、自然言語による対話、リアルタイムの文脈的推論、ゼロショット計画、パーソナライズ、透明な意思決定説明が可能となり、高速追い越しなどの複雑な走行シナリオにおいて、安全性、信頼性、ユーザーエクスペリエンスが著しく向上する。

ABSTRACT

The future of autonomous vehicles lies in the convergence of human-centric design and advanced AI capabilities. Autonomous vehicles of the future will not only transport passengers but also interact and adapt to their desires, making the journey comfortable, efficient, and pleasant. In this paper, we present a novel framework that leverages Large Language Models (LLMs) to enhance autonomous vehicles' decision-making processes. By integrating LLMs' natural language capabilities and contextual understanding, specialized tools usage, synergizing reasoning, and acting with various modules on autonomous vehicles, this framework aims to seamlessly integrate the advanced language and reasoning capabilities of LLMs into autonomous vehicles. The proposed framework holds the potential to revolutionize the way autonomous vehicles operate, offering personalized assistance, continuous learning, and transparent decision-making, ultimately contributing to safer and more efficient autonomous driving technologies.

研究の動機と目的

  • LLMsがリアルタイムの走行環境を把握できないという制限を解消するため、LLMsを車両の視認および制御モジュールと統合すること。
  • 『前方の車両を追い抜く』といった自然言語コマンドを、文脈的推論と安全確認を伴って解釈・実行できる自律走行車両の実現。
  • 特に複雑またはレアなシナリオにおいても、LLMsが意思決定を日常言語で説明することで、信頼性と透明性を向上させること。
  • メモリモジュールを介してドライバーの好みや過去の行動をアクセスすることで、継続的なパーソナライズを可能とすること。
  • LLMsと処理済みセンサデータのみを用いて、動的で変化し続ける走行シナリオにおけるゼロショット推論の実現可能性を示すこと。

提案手法

  • LLMが中心的な意思決定モジュールとして機能し、視認、位置特定、車内モニタリングシステムから処理済みの環境データを受信する。
  • 自然言語コマンドはLLMによって解釈され、関連するモジュール(例:車両の速度や距離を取得するための視認モジュール)に問い合わせて文脈を収集する。
  • LLMは交通状況、車両の動態、ドライバーの状態(例:注視状態、シートベルト着用状況)、道路の幾何学的形状を評価することで、多層的な推論を実行する。
  • 安全性、効率性、ユーザープレファレンスを考慮した9段階の運動計画が生成され、その行動が車両コントローラーに送信されて実行される。
  • システムはメモリモジュールを用いて、ドライバーの好み(例:好ましい追従距離、追い抜き時の速度)を記録・再利用することでパーソナライズを実現する。
  • すべての意思決定には、透明性とユーザートラストを高めるために、リアルタイムで自然言語による説明が付随する。
Figure 1 : The human-centric LLM-integrated framework for autonomous vehicles.
Figure 1 : The human-centric LLM-integrated framework for autonomous vehicles.

実験結果

リサーチクエスチョン

  • RQ1LLMsを自律走行車両に効果的に統合することで、安全を確保しつつ自然言語対話が可能になるか?
  • RQ2LLMsは、特定の設定に事前に露出していない状況においても、複雑な現実世界の走行シナリオでゼロショット推論を実行できるか?
  • RQ3LLMsを車両の視認および制御モジュールと統合することで、意思決定の透明性とユーザートラストはどのように向上するか?
  • RQ4LLMsは、過去のユーザープレファレンスとリアルタイムの文脈に基づいて、走行行動をどの程度パーソナライズできるか?
  • RQ5文脈的推論は、高速追い抜きのような複雑なマニューバーを安全かつ効率的に実行するために、どのように役立つか?

主な発見

  • LLMは、複雑な条件下(車両の速度や距離の変動あり)においても、インディアナ州の二車線道路で9段階の追い抜き計画を正常に生成した。
  • リアルタイムデータに基づき、前方に30メートル離れた車両が時速112km/h、後方の40メートル離れた車両が時速104km/hで走行している状況でも、追い抜きが安全であると判断した。
  • LLMは、安全確認と軌道計画を含む詳細な段階的説明を提供し、意思決定の透明性を高めた。
  • システムは、訓練データにない特定の状況に対しても、事前のトレーニングなしに処理可能なゼロショット推論を示した。
  • ドライバーの好み(速度や追従距離に対する快適度)を記録・再利用することで、パーソナライズが実現された。
  • LLMsを感覚入力およびコントローラーと統合することで、滑らかで直感的かつ安全なインタラクションモデルが実現され、柔軟性と説明可能性においてルールベースシステムを上回った。
Figure 2 : General Q&A with ChatGPT-4 regarding autonomous vehicles.
Figure 2 : General Q&A with ChatGPT-4 regarding autonomous vehicles.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。