Skip to main content
QUICK REVIEW

[논문 리뷰] Drive as You Speak: Enabling Human-Like Interaction with Large Language Models in Autonomous Vehicles

Can Cui, Yunsheng Ma|arXiv (Cornell University)|2023. 09. 19.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 자율주행차의 의사결정 '뇌'로 대규모 언어모델(Large Language Models, LLMs)을 통합하는 인간 중심의 프레임워크를 제안한다. 이 프레임워크는 인식, 정위치화, 내부 승객 모니터링을 '감각 입력'으로 활용하고 차량 제어를 '행동'으로 삼는다. LLMs는 자연어 상호작용, 실시간 맥락 추론, 제로샷 계획 수립, 개인화 및 투명한 의사결정 설명 기능을 제공하여 고속 추월과 같은 복잡한 주행 상황에서 안전성, 신뢰도 및 사용자 경험을 크게 향상시킨다.

ABSTRACT

The future of autonomous vehicles lies in the convergence of human-centric design and advanced AI capabilities. Autonomous vehicles of the future will not only transport passengers but also interact and adapt to their desires, making the journey comfortable, efficient, and pleasant. In this paper, we present a novel framework that leverages Large Language Models (LLMs) to enhance autonomous vehicles' decision-making processes. By integrating LLMs' natural language capabilities and contextual understanding, specialized tools usage, synergizing reasoning, and acting with various modules on autonomous vehicles, this framework aims to seamlessly integrate the advanced language and reasoning capabilities of LLMs into autonomous vehicles. The proposed framework holds the potential to revolutionize the way autonomous vehicles operate, offering personalized assistance, continuous learning, and transparent decision-making, ultimately contributing to safer and more efficient autonomous driving technologies.

연구 동기 및 목표

  • LLMs가 실시간 주행 환경을 인지하는 데 한계가 있음을 해결하기 위해, 차량 인식 및 제어 모듈과의 통합을 통해 이를 보완한다.
  • 자율주행차가 '앞차를 추월하라'와 같은 자연어 명령어를 맥락 추론과 안전 점검을 통해 이해하고 응답할 수 있도록 한다.
  • 특히 복잡하거나 드문 상황에서 의사결정을 평이한 언어로 설명할 수 있도록 LLM을 활용해 투명성과 신뢰도를 향상시킨다.
  • 기억 모듈을 통해 운전자의 선호도와 과거 행동을 접근함으로써 지속적인 개인화를 지원한다.
  • 단지 LLM과 처리된 센서 데이터만을 사용하여도 동적 주행 상황에서 제로샷 추론의 가능성을 입증한다.

제안 방법

  • LLM은 환경 데이터를 처리한 인식, 정위치화, 내부 승객 모니터링 시스템으로부터 입력을 받는 중심 의사결정 모듈로 기능한다.
  • 자연어 명령어는 LLM이 해석되며, 관련 모듈(예: 차량 속도 및 거리 정보 확보를 위한 인식 모듈)에 질의하여 맥락을 확보한다.
  • LLM은 교통 상황, 차량 동역학, 운전자 상태(예: 주의 집중도, 안전벨트 착용 여부), 도로 기하학적 특성 등을 평가함으로써 다층적 추론을 수행한다.
  • 안전성, 효율성, 사용자 선호도를 고려해 9단계의 운동 계획을 수립하고, 제어 명령어를 차량 제어기로 전송하여 실행한다.
  • 기억 모듈을 통해 사용자 선호도(예: 선호하는 뒷거리, 추월 속도 등)를 기억하여 개인화를 구현한다.
  • 모든 의사결정은 실시간으로 자연어로 설명되며, 이는 투명성 향상과 사용자 신뢰 구축에 기여한다.
Figure 1 : The human-centric LLM-integrated framework for autonomous vehicles.
Figure 1 : The human-centric LLM-integrated framework for autonomous vehicles.

실험 결과

연구 질문

  • RQ1LLMs를 자율주행차에 효과적으로 통합하여 자연어 상호작용을 가능하게 하면서도 안전성을 유지할 수 있는가?
  • RQ2LLMs는 특정 구성에 노출된 바가 없이도 실제 복잡한 주행 상황에서 제로샷 추론을 수행할 수 있는가?
  • RQ3LLMs를 차량 인식 및 제어 모듈과 통합함으로써 의사결정의 투명성과 사용자 신뢰는 어떻게 향상되는가?
  • RQ4LLMs는 과거 사용자 선호도와 실시간 맥락을 기반으로 주행 행동을 얼마나 개인화할 수 있는가?
  • RQ5맥락 추론은 고속 추월과 같은 복잡한 주행 동작을 안전하고 효율적으로 수행하는 데 어떤 역할을 하는가?

주요 결과

  • LLM은 복잡한 조건(다양한 차량 속도 및 거리) 하에서 인디アナ 주의 이중차선 고속도로에서 9단계의 추월 계획을 성공적으로 생성했다.
  • 실시간 데이터 기반으로, 앞서 가는 차량이 30미터 떨어져 112km/h로 주행하고 있고, 따라오는 차량이 40미터 떨어져 104km/h로 주행하고 있음에도 불구하고 추월이 안전하다고 판단했다.
  • LLM은 안전 점검 및 궤적 계획을 포함한 상세한 단계별 추론 설명을 제공하여 투명성을 높였다.
  • 사전에 동일한 구성에 대해 훈련된 바가 없음에도 불구하고, 익숙하지 않은 상황을 제로샷 추론으로 처리함으로써 유연성을 입증했다.
  • 운전자의 선호도(예: 속도나 뒷거리에 대한 편안함 수준)를 기억함으로써 개인화된 추월 행동을 구현했다.
  • 감각 입력과 제어기와의 LLM 통합은 규칙 기반 시스템에 비해 융통성과 설명 가능성 면에서 뛰어난 원활하고 직관적이며 안전한 상호작용 모델을 제공했다.
Figure 2 : General Q&A with ChatGPT-4 regarding autonomous vehicles.
Figure 2 : General Q&A with ChatGPT-4 regarding autonomous vehicles.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.