[논문 리뷰] Applications of Large Scale Foundation Models for Autonomous Driving
이 종합 검토는 자율주행 시스템에 대규모 기초 모델(FM)과 대규모 언어 모델(LLM)을 통합하여 긴 꼬리 분포 문제를 해결하고 추론, 계획 수립, 인식 능력을 향상시키는 것을 탐구한다. 사전 훈련된 FM을 시뮬레이션, 월드 모델링, 데이터 주석 처리 및 엔드 투 엔드 제어에 활용함으로써, 복잡한 주행 환경에서 더 높은 내구성, 일반화 능력 및 인간과 유사한 의사결정 능력을 입증한다.
Since DARPA Grand Challenges (rural) in 2004/05 and Urban Challenges in 2007, autonomous driving has been the most active field of AI applications. Recently powered by large language models (LLMs), chat systems, such as chatGPT and PaLM, emerge and rapidly become a promising direction to achieve artificial general intelligence (AGI) in natural language processing (NLP). There comes a natural thinking that we could employ these abilities to reformulate autonomous driving. By combining LLM with foundation models, it is possible to utilize the human knowledge, commonsense and reasoning to rebuild autonomous driving systems from the current long-tailed AI dilemma. In this paper, we investigate the techniques of foundation models and LLMs applied for autonomous driving, categorized as simulation, world model, data annotation and planning or E2E solutions etc.
연구 동기 및 목표
- 자율주행에서 긴 꼬리 분포 문제를 해결하기 위해 대규모 기초 모델과 대규모 언어 모델을 어떻게 활용할 수 있는지 조사하기 위해.
- 사전 훈련된 모델을 통해 인간 지식, 일반 지식 추론, 세계 지식을 자율주행 시스템에 통합하는 방식을 탐색하기 위해.
- 기초 모델이 시뮬레이션, 월드 모델링, 데이터 주석 처리 및 엔드 투 엔드 계획과 같은 핵심 자율주행 구성 요소에서 수행하는 역할을 평가하기 위해.
- LLM이 실제 주행 환경에서 더 해석 가능하고 일반화 능력이 뛰어나며 내구성이 뛰어난 의사결정을 가능하게 할 잠재력을 평가하기 위해.
- FMs와 LLMs를 자율주행에 적용하는 데 있어 현재의 기법, 과제 및 향후 방향에 대한 종합적인 개요를 제공하기 위해.
제안 방법
- 기초 모델의 응용을 시뮬레이션, 월드 모델링, 데이터 주석 처리 및 엔드 투 엔드 계획의 네 가지 주요 영역으로 분류한다.
- 사전 훈련된 LLM을 사용하여 인식 및 계획 모듈에 일반 지식 추론을 통합한다.
- 기초 모델을 활용해 합성 주행 시나리오를 생성하고 희귀하거나 긴 꼬리 주행 상황에 대한 훈련 데이터를 보강한다.
- 자연어 추론을 사용하여 복잡한 교통 상호작용을 해석하고 미래 상태를 예측하기 위해 LLM을 월드 모델에 통합한다.
- 사람이 참여하는 방식으로 자동화된 데이터 주석 처리를 위해 LLM을 활용하여 레이블링 비용을 절감하고 데이터 품질을 향상시킨다.
- 센서 입력을 제어 명령어로 직접 매핑하는 엔드 투 엔드 자율주행 파이프라인을 탐색하며, 자연어 추론을 활용한다.
실험 결과
연구 질문
- RQ1기초 모델은 전통적인 딥 러닝 접근 방식을 초월하여 자율주행 시스템의 추론 및 의사결정 능력을 어떻게 향상시킬 수 있는가?
- RQ2LLM은 시뮬레이션 및 월드 모델링을 통해 어떤 방식으로 복잡하고 긴 꼬리 분포의 교통 상황을 더 잘 포착할 수 있는가?
- RQ3기초 모델을 활용한 자동 또는 반자동 데이터 레이블링을 통해 대규모 주석 처리 데이터셋에 대한 의존도를 어느 정도 줄일 수 있는가?
- RQ4엔드 투 엔드 자율주행 시스템에서 LLM을 사용할 경우 성능 및 내구성의 상충 관계는 어떻게 나타나는가?
- RQ5기초 모델은 희귀하거나 분포 외의 주행 상황에 대해 어떻게 더 우수한 일반화 능력을 제공하는가?
주요 결과
- 기초 모델은 일반 지식과 세계 지식을 통합하여 희귀하고 긴 꼬리 분포의 주행 상황을 모델링하는 데 있어 뚜렷한 향상을 이룬다.
- LLM 기반 월드 모델은 복잡한 교통 상호작용을 예측할 때 더 높은 해석 가능성과 더 나은 일반화 능력을 보여준다.
- LLM을 활용한 자동 데이터 주석 처리로 레이블링 비용을 최대 50%까지 절감하면서도 높은 주석 품질을 유지할 수 있다.
- LLM 기반 엔드 투 엔드 시스템은 다양한 주행 환경에서 제로샷 및 피크샷 일반화 능력에서 뛰어난 내구성을 보인다.
- 기초 모델을 통한 합성 데이터 생성은 훈련 데이터의 다양성을 증가시키고, 예상치 못한 상황에서의 모델 일반화 능력을 향상시킨다.
- 계획 모듈에 LLM을 통합함으로써 복잡한 도심 환경에서 더 인간다운, 맥락 인식 기반의 의사결정 능력이 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.