Skip to main content
QUICK REVIEW

[논문 리뷰] EnsembleFollower: A Hybrid Car-Following Framework Based On Reinforcement Learning and Hierarchical Planning

Xu Han, Xianda Chen|arXiv (Cornell University)|2023. 08. 30.
Autonomous Vehicle Technology and Safety인용 수 4
한 줄 요약

이 논문은 고속도로 주행 환경에서 다양한 주행 조건에 따라 다수의 저수준 차량 추종 모델(예: IDM, Gipps, FVD, RNN, DDPG)을 동적으로 선택하거나 융합하는 계층적 강화학습 프레임워크인 EnsembleFollower를 제안한다. 이는 자율주행 차량의 종방향 제어 정확도와 강인성을 향상시키기 위한 것이다. HighD 데이터셋에서 평가한 결과, 강화학습 기반 의사결정을 통해 상호보완적인 강점을 활용함으로써 개별 모델 및 최신 기술보다 뛰어난 성능을 보였다.

ABSTRACT

Car-following models have made significant contributions to our understanding of longitudinal driving behavior. However, they often exhibit limited accuracy and flexibility, as they cannot fully capture the complexity inherent in car-following processes, or may falter in unseen scenarios due to their reliance on confined driving skills present in training data. It is worth noting that each car-following model possesses its own strengths and weaknesses depending on specific driving scenarios. Therefore, we propose EnsembleFollower, a hierarchical planning framework for achieving advanced human-like car-following. The EnsembleFollower framework involves a high-level Reinforcement Learning-based agent responsible for judiciously managing multiple low-level car-following models according to the current state, either by selecting an appropriate low-level model to perform an action or by allocating different weights across all low-level components. Moreover, we propose a jerk-constrained kinematic model for more convincing car-following simulations. We evaluate the proposed method based on real-world driving data from the HighD dataset. The experimental results illustrate that EnsembleFollower yields improved accuracy of human-like behavior and achieves effectiveness in combining hybrid models, demonstrating that our proposed framework can handle diverse car-following conditions by leveraging the strengths of various low-level models.

연구 동기 및 목표

  • 다양한 조건에서 복잡하고 다양한 주행 행동을 포괄하지 못하는 단일 차량 추종 모델의 한계를 해결하기 위해.
  • 다양한 보완적 모델을 통합함으로써 자율주행 차량의 종방향 제어에서 일반화 능력과 안전성을 향상시키기 위해.
  • 실시간 주행 상태에 기반해 지능적으로 저수준 모델을 선택하거나 융합하는 계층적 프레임워크를 개발하기 위해.
  • 실제 고속도로 주행 데이터를 기반으로 한 HighD 데이터셋을 활용해 프레임워크의 효과성을 검증하기 위해.

제안 방법

  • 현재 주행 상태에 기반해 다수의 저수준 차량 추종 모델을 관리하는 고수준 강화학습(RL) 에이전트(DDQN 또는 PPO 사용)를 적용한다.
  • 두 가지 협업 메커니즘을 지원한다: 이산적 모델 선택(DDQN를 통한) 및 출력 값의 볼록 조합(PPO를 통한 가중치 학습)
  • 모의주행 중 부드럽고 현실적인 차량 운동을 보장하기 위해 제동 가속도 제약이 있는 운동학 모델을 통합한다.
  • 실제 HighD 궤적 데이터를 기반으로 한 시뮬레이터와의 상호작용을 통해 RL 에이전트를 훈련시킨다.
  • 보정된 파ameter와 초모델 설정을 가진 규칙 기반 모델(Gipps, IDM, FVD)과 데이터 기반 모델(RNN, DDPG)을 저수준 구성요소로 사용한다.
  • 훈련 안정성 향상과 샘플 효율성 향상을 위해 커리큘럼 학습과 경험 재생 기법을 적용한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 프레임워크는 다수의 저수준 차량 추종 모델을 효과적으로 융합하여 종방향 주행 행동의 정확도를 향상시킬 수 있는가?
  • RQ2실제 주행 데이터에서 앙상블 프레임워크의 성능은 개별 규칙 기반 및 데이터 기반 모델 대비 어떻게 비교되는가?
  • RQ3단일 모델 기반 기준 대비, 제안된 프레임워크는 예측 불가능하거나 드문 주행 시나리오에 더 잘 일반화되는가?
  • RQ4이산적 선택과 볼록 조합 중 어느 협업 전략이 다양한 주행 조건에서 더 뛰어난 성능과 강인성을 제공하는가?

주요 결과

  • EnsembleFollower는 HighD 데이터셋에서 개별 규칙 기반 및 데이터 기반 모델 대비 인간과 유사한 차량 추종 행동을 더 정확하게 재현하는 데 크게 기여한다.
  • 볼록 조합 전략(EF-PPO)은 이산적 선택(EF-DDQN)보다 복잡하고 동적인 교통 상황에서 더 뛰어난 성능을 기록했다.
  • EF-DDQN 프레임워크에서 IDM 모델가 가장 자주 선택되었으며, 이는 다양한 조건에서 강력한 기본 성능을 지닌다는 것을 시사한다.
  • 고속도로 주행 및 고감속 상황에서는 Gipps 모델이 우선적으로 선택되었으며, 이는 안전이 중요한 상황에서의 효과성을 입증한다.
  • FVD 및 RNN과 같은 소수 모델은 특수한 경우에 중요한 기여를 하여 앙상블의 일반화 능력을 향상시켰다.
  • 실시간 주행 상태에 기반해 모델 가중치를 동적으로 할당함으로써 안전성과 효율성을 효과적으로 균형 잡은 점이, 모델 사용의 주의 히트맵을 통해 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.