Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning in Autonomous Car Path Planning and Control: A Survey

Yiyang Chen, Chao Ji|arXiv (Cornell University)|2024. 03. 30.
Robotic Path Planning Algorithms인용 수 4
한 줄 요약

이 종합 검토는 도시 주행, 고속도로 주행, 교차로 주행와 같은 다양한 환경에서 자율주행차의 경로 계획 및 제어에 응용된 딥 강화학습(DRL)의 포괄적인 분석을 제공한다. SAC, PPO, DDPG와 같은 DRL 알고리즘의 성능을 평가하며, 샘플 효율성, 안전성, 일반화 능력 등의 핵심 과제를 규명하고, 안전성 층과 입력 전처리 기법을 통합한 프레임워크를 제안하여 강인성과 실세계 적용 가능성을 향상시킨다.

ABSTRACT

Combining data-driven applications with control systems plays a key role in recent Autonomous Car research. This thesis offers a structured review of the latest literature on Deep Reinforcement Learning (DRL) within the realm of autonomous vehicle Path Planning and Control. It collects a series of DRL methodologies and algorithms and their applications in the field, focusing notably on their roles in trajectory planning and dynamic control. In this review, we delve into the application outcomes of DRL technologies in this domain. By summarizing these literatures, we highlight potential challenges, aiming to offer insights that might aid researchers engaged in related fields.

연구 동기 및 목표

  • 자율주행차 경로 계획 및 제어 분야에서 최근의 딥 강화학습(DRL) 기술 발전을 체계적으로 검토하기 위해.
  • 동적이고 불확실한 주행 환경에서 DRL 알고리즘의 성능 및 한계를 분석하기 위해.
  • 샘플 효율성, 안전성 제약, 환경 간 일반화 능력 등의 핵심 과제를 규명하기 위해.
  • DRL과 전통적 제어 시스템 간의 통합 전략을 탐색하여 강인성 및 실세계 적용 가능성을 향상시키기 위해.
  • 더 안전한 훈련 방법과 향상된 시뮬레이션 프레임워크를 포함한未래 연구 방향을 제안하기 위해.

제안 방법

  • Web of Science, LLM 도구, 단어 임bedding 기반 키워드 검색을 활용해 약 500건의 관련 DRL-자율주행 논문을 걸러낸 체계적 문헌 검토를 수행하였다.
  • 경로 계획, 운동 제어, 엔드 투 엔드 학습에 응용된 DRL 방법을 기반으로 분류 및 통합 분석을 수행하였다.
  • SAC, PPO, TD3, DQN, DDPG 및 모델 기반 강화학습을 포함한 DRL 알고리즘의 연속 제어 및 복잡한 의사결정 과제에서의 성능을 평가하였다.
  • 계층적 강화학습을 활용한 안전성 층을 제안하여 적응형 제약 조건과 동적 목표 설정을 통해 위험한 행동을 모니터링하고 수정하였다.
  • 탐색 능력을 손상시키지 않은 채로 위험한 행동을 간접적으로 제한하기 위해 입력 전처리 및 상태 필터링 기법을 적용하였다.
  • 엔드 투 엔드 DRL 프레임워크에 자기주의 메커니즘과 최적 제어 전략을 통합하여 시간적 모델링 능력과 제어 정확도를 향상시켰다.

실험 결과

연구 질문

  • RQ1동적이고 불확실한 조건 하에서 자율주행차 경로 계획 및 제어에 있어 어떤 DRL 알고리즘이 뛰어난 성능을 보였는가?
  • RQ2학습 효율성을 저하시키지 않으면서 DRL 기반 자율주행 시스템에서 안전성을 어떻게 효과적으로 확보할 수 있는가?
  • RQ3입력 전처리 및 상태 필터링은 DRL 에이전트가 위험한 행동으로부터 멀어지도록 하는 데 어떤 역할을 하는가?
  • RQ4모델 기반 DRL과 적응형 동적 프로그래밍은 장거리 제어 및 안정성 향상에 어떻게 기여하는가?
  • RQ5실세계 자율주행에 DRL를 구현하는 데 있어 주요 장애물은 무엇이며, 이를 어떻게 해결할 수 있는가?

주요 결과

  • SAC, PPO, TD3는 복잡한 환경에서의 안정성과 샘플 효율성 덕분에 동적 경로 계획 과제에서 뛰어난 성능을 보였다.
  • DDPG는 부드러운 궤적 추적에 효과적인 기울기 신호 전달 능력과 높은 샘플 효율성 덕분에 연속 제어 과제에서 널리 사용되었다.
  • 모델 기반 DRL과 적응형 동적 프로그래밍(ADP)은 정확한 차량 동역학 모델링을 활용하여 장거리 제어에서 효과적인 성능을 보였다.
  • 자기주의 및 최적 제어 전략을 통합한 엔드 투 엔드 제어 프레임워크는 시간적 추론 능력을 향상시키고 오차 누적도 감소시켰다.
  • 적응형 제약 조건을 갖춘 계층적 강화학습 기반 안전성 층은 학습 속도를 손상시키지 않은 채 복잡한 고속도로 환경에서 안전성 성능을 크게 향상시켰다.
  • 입력 전처리 및 상태 필터링은 시뮬레이션 벤치마크에서 위험 행동 발생 가능성을 40–60% 감소시켜 탐색 능력을 제한하지 않은 채 안전성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.