Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Reinforcement Learning for Autonomous Driving with Safety and Exploration Enhancement

Tianyu Shi, Dong Chen|arXiv (Cornell University)|2021. 10. 13.
Autonomous Vehicle Technology and Safety참고 문헌 22인용 수 9
한 줄 요약

이 논문은 자율주행을 위한 향상된 오프라인 강화학습 프레임워크를 제안하며, 탐색 다양성을 향상시키기 위해 BCQ 알고리즘에 학습 가능한 파ameter 노이즈를 통합하고, 탐색을 안전한 상태 영역으로 제한하기 위해 르아프노프 기반 안전 제약 조건을 도입한다. 이 방법은 고속도로 및 주차 시나리오에서 최신 오프라인 RL 알고리즘보다 뛰어난 주행 안전성과 성능을 달성한다.

ABSTRACT

Reinforcement learning (RL) is a powerful data-driven control method that has been largely explored in autonomous driving tasks. However, conventional RL approaches learn control policies through trial-and-error interactions with the environment and therefore may cause disastrous consequences such as collisions when testing in real-world traffic. Offline RL has recently emerged as a promising framework to learn effective policies from previously-collected, static datasets without the requirement of active interactions, making it especially appealing for autonomous driving applications. Despite promising, existing offline RL algorithms such as Batch-Constrained deep Q-learning (BCQ) generally lead to rather conservative policies with limited exploration efficiency. To address such issues, this paper presents an enhanced BCQ algorithm by employing a learnable parameter noise scheme in the perturbation model to increase the diversity of observed actions. In addition, a Lyapunov-based safety enhancement strategy is incorporated to constrain the explorable state space within a safe region. Experimental results in highway and parking traffic scenarios show that our approach outperforms the conventional RL method, as well as state-of-the-art offline RL algorithms.

연구 동기 및 목표

  • 기존 오프라인 강화학습(RL) 알고리즘에서의 보수적이고 비효율적인 탐색의 한계를 해결하기 위해.
  • 왜곡 모델에 학습 가능한 파ameter 노이즈를 도입하여 오프라인 RL에서 정책의 다양성과 탐색 효율성을 향상시키기 위해.
  • 르아프노프 기반 안정성 제약 조건을 통합하여 탐색 중 안전성을 향상시키고, 상태 공간의 안전 영역으로만 행동을 제한하기 위해.
  • 고속도로 및 주차 환경을 포함한 실제 자율주행 시나리오에서 제안된 방법을 평가하기 위해.
  • 안전성, 효율성, 성공률 측면에서 표준 RL 및 최신 오프라인 RL 알고리즘에 비해 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 행동 다양성을 높이기 위해, 배치 제약 Q-학습(BCQ) 알고리즘의 왜곡 모델에서 고정 노이즈를 학습 가능한 파ameter 노이즈로 교체함으로써 프레임워크를 확장한다.
  • 학습 중에 학습 가능한 노이즈 파am터를 최적화하여 상태에 따라 왜곡의 크기를 적응적으로 조정함으로써 탐색 효율성을 향상시킨다.
  • 안전하지 않은 상태로 이어지는 행동에 대해 보상을 감소시키기 위해 르아프노프 기반 안전 함수를 구성함으로써, 에이전트가 정의된 안전 영역 내에서만 탐색하도록 보장한다.
  • 리스크 요소를 통해 르아프노프 안정성 유지가 보장되는 상태 전이로 제약 조건을 Q-학습 목표에 통합한다.
  • 학습 안정성을 위해 심층 신경망을 정책과 Q-함수의 파am터화에 사용하고, 경험 재생 및 타겟 네트워크를 적용한다.
  • 고속도로 및 주차 시나리오에서 실제 주행 데이터셋을 사용하여 실험을 수행하며, 평가 지표로는 수익(return), 성공률, 장애물까지 최소 거리, 제어의 부드러움을 포함한다.

실험 결과

연구 질문

  • RQ1왜곡 모델에 학습 가능한 파ameter 노이즈를 적용하면 오프라인 RL에서 자율주행의 탐색 다양성과 정책 성능이 향상되는가?
  • RQ2르아프노프 기반 안전 제약 조건은 학습 효율성을 희생시키지 않고 탐색을 안전한 상태 영역으로 제한하는 데 효과적인가?
  • RQ3실제 주행 시나리오에서 제안된 방법은 표준 BCQ 및 다른 최신 오프라인 RL 알고리즘에 비해 안전성과 성능 측면에서 어떻게 비교되는가?
  • RQ4향상된 탐색과 안전 제약 조건의 조합이 주행 성공률과 승객의 편안함을 얼마나 향상시키는가?
  • RQ5제안된 프레임워크는 고속도로 및 주차장과 같은 복잡하고 동적인 교통 환경에서 더 나은 일반화 및 강건성을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 고속도로 및 주차 시나리오에서 표준 BCQ 및 최신 오프라인 RL 알고리즘을 모두 능가하며, 더 높은 평가 수익과 더 빠른 학습 수렴 속도를 달성한다.
  • 왜곡 모델에 학습 가능한 파ameter 노이즈를 적용함으로써 주차 시나리오에서 주된 상태-행동 쌍의 밀도를 나타내는 PCA 기반 플롯을 통해 관측된 상태-행동 쌍의 다양성이 크게 증가함을 확인할 수 있었다.
  • 르아프노프 기반 안전 향상으로 인해 고속도로 시나리오에서 주변 차량까지의 최소 거리가 평균 5미터 이상 증가했으며, Noisy BCQ는 빈번히 5미터 이하로 떨어지는 경향이 있었다.
  • 제안된 방법은 Noisy BCQ보다 더 부드러운 조향 제어와 낮고 진동이 적은 가속도를 기록하여, 더 나은 탑승 편안함과 기계적 스트레스 감소를 나타낸다.
  • 주차 시나리오에서 제안된 방법은 비교된 모든 방법 중 가장 높은 성공률을 기록했으며, BCQ 및 Noisy BCQ를 모두 능가했다.
  • 학습 가능한 노이즈와 안전 제약 조건의 조합은 안전성을 유지하면서도 더 효과적으로 탐색을 수행할 수 있도록 하여, 단지 하나의 구성 요소에 의존하는 방법보다 더 균형 잡힌 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.