Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Reinforcement Learning for Autonomous Vehicles through Parallel Constrained Policy Optimization

Lu Wen, Jingliang Duan|arXiv (Cornell University)|2020. 03. 03.
Reinforcement Learning in Robotics참고 문헌 21인용 수 7
한 줄 요약

이 논문은 안정된 강화학습 알고리즘인 병렬 제약 정책 최적화(Parallel Constrained Policy Optimization, PCPO)를 제안한다. 이는 신뢰 영역 제약을 적용한 세 개의 네트워크로 구성된 액터-크리틱 아키텍처에 위험 함수를 통합하여 자율 주행 차량을 위한 안전한 강화학습을 구현한다. PCPO는 예상 위험을 사전에 정의된 한계 이하로 제한함으로써 학습 중 안전성을 확보하며, PPO와 CPO보다 빠른 학습 속도와 높은 데이터 효율성을 확보하면서도 학습 과정에서 안전성을 유지한다. 이는 주행 유지 및 다중 차량 교차로 작업 모두에서 성능을 입증하였다.

ABSTRACT

Reinforcement learning (RL) is attracting increasing interests in autonomous driving due to its potential to solve complex classification and control problems. However, existing RL algorithms are rarely applied to real vehicles for two predominant problems: behaviours are unexplainable, and they cannot guarantee safety under new scenarios. This paper presents a safe RL algorithm, called Parallel Constrained Policy Optimization (PCPO), for two autonomous driving tasks. PCPO extends today's common actor-critic architecture to a three-component learning framework, in which three neural networks are used to approximate the policy function, value function and a newly added risk function, respectively. Meanwhile, a trust region constraint is added to allow large update steps without breaking the monotonic improvement condition. To ensure the feasibility of safety constrained problems, synchronized parallel learners are employed to explore different state spaces, which accelerates learning and policy-update. The simulations of two scenarios for autonomous vehicles confirm we can ensure safety while achieving fast learning.

연구 동기 및 목표

  • 기존 자율 주행을 위한 강화학습(RL) 방법에서의 안전 보장을 확보하지 못하는 문제를 해결하기 위해.
  • 위험 중립적 강화학습의 한계를 극복하기 위해, 새로운 또는 복잡한 상황에서 위험한 행동을 유도할 수 있는 문제를 해결하기 위해.
  • 학습 중 정책의 안전성을 보장하면서도 고속의 학습 속도와 높은 데이터 효율성을 유지하는 안전한 강화학습 알고리즘을 개발하기 위해.
  • 안전 제약을 위반하지 않으면서 안전한 탐색과 최적 또는 near-optimal 정책 수렴을 가능하게 하기 위해.
  • 실제 주행 환경에 유사한 자율 주행 작업, 즉 주행 유지 및 교차로 통과와 같은 과제에서 방법의 타당성을 검증하기 위해.

제안 방법

  • PCPO는 표준 액터-크리틱 아키텍처를 세 개의 별도 신경망으로 확장한 삼성분 프레임워크로 구성된다: 정책 네트워크, 가치 함수 네트워크, 그리고 예상 위험 함수를 근사하는 새로운 네트워크.
  • 신뢰 영역 제약을 적용하여 큰 정책 업데이트를 허용하면서도 단조로운 향상을 유지하고, 정책의 치명적인 악화를 방지한다.
  • 위험 함수는 그 기대값이 사전에 정의된 위험 한도 이하로 유지되도록 제약을 둔다. 이는 학습 중 안전성을 보장한다.
  • 동기화된 병렬 학습자들이 동시에 상태 공간의 서로 다른 영역을 탐색함으로써 탐색 속도를 가속화하고 안전한 정책 수렴을 향상시킨다.
  • 목표는 예상 수익을 최대화하면서도 위험 제약 조건을 만족시키는 제약 최적화 공식을 사용한다.
  • 학습 목표에 위험 지표를 통합하여 위험 중심 탐색을 통합함으로써, 안전하고 제어 가능한 영역에서의 탐색을 촉진한다.

실험 결과

연구 질문

  • RQ1인간의 예시나 사전 정의된 안전 행동에 의존하지 않고도 자율 주행 과제에서 학습 중 안전성을 유지할 수 있는 강화학습 알고리즘이 존재하는가?
  • RQ2딥 강화학습 프레임워크에서 위험을 명시적으로 모델링하고 제약을 둠으로써 복잡한 주행 환경에서의 안전한 정책 학습을 어떻게 보장할 수 있는가?
  • RQ3제안된 PCPO 알고리즘이 표준 PPO 및 CPO에 비해 학습 속도와 데이터 효율성에서 얼마나 향상되는가?
  • RQ4교차로 통과와 같은 안전이 중요한 상황에서 PCPO는 에이전트가 위험하거나 부분 최적의 정책으로 수렴하는 것을 방지할 수 있는가?
  • RQ5병렬 학습은 고차원적이고 연속적인 제어 과제에서 안전한 정책 최적화의 실현 가능성과 수렴 성능을 어떻게 향상시키는가?

주요 결과

  • 주행 유지 과제에서 PCPO는 CPO에 비해 35% 빠른 학습 속도를 기록했고, PPO에 비해 70% 이상 빠른 학습 속도를 확보하면서도 안전성을 유지하였다.
  • 교차로 통과 과제에서 PCPO는 약 800개의 학습 에포크 후 이론적 최적 수익 0에 수렴했으며, CPO는 1400개의 에포크 후에도 수익 -5에 머물렀다.
  • PCPO는 학습 전반에 걸쳐 예상 위험 값을 사전 정의된 안전 한계 이하로 유지했지만, PPO의 경우 위험 값이 30으로 상승하여 안전 기준치 5를 초과하였다.
  • PCPO와 CPO의 위험 곡선은 안전 기준에 가까이 안정화되며 단조로운 감소를 보였으며, 이는 일관된 안전 보장이 이루어졌음을 확인하였다.
  • PCPO는 PPO 및 CPO에 비해 더 높은 데이터 효율성과 더 적은 위험하거나 부분 최적의 정책에 갇힐 가능성을 보였다.
  • 두 과제 모두에서 PCPO는 안전성, 학습 속도, 수익 최적화 사이의 뛰어난 균형을 확보하여 실생활 자율 주행 응용 분야에서의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.