Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Autonomous Racing via Approximate Reachability on Ego-vision

Bingqing Chen, Jonathan Francis|arXiv (Cornell University)|2021. 10. 14.
Adversarial Robustness in Machine Learning참고 문헌 42인용 수 5
한 줄 요약

이 논문은 자율 레이싱을 위한 안전 강화학습 프레임워크인 SAGE를 제안한다. 이 프레임워크는 허밀토니안-자브리지 도달 가능성 이론을 활용하여 자동차의 카메라 시각과 속도에서 직접 안전성 값을 학습함으로써 저지연 안전성 검증을 가능하게 한다. 기존에 HJ 도달 가능성에 비해 고차원 시각 입력에서 실현 가능하지 않았던 신경망 근사 기반 안전성 비평가를 훈련시켜, Safety Gym 및 Learn-to-Race 벤치마크에서 제약 위반 수가 크게 줄어든 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Racing demands each vehicle to drive at its physical limits, when any safety infraction could lead to catastrophic failure. In this work, we study the problem of safe reinforcement learning (RL) for autonomous racing, using the vehicle's ego-camera view and speed as input. Given the nature of the task, autonomous agents need to be able to 1) identify and avoid unsafe scenarios under the complex vehicle dynamics, and 2) make sub-second decision in a fast-changing environment. To satisfy these criteria, we propose to incorporate Hamilton-Jacobi (HJ) reachability theory, a safety verification method for general non-linear systems, into the constrained Markov decision process (CMDP) framework. HJ reachability not only provides a control-theoretic approach to learn about safety, but also enables low-latency safety verification. Though HJ reachability is traditionally not scalable to high-dimensional systems, we demonstrate that with neural approximation, the HJ safety value can be learned directly on vision context -- the highest-dimensional problem studied via the method, to-date. We evaluate our method on several benchmark tasks, including Safety Gym and Learn-to-Race (L2R), a recently-released high-fidelity autonomous racing environment. Our approach has significantly fewer constraint violations in comparison to other constrained RL baselines in Safety Gym, and achieves the new state-of-the-art results on the L2R benchmark task. We provide additional visualization of agent behavior at the following anonymized paper website: https://sites.google.com/view/safeautonomousracing/home

연구 동기 및 목표

  • 서브초 단위의 결정과 물리적 한계 작동으로 인해 안전 위험이 증가하는 고속 자율 레이싱 문제를 해결한다.
  • 기존의 확장성 문제로 인해 스케일링에 실패하는 전통적 도달 가능성 방법이 실패하는 고차원 시각 관측 공간에서 실시간 안전성 검증을 가능하게 한다.
  • 허밀토니안-자브리지 도달 가능성 이론을 제약이 있는 마르코프 결정 과정(CMDP) 프레임워크에 통합하여 안전성과 성능 학습을 분리한다.
  • 자신의 카메라 RGB 입력과 차량 속도에서 직접 HJ 기반 안전성 값을 학습하는 안전성 비평가를 개발하여 전체 상태 추정이 필요 없도록 한다.
  • 정확한 동역학 모델에 의존하지 않고도 고정밀 레이싱 시뮬레이터에서 뛰어난 안전성과 높은 성능을 확보한다.

제안 방법

  • 허밀토니안-자브리지(HJ) 도달 가능성 이론을 사용하여 시간 간격 내에서 상태-행동 쌍이 안전한지 검증할 수 있는 안전성 값 함수 $ Q_S(x,u) $ 를 정의한다.
  • 자신의 카메라 RGB 이미지와 차량 속도에서 직접 HJ 안전성 값 함수를 신경망 기반 안전성 비평가로 근사함으로써 고차원 입력 처리를 가능하게 한다.
  • 학습 과정을 두 개의 독립된 정책으로 분해한다: 성능 정책은 속도와 주행 경로 최적화를 담당하고, 안전성 제어기는 $ Q_S(x,u) < \epsilon $ 인 경우에 개입한다.
  • 이론적 안전 보장을 확보하기 위해 오프-폴리시 경험을 사용하여 HJ 벨먼 업데이트 규칙을 적용하여 안전성 비평가를 학습한다.
  • 성능 및 안전성에 각각 별도의 최적화 기준을 사용하는 듀얼-비평가 액터-크리틱 아키텍처를 사용하며, 엔트로피 정규화와 타겟 네트워크를 통합한다.
  • 재플레이 버퍼와 오프-폴리시 데이터를 활용하여 훈련을 안정화시키며, 실시간 레이싱 환경에서 저지연 추론을 위해 하이퍼파라미터를 최적화한다.

실험 결과

연구 질문

  • RQ1허밀토니안-자브리지 도달 가능성 이론이 신경망 근사를 통해 고차원 시각 관측, 예를 들어 자가 카메라 RGB 이미지에 효과적으로 스케일링될 수 있는가?
  • RQ2기존의 표준 기준 대비 제약이 있는 강화학습 프레임워크에 HJ 도달 가능성 이론을 통합할 경우 고속 자율 레이싱에서 안전성과 성능이 향상되는가?
  • RQ3시각 입력만으로 훈련된 안전성 비평가가 명시적 상태 추정 없이 신뢰할 수 있고 저지연으로 안전성 검증을 수행할 수 있는가?
  • RQ4고정밀 레이싱 환경에서 제약 위반 수와 작업 완료율 측면에서 제안된 SAGE 프레임워크는 제约束 강화학습 기준 대비 어떻게 비교되는가?
  • RQ5안전성 마진 $ \epsilon $ 가 자율 레이싱에서 성능와 안전성의 상호 보완적 조건에 얼마나 큰 영향을 미치는가?

주요 결과

  • SAGE는 Learn-to-Race 벤치마크에서 새로운 최신 기술 수준을 달성하였으며, 에피소드 완료 비율(ECP), 평균 조정 주행 속도(AATS), 경로 효율성(TrE)을 포함한 모든 주행 품질 지표에서 이전의 모든 방법을 능가한다.
  • Safety Gym에서 SAGE는 다른 제约束 강화학습 기준 대비 훨씬 적은 제약 위반을 보이며, 뛰어난 안전성 강화 성능을 입증한다.
  • 자신의 시각 입력에서 훈련된 안전성 비평가가 실시간 레이싱에 적합한 지연으로 신뢰할 수 있는 안전성 검증을 수행하며, 서브초 단위의 결정을 가능하게 한다.
  • 이 방법은 고차원 시각 입력에서 직접 HJ 안전성 값을 학습하는 데 성공하였으며, 이는 현재까지 HJ 도달 가능성 이론이 적용된 가장 고차원의 시스템이다.
  • 안전성 마진 $ \epsilon = 3 $ 일 때 SAGE는 높은 ECP와 안정된 성능를 유지하는 반면, 동일한 마진에서 SafeSAC는 최소한의 향상만을 보이며, SAGE의 뛰어난 안전성 인식 정책 학습 능력을 시사한다.
  • SafeRandom 기준은 80% 이상의 랩 완료를 달성하기 위해 $ \epsilon = 4.2 $ 가 필요하다는 점을 보여주며, SAGE에서 선택된 $ \epsilon $ 가 뛰어난 안정성을 확보하고 있음을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.