Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Reinforcement Learning Using Robust Action Governor

Yutong Li, Nan Li|arXiv (Cornell University)|2021. 02. 21.
Reinforcement Learning in Robotics참고 문헌 19인용 수 9
한 줄 요약

이 논문은 모델 기반 제약 조건 강제를 통해 훈련 중 안전성을 보장하는 안전한 강화학습 프레임워크를 제안한다. 이 프레임워크는 어떤 RL 알고리즘과도 통합 가능한 강력한 동작 가드(Robust Action Governor, RAG)를 통합하여 실시간으로 제약 조건을 이행한다. 집합 이론 기반 기법과 최적화를 활용해 제어 신호를 온라인으로 수정함으로써 RAG는 제약 위반을 완전히 방지한다. 이는 100% 제약 조건 이행을 달성한 적응형 크루즈 컨트롤 시나리오에서 입증되었으며, 기존의 RL에 비해 더 빠르고 안정적인 학습을 가능하게 한다.

ABSTRACT

Reinforcement Learning (RL) is essentially a trial-and-error learning procedure which may cause unsafe behavior during the exploration-and-exploitation process. This hinders the application of RL to real-world control problems, especially to those for safety-critical systems. In this paper, we introduce a framework for safe RL that is based on integration of a RL algorithm with an add-on safety supervision module, called the Robust Action Governor (RAG), which exploits set-theoretic techniques and online optimization to manage safety-related requirements during learning. We illustrate this proposed safe RL framework through an application to automotive adaptive cruise control.

연구 동기 및 목표

  • 모델-프리 강화학습에서 탐색 과정에서 발생하는 본질적 위험, 특히 안전이 중요한 시스템에서의 위험을 해결하기 위해.
  • 시험-오차에 의존하지 않고 훈련 및 배포 중 제약 조건 이행을 보장하는 프레임워크를 개발하기 위해.
  • 어떤 상용 RL 알고리즘과도 통합할 수 있는 모델 기반 안전 감시자와의 융합을 통해 안전하고 고성능의 정책 학습을 가능하게 하기 위해.
  • 기존의 동작 가드 이론을 이산 시간 선형 시스템과 유계 외란, 비볼록 제약 조건을 다룰 수 있도록 확장하기 위해.
  • 실세계 자동차 제어 응용 분야인 적응형 크루즈 컨트롤에서 프레임워크의 효과성을 입증하기 위해.

제안 방법

  • 프레임워크는 명시적 RL 정책과 모델 기반 안전 감시자인 강력한 동작 가드(Robust Action Governor, RAG)를 통합한다.
  • RAG는 시스템 동역학과 제약 조건을 바탕으로 사전에 안전 영역과 비안전 영역을 집합 이론 기법을 사용해 계산한다.
  • 각 시간 단계에서 RAG는 RL 정책 출력을 최소한으로 수정하여 상태의 실현 가능성을 확보하기 위해 온라인으로 혼합정수 quadratic programming(MIQP) 문제를 해결한다.
  • 이 방법은 이산 시간 시스템을 직접 대상으로 설정되어 있어 연속 시간 장벽 함수 접근 방식에서 흔히 발생하는 이산화 오차를 피한다.
  • RAG는 제어기 출력에 작용하므로, 더 높은 수준의 안정된 제어기 필요 없이 하위 제어 루프에 적용할 수 있다. 반면 참조 가드(Reference Governor)는 안정된 고수준 제어기가 필요하다.
  • 안전 영역은 사전에 MPT3 툴박스를 사용해 계산되며, 온라인 최적화는 OPTI를 통해 SCIP를 사용해 실시간으로 해결된다.

실험 결과

연구 질문

  • RQ1모델 기반 안전 감시자와 모델-프리 RL 알고리즘을 효과적으로 통합하여 탐색 중 안전성을 확보할 수 있는가?
  • RQ2RAG 기반 프레임워크는 기존의 RL에 비해 훈련 중 제약 위반 비율에서 어떤 차이를 보이는가?
  • RQ3온라인 RAG 최적화의 계산 오버헤드는 얼마이며, 실시간 제어 응용에 실현 가능한가?
  • RQ4비볼록이고 유계 외란 환경에서 RAG 프레임워크는 성능 유지를 유지하면서도 안전성을 보장할 수 있는가?
  • RQ5RAG는 탐색 영역을 안전하고 잘 정의된 영역로 제한함으로써 더 빠르고 안정적인 학습을 가능하게 하는가?

주요 결과

  • RAG를 통한 안전한 강화학습 프레임워크는 전체 훈련 과정 동안 제약 위반 수가 0이었으며, 기존의 RL은 초기 단계에 높은 위반 비율을 보였다.
  • RAG 최적화 문제를 해결하는 데 평균적으로 약 30 ms의 온라인 계산 시간이 소요되어 실시간 제어에 실현 가능함을 확인했다.
  • 에피소드당 평균 훈련 시간은 약 130초였으며, 온라인 최적화로 인해 기존의 RL보다 더 길지만 시뮬레이션 기반 학습에 있어서는 여전히 타당한 수준이었다.
  • 안전한 강화학습 정책는 기존의 RL에 비해 더 빠른 수렴과 낮은 보상 분산을 달성했으며, 20회의 실험에서 평균 보상의 표준편차가 감소한 것으로 나타났다.
  • RAG는 차간 거리(헤드웨이 타임)를 항상 [1, 2]초의 안전 범위 내에서 유지하여 일관되고 안전한 차량 추종 행동을 보장했다.
  • 검증 결과, RAG가 제어 입력을 효과적으로 모니터링하고 수정하여 동적인 주행 조건에서도 안전하지 않은 상대 거리를 방지하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.