Skip to main content
QUICK REVIEW

[논문 리뷰] Safety-Guided Deep Reinforcement Learning via Online Gaussian Process Estimation

Jiameng Fan, Wenchao Li|arXiv (Cornell University)|2019. 03. 06.
Gaussian Processes and Bayesian Inference참고 문헌 31인용 수 16
한 줄 요약

이 논문은 궤도 기반 안전 비용을 리아푸노프 함수 후보로 모델링하기 위해 온라인 가우시안 프로세스(GP) 추정을 사용하는 안전 지향 딥 강화학습 프레임워크를 제안한다. 이는 탐색 중 증명 가능한 안정성과 참사 감소를 가능하게 한다. 이 방법은 기존 DDPG에 비해 훈련을 크게 가속화하고 안전하지 않은 행동을 줄이며, 하프체티 테스크에서 50,000단계 만에 베이스라인 성능을 달성하는 데 성공했다. DDPG는 이와 같은 성능을 달성하기 위해 700,000단계가 필요하다.

ABSTRACT

An important facet of reinforcement learning (RL) has to do with how the agent goes about exploring the environment. Traditional exploration strategies typically focus on efficiency and ignore safety. However, for practical applications, ensuring safety of the agent during exploration is crucial since performing an unsafe action or reaching an unsafe state could result in irreversible damage to the agent. The main challenge of safe exploration is that characterizing the unsafe states and actions is difficult for large continuous state or action spaces and unknown environments. In this paper, we propose a novel approach to incorporate estimations of safety to guide exploration and policy search in deep reinforcement learning. By using a cost function to capture trajectory-based safety, our key idea is to formulate the state-action value function of this safety cost as a candidate Lyapunov function and extend control-theoretic results to approximate its derivative using online Gaussian Process (GP) estimation. We show how to use these statistical models to guide the agent in unknown environments to obtain high-performance control policies with provable stability certificates.

연구 동기 및 목표

  • 안전하지 않은 행동이 영구적인 손상을 초래할 수 있는 연속적이고 고차원적인 상태 및 행동 공간에서의 안전 탐색 문제를 해결하기 위해.
  • 알 수 없는 환경에서 높은 확률로 궤도 기반 안전 보장을 제공하는 모델리스 강화학습 알고리즘을 개발하기 위해.
  • 온라인 가우시안 프로세스를 사용하여 누적 안전 비용을 리아푸노프 함수 후보로 모델링함으로써 정책 최적화에 안전성을 통합하기 위해.
  • 표준 오프-폴리시 DRL 방법(예: DDPG)에 비해 샘플 효율성을 향상시키고 훈련 중 참사 수를 줄이기 위해.

제안 방법

  • 안정성 인증을 가능하게 하기 위해 안전 비용의 상태-행동 가치 함수를 후보 리아푸노프 함수로 설정한다.
  • 안전 비용 가치 함수의 도함수를 추정하기 위해 온라인 가우시안 프로세스 회귀를 사용하며, 통계적 불확도 구간을 제공한다.
  • 훈련 중에 수집된 신규 궤도 데이터(상태, 행동, 다음 상태, 보상, 안전 비용)를 반복적으로 이용해 GP 모델을 업데이트한다.
  • 기대 수익을 최대화하면서 추정된 누적 안전 비용을 최소화하는 복합 목표를 사용해 정책을 최적화한다.
  • GP 모델의 신뢰구간을 정책 업데이트에 통합하여 안전한 탐색을 우선시한다.
  • 효율성을 위해 2,000개의 샘플로 제한된 고정된 초기 안전 궤도를 사용해 GP 모델을 부트스트랩한다.

실험 결과

연구 질문

  • RQ1통계적 함수 근사 방법을 사용해 궤도 기반 안전성을 효과적으로 모델링하고 딥 RL에 통합할 수 있는가?
  • RQ2온라인 GP 추정은 알 수 없는 환경에서 정책 학습 중 안전성과 안정성을 어떻게 향상시킬 수 있는가?
  • RQ3안전 비용 가치 함수에서 유도된 리아푸노프 함수를 사용하면 증명 가능한 안정성과 안전성을 가진 정책를 도출할 수 있는가?
  • RQ4시간이 지남에 따라 안전성과 성능을 유지하는 데 있어 온라인 GP 적응은 고정된 GP 모델에 비해 어떻게 성능이 뛰어나게 되는가?
  • RQ5이 방법은 복잡한 운동 제어 과제에서 훈련 중 참사 수를 줄이고 수렴 속도를 가속화할 수 있는가?

주요 결과

  • 제안된 방법은 하프체티 과제에서 기존 DDPG가 필요로 하는 700,000단계 대비 약 50,000단계 만에 베이스라인 성능을 달성했다.
  • 온라인 GP를 사용한 안전 지향 DDPG에서는 학습 중 참사(예: 넘어짐)가 전혀 발생하지 않았지만, 기존 DDPG는 그렇지 않았다.
  • 온라인 GP 적응은 고정된 GP 모델에 비해 뚜렷이 뛰어난 성능을 보였으며, 훈련이 진행됨에 따라 고정 GP 변종에서는 성능 저하가 관찰되었다.
  • 기존 DDPG에 비해 동일한 월 타임 동안 더 높은 누적 수익과 더 낮은 안전 비용을 달성했다.
  • 초기 안전 궤도의 사용은 초기 GP 추정의 신뢰성을 향상시키며, 학습 시작 단계부터 안정적인 학습에 기여했다.
  • 정책 최적화 과정에서 GP 모델의 통계적 불확도를 활용함으로써 고확률 안정성 증명서를 제공할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.