Skip to main content
QUICK REVIEW

[논문 리뷰] DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning

Archana Bura, Aria HasanzadeZonuzy|arXiv (Cornell University)|2021. 12. 01.
Adversarial Robustness in Machine Learning인용 수 9
한 줄 요약

이 논문은 동역학이 알려지지 않은 유한 시간 범위의 제약 마르코프 결정 과정(CMDP)을 위한 모델 기반 안전 강화 학습 알고리즘인 DOPE를 제안한다. 낙관적 보상 보너스와 비관적 제약 처리를 조합하고 안전 기반 정책을 활용하여, 학습 중에 안전 제약을 위반하지 않으면서 $\tilde{O}(|\mathcal{S}|\sqrt{|\mathcal{A}|K})$의 목적 함수 회귀를 달성한다. 이는 이전의 낙관-비관 기반 방법들보다 실증적으로 뛰어난 성능을 보인다.

ABSTRACT

Safe reinforcement learning is extremely challenging--not only must the agent explore an unknown environment, it must do so while ensuring no safety constraint violations. We formulate this safe reinforcement learning (RL) problem using the framework of a finite-horizon Constrained Markov Decision Process (CMDP) with an unknown transition probability function, where we model the safety requirements as constraints on the expected cumulative costs that must be satisfied during all episodes of learning. We propose a model-based safe RL algorithm that we call Doubly Optimistic and Pessimistic Exploration (DOPE), and show that it achieves an objective regret $ ilde{O}(|\mathcal{S}|\sqrt{|\mathcal{A}| K})$ without violating the safety constraints during learning, where $|\mathcal{S}|$ is the number of states, $|\mathcal{A}|$ is the number of actions, and $K$ is the number of learning episodes. Our key idea is to combine a reward bonus for exploration (optimism) with a conservative constraint (pessimism), in addition to the standard optimistic model-based exploration. DOPE is not only able to improve the objective regret bound, but also shows a significant empirical performance improvement as compared to earlier optimism-pessimism approaches.

연구 동기 및 목표

  • 학습 또는 배포 중에 안전 제약을 위반하지 않아야 하는 제약 마르코프 결정 과정을 위한 안전 탐색 알고리즘을 개발하는 것.
  • 모르는 환경에서 학습을 위한 탐색과 엄격한 안전 제약 준수 사이의 균형을 맞추는 과제를 해결하는 것.
  • 낮은 목적 함수 회귀를 달성하면서도 학습 단계 동안 제약 위반이 없도록 보장하는 것.
  • 모델 기반 낙관주의와 제약 비관주의, 안전 기반 정책을 융합하여 기존의 낙관-비관 접근법을 개선하는 것.
  • 기존 방법들이 높은 제약 위반 또는 열악한 회귀 성능을 겪는 데 반해, 알고리즘이 하위선형 회귀를 달성하고 안전성을 유지함을 실증적으로 검증하는 것.

제안 방법

  • 수집된 에피소드에서 전이 커널을 추정하기 위해 모델 기반 접근법을 사용하며, 경험 모델 주변의 신뢰 구간을 유지한다.
  • 낮은 샘플링 횟수를 가진 상태-행동 쌍을 탐색하도록 장려하기 위해 보상 함수에 보너스를 추가함으로써 보상에 대해 낙관주의를 적용한다.
  • 안전 제약 위반의 위험을 줄이기 위해 정책 선택을 보수적으로 만드는 제약 함수에 대해 비관주의를 적용한다.
  • 제약을 항상 만족시키는 것이 보장된 안전 기반 정책 $π_b$ 를 사용하며, 이는 임계값 $K_0$ 에 도달할 때까지 초기 단계에서 활용된다.
  • 각 에피소드 $k$ 에서는 낙관적 보상을 최대화하면서도 비관적 제약 범위를 준수하는 선형 계획법을 통해 정책을 계산한다.
  • 이러한 요소들을 통합하여, 높은 확률로 낮은 회귀와 제로 제약 위반을 보장하는 통합 프레임워크를 구성한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화 학습 알고리즘이 학습 중에 안전 제약을 위반하지 않으면서도 CMDP 환경에서 하위선형 목적 함수 회귀를 달성할 수 있는가?
  • RQ2보상에 대한 낙관주의와 제약에 대한 비관주의를 융합함으로써, 이전 방법들에 비해 회귀 성능과 안전성 향상이 어떻게 이루어지는가?
  • RQ3안전 기반 정책의 사용이 알고리즘의 수렴성과 회귀 행동에 어떤 영향을 미치는가?
  • RQ4OptPessLP 알고리즘이 이론적으로는 회귀 보장을 갖추고 있음에도 불구하고 실증적으로는 성능이 열악한 이유는 무엇이며, DOPE는 이 문제를 어떻게 극복할 수 있는가?
  • RQ5DOPE의 성능은 기반 정책 $π_b$ 의 선택에 얼마나 민감한가?

주요 결과

  • DOPE는 $\tilde{O}(|σ|\sqrt{|σ|× K})$의 목적 함수 회귀를 달성하며, 이는 이론적 한계와 정확히 일치하고, 학습 전반에 걸쳐 제로 제약 회귀를 유지한다.
  • 재고 제어 환경에서 DOPE의 목적 함수 회귀는 $K_0$ 에피소드 이후 선형에서 $\tilde{O}(σ\sqrt{K})$ 성장으로 전이되며, 이는 이론적 분석을 확인한다.
  • DOPE는 모든 제약 위반을 피했고, OptCMDP는 하위선형 제약 회귀를 겪었으며, 이는 학습 중에 위반 발생을 의미한다.
  • OptPessLP는 끊임없는 선형 회귀를 보이며 실증적 성능이 열악하여, 높은 비관주의가 탐색을 심각하게 저해함을 시사한다.
  • 기반 정책 $π_b$ 의 선택은 성능에 중간 정도의 영향을 미치지만, DOPE는 다양한 $π_b$ 설정에 대해 뛰어난 강건성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.