Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Reward-free Approach to Constrained Reinforcement Learning

Sobhan Miryoosefi, Chi Jin|arXiv (Cornell University)|2021. 07. 12.
Reinforcement Learning in Robotics참고 문헌 37인용 수 5
한 줄 요약

이 논문은 보상이 없는 강화학습(RL) 오라클을 활용하여 제약 조건이 있는 RL 문제를 최소한의 추가 샘플 복잡도로 해결하는 메타알고리즘을 제안한다. 동역학 학습과 제약 조건 처리를 분리함으로써, 표본 복잡도에서 테이블형 MDP와 선형 MDP에서 최신 기술을 달성하며, 이전 최고 성능 결과와 수준까지 동일한 결과를 내며, 일반적인 볼록 제약 조건이 있는 선형 MDP 환경에서 최초로 샘플 효율적인 해결책을 제공한다.

ABSTRACT

In constrained reinforcement learning (RL), a learning agent seeks to not only optimize the overall reward but also satisfy the additional safety, diversity, or budget constraints. Consequently, existing constrained RL solutions require several new algorithmic ingredients that are notably different from standard RL. On the other hand, reward-free RL is independently developed in the unconstrained literature, which learns the transition dynamics without using the reward information, and thus naturally capable of addressing RL with multiple objectives under the common dynamics. This paper bridges reward-free RL and constrained RL. Particularly, we propose a simple meta-algorithm such that given any reward-free RL oracle, the approachability and constrained RL problems can be directly solved with negligible overheads in sample complexity. Utilizing the existing reward-free RL solvers, our framework provides sharp sample complexity results for constrained RL in the tabular MDP setting, matching the best existing results up to a factor of horizon dependence; our framework directly extends to a setting of tabular two-player Markov games, and gives a new result for constrained RL with linear function approximation.

연구 동기 및 목표

  • 보상이 없는 RL과 제약 조건이 있는 RL을 연결하기 위해 제약 조건 이행을 동역학 학습에서 분리한다.
  • 모든 보상이 없는 RL 오라클을 사용하여 접근 가능성 및 제약 조건이 있는 MDP 문제를 근사적으로 해결할 수 있는 메타알고리즘을 개발한다. 이때 샘플 오버헤드가 극히 미미하다.
  • 테이블형 및 선형 MDP에서 제약 조건이 있는 RL의 날카운 샘플 복잡도 경계를 확보하며, 기존 결과를 근사하거나 초월한다.
  • 두 명의 플레이어가 참여하는 마르코프 게임에 프레임워크를 확장하고, 낮은 손실 보장(레지레트 보장)을 제공한다.

제안 방법

  • 메타알고리즘은 보상 없이 동작하는 RL 오라클을 사용하여 사전에 트레이젝터리를 수집하고, 보상 지도 없이 MDP의 동역학을 학습한다.
  • 그 후 제약 조건 이행 문제를 별도의 최적화 문제로 설정함으로써, 가치 함수 학습과 분리한다.
  • 이 접근법은 제약 조건을 경험 모델 기반의 파라미터화된 정책 최적화를 통해 강제로 구현하는 이중 최적화 프레임워크를 활용한다.
  • Q-값 및 V-값 함수에 대한 신뢰구간을 사용하여 불확실성 경계를 도입하고, 이를 재귀적 불확실성 전파 메커니즘으로 제어한다.
  • 경험 모델의 추정 오차에 대한 강건성을 확보하기 위해 정책 파라미터에 대해 최소-최대 전략을 사용한다.
  • 고확률 사건에서의 추정 오차를 제한하기 위해 허프딩 유형의 농도 부등식을 적용하여 일반화를 보장한다.

실험 결과

연구 질문

  • RQ1보상이 없는 RL이 추가 샘플 비용을 최소화하면서 제약 조건이 있는 RL 문제를 해결하는 데 기초 자원으로 사용될 수 있는가?
  • RQ2제약 조건이 있는 MDP에서 제약 조건 이행을 동역학 학습과 가치 함수 최적화에서 분리할 수 있는가?
  • RQ3이 메타알고리즘을 사용하여 테이블형 및 선형 MDP에서 제약 조건이 있는 RL의 샘플 복잡도 경계는 어떤 수준에 도달할 수 있는가?
  • RQ4이 프레임워크는 벡터 값 제약 조건이 있는 두 명의 플레이어가 참여하는 마르코프 게임으로 확장될 수 있으며, 여전히 낮은 손실 보장을 달성할 수 있는가?
  • RQ5제안된 접근 방식에서 수명 주기 의존성은 최종 샘플 복잡도에 어떤 영향을 미치는가?

주요 결과

  • 테이블형 MDP에서는 보상가 없는 RL, 접근 가능성, 제약 조건이 있는 MDP의 세 가지 작업 모두에서 샘플 복잡도 $\tilde{\mathcal{O}}(\min\{d,S\}H^{4}SA/\epsilon^{2})$ 를 달성한다.
  • 선형 MDP에서는 세 가지 작업 모두에 대해 $\tilde{\mathcal{O}}(d_{\text{lin}}^{3}H^{6}/\epsilon^{2})$ 의 샘플 복잡도로 최초로 샘플 효율적인 결과를 제공한다.
  • 이 방법은 수명 주기 의존성에 따라 $H$의 요소가 포함된 인과로 이전 최고 성능 결과와 근사한다.
  • 두 명의 플레이어가 참여하는 마르코프 게임 환경에서는 $\alpha(T) = \mathcal{O}(\epsilon/2 + \sqrt{H^{2}\iota/T})$ 의 손실 경계를 달성하며, $\mathcal{O}(\epsilon)$ 의 편향이 존재한다.
  • 이 프레임워크는 보상가 없는 RL 분야의 진전을 제약 조건이 있는 RL로 직접 번역할 수 있게 하여 알고리즘 재설계의 필요성을 줄인다.
  • 농도 부등식과 재귀적 불확실성 경계를 사용하여 고확률로 이론적 보장을 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.