Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Safety Constraints: Sample Complexity of Reinforcement Learning for Constrained MDPs

Aria HasanzadeZonuzy, Archana Bura|arXiv (Cornell University)|2020. 08. 01.
Reinforcement Learning in Robotics인용 수 11
한 줄 요약

이 논문은 동역학이 알려지지 않은 제약付き 마르코프 결정 과정(CMDP)에 대해 모델 기반 강화학습 알고리즘을 제안하며, 생성형 및 온라인 학습 접근 방식을 사용하여 안전성과 최적성을 보장한다. 이는 표본 복잡도가 제약 수에 대해 로그적으로만 증가함을 입증하여, 많은 안전 제약을 가진 실세계 사이버-물리 시스템에 대해 제약 강화학습을 실용적으로 가능하게 한다.

ABSTRACT

Many physical systems have underlying safety considerations that require that the policy employed ensures the satisfaction of a set of constraints. The analytical formulation usually takes the form of a Constrained Markov Decision Process (CMDP). We focus on the case where the CMDP is unknown, and RL algorithms obtain samples to discover the model and compute an optimal constrained policy. Our goal is to characterize the relationship between safety constraints and the number of samples needed to ensure a desired level of accuracy -- both objective maximization and constraint satisfaction -- in a PAC sense. We explore two classes of RL algorithms, namely, (i) a generative model based approach, wherein samples are taken initially to estimate a model, and (ii) an online approach, wherein the model is updated as samples are obtained. Our main finding is that compared to the best known bounds of the unconstrained regime, the sample complexity of constrained RL algorithms are increased by a factor that is logarithmic in the number of constraints, which suggests that the approach may be easily utilized in real systems.

연구 동기 및 목표

  • 모델 불확실성 하에서 제약 강화학습 알고리즘을 개발하여 목적 함수 최대화와 제약 충족을 동시에 보장한다.
  • 확률적으로 근사적으로 정확한(PAC) 학습 프레임워크 내에서 안전성 제약과 표본 복잡도 간의 트레이드오프를 정량화한다.
  • 제한된 상호작용으로 정확한 모델을 학습하면서도 탐색성과 실현 가능성을 유지하는 알고리즘을 설계한다.
  • 성능 및 제약 준수 수준을 원하는 정확도에 도달하기 위해 필요한 표본 수에 대한 이론적 경계를 제공한다.
  • 특히 대규모 사이버-물리 시스템에서 제약 수가 학습의 어려움을 크게 증가시키는지 평가한다.

제안 방법

  • 초기 표본을 수집하여 MDP 모델을 추정한 후 선형 프로그래밍(LP)을 통해 CMDP를 해결하는 생성형 모델 기반 접근 방식을 제안한다.
  • 신규 데이터가 도착함에 따라 모델과 정책을 점진적으로 업데이트하는 온라인 학습 변형을 도입하며, 추정치 주변의 신뢰 구역을 통해 실현 가능성을 유지한다.
  • 모델 추정치 주변의 신뢰 구역을 사용하여 추정 모델이 정확하지 않더라도 실현 가능한 해가 존재하도록 보장한다.
  • 표준 LP 공식을 확장하여 전체 모델의 신뢰 구역을 탐색함으로써 정책 선택에서 낙관성과 실현 가능성을 보장한다.
  • 표본 수가 원하는 정확도에 도달하기 위해 필요한 양을 제한하기 위해 PAC 스타일 분석을 사용한다.
  • 집중 불등식과 상태-행동 쌍, 제약 항목에 대한 오차 전파 분석을 조합하여 표본 복잡도 경계를 유도한다.

실험 결과

연구 질문

  • RQ1다수의 안전 제약이 존재할 경우, 제약이 없는 MDP와 비교해 CMDP에서의 학습 표본 복잡도는 어떻게 영향을 받는가?
  • RQ2CMDP에 대한 모델 기반 강화학습 알고리즘은 학습 도중 제약 위반을 최소화하면서도 실현 가능성과 낙관성을 유지할 수 있는가?
  • RQ3PAC 학습 프레임워크 내에서 표본 복잡도는 제약 수와 상태 공간 크기와 어떻게 스케일링되는가?
  • RQ4생성형 및 온라인 학습 접근 방식은 표본 효율성과 제약 준수 보장 측면에서 어떻게 비교되는가?
  • RQ5제약으로 인한 표본 복잡도 증가는 금지 수준까지 크지 않으며, 제약 수에 대해 유리하게(예: 로그적으로) 스케일링되는가?

주요 결과

  • 제약 강화학습의 표본 복잡도는 제约束 없는 강화학습에 비해 제약 수에 대해 로그 인자만큼 증가함을 확인하여 관리 가능한 오버헤드임을 시사한다.
  • 제안된 알고리즘은 학습된 정책이 높은 확률로 근사 최적의 목적 함수 값을 달성하고 모든 제약을 충족함을 보장한다.
  • 생성형 및 온라인 접근 모두 표본 복잡도가 |S|H²/ε²에 비례하며 제약 수와 상태 공간에 대한 로그 항을 포함하는 PAC 경계를 달성한다.
  • 부적절한 에피소드 수는 O(|S|²|A|H²/ε²)에 로그 항을 곱한 값으로 경계되며, 유한한 에피소드 수 내에 수렴함을 보장한다.
  • 제약 수에 대한 로그 의존성은 많은 안전 제약이 존재할 경우에도 방법이 실용적임을 시사한다.
  • 집중 불등식과 상태-행동 쌍, 제약 색인에 대한 유니온 바운드를 통한 이론적 경계는 불확실성 하에서도 강건함을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.