Skip to main content
QUICK REVIEW

[논문 리뷰] Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage

Masatoshi Uehara, W. Sun|arXiv (Cornell University)|2021. 07. 13.
Advanced Bandit Algorithms Research참고 문헌 65인용 수 6
한 줄 요약

이 논문은 제약 조건을 통해 낙관주의를 강제함으로써 부분적 오프라인 데이터 커버리지 하에서 near-optimal 성능를 달성하는 모델기반 오프라인 강화학습 알고리즘인 제약 있는 낙관적 정책 최적화(CPPO)를 제안한다. 진짜 모델이 일반 함수 클래스에 속하고 비교 정책이 오프라인 데이터 분포에 포함되어 있을 경우, 다항 수준의 샘플 복잡도 보장을 제공한다.

ABSTRACT

We study model-based offline Reinforcement Learning with general function approximation without a full coverage assumption on the offline data distribution. We present an algorithm named Constrained Pessimistic Policy Optimization (CPPO)which leverages a general function class and uses a constraint over the model class to encode pessimism. Under the assumption that the ground truth model belongs to our function class (i.e., realizability in the function class), CPPO has a PAC guarantee with offline data only providing partial coverage, i.e., it can learn a policy that competes against any policy that is covered by the offline data. We then demonstrate that this algorithmic framework can be applied to many specialized Markov Decision Processes where additional structural assumptions can further refine the concept of partial coverage. Two notable examples are: (1) low-rank MDP with representation learning where the partial coverage condition is defined using a relative condition number measured by the unknown ground truth feature representation; (2) factored MDP where the partial coverage condition is defined using density ratio based concentrability coefficients associated with individual factors.

연구 동기 및 목표

  • 비탐색적 행동 정책이 존재하는 현실 세계 시나리오에서 적용 가능한 제약을 가진 오프라인 RL의 전형적 제한인 완전한 데이터 커버리지 요구 조건을 해결한다.
  • 이전의 오프라인 RL 방법에서 요구하는 강력한 벨먼 완전성과 완전한 커버리지 가정을 완화하여 부분적 커버리지가 있는 데이터셋에서도 학습이 가능하도록 한다.
  • 비마르코프 또는 이력 의존적인 정책이라도 오프라인 데이터 분포에 포함된 정책과 경쟁할 수 있는 일반적인 알고리즘 프레임워크를 개발한다.
  • 모델 기반 오프라인 RL에 대해 베이지안 버전을 확장하여 명시적인 낙관주의 또는 보상 페널티 없이 사후 분포 샘플링을 사용함으로써 낙관주의를 제거한다.
  • 진짜 모델이 일반 함수 클래스 내에 존재할 때 부분적 커버리지 하에서 다항 수준의 샘플 복잡도 보장을 이론적으로 제공한다.

제안 방법

  • 정책 업데이트가 낮은 데이터 커버리지의 행동을 피하도록 제약 조건을 도입하여 낙관주의를 강제하는 제약 최적화 프레임워크인 CPPO를 제안한다.
  • 모델에 일반 함수 클래스를 사용하고, 오프라인 데이터 분포에서 밀도가 낮은 행동에 대해 페널티를 주는 제약 조건을 적용한다.
  • 표현 학습을 통한 저질서 MDP에서 부분적 커버리지의 정의를 위해 특성 표현의 상대 조건 수치를 활용한다.
  • 베이지안 오프라인 RL을 위한 사후 샘플링 기반 알고리즘인 PS-PO를 도입하여, 반복적으로 사후 분포에서 모델을 샘플링하고 점진적 정책 최적화를 수행한다.
  • 기능 베르누이 부등식과 분포 이탈 레미마를 사용하여 부분적 커버리지 하에서 일반화 오차를 제어하는 이론적 경계를 수립한다.
  • 행렬 농도 부등식과 SVD 분해를 사용하여 비교 정책과 행동 정책 간의 상태-행동 분포 이탈 비율을 분석한다.

실험 결과

연구 질문

  • RQ1완전한 데이터 커버리지가 없더라도 오프라인 데이터 분포에 포함된 정책과 경쟁할 수 있는 정책을 학습할 수 있는가?
  • RQ2명시적인 보상 조정 없이 제약 조건을 통해 모델기반 오프라인 RL에서 낙관주의를 효과적으로 표현할 수 있는가?
  • RQ3알고리즘 프레임워크를 베이지안 오프라인 RL로 확장하여 명시적인 낙관주의 구성이 필요 없도록 할 수 있는가?
  • RQ4진짜 모델이 일반 함수 클래스 내에 존재할 때 부분적 커버리지 하에서 학습의 샘플 복잡도는 어떻게 되는가?
  • RQ5저질서 MDP와 같은 구조적 가정이 부분적 커버리지 개념을 어떻게 정교화하고 일반화 성능을 향상시키는가?

주요 결과

  • CPPO는 모델 실현 가능성과 부분적 커버리지 하에서, 오프라인 데이터에 포함된 비교 정책과 경쟁하는 정책을 학습하는 데 다항 수준의 샘플 복잡도를 달성한다.
  • 베이지안 설정에서 사전 분포에 대해 기대값 기준으로 near-optimal 성능를 보장하며, 명시적인 낙관주의나 보상 페널티가 필요로 하지 않는다.
  • 저질서 MDP의 경우, 부분적 커버리지는 알려지지 않은 진짜 특성 표현의 상대 조건 수치를 통해 정의되며, 더 날카운 일반화 경계를 가능하게 한다.
  • 이론적 분석에 따르면, 비교 정책과 행동 정책 간의 분포 이탈 비율은 특성 표현의 조건 수치에 의해 유계이며, 이는 안정성을 보장한다.
  • PS-PO에서 사후 샘플링을 사용함으로써 명시적인 낙관주의가 필요 없어지며, 선형 모델을 초월한 알고리즘 설계를 단순화한다.
  • 기능 베르누이 부등식과 분포 이탈 레미마를 사용하여 일반화 오차를 유계로 유지함으로써, 부분적 커버리지 하에서 수렴을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.