[논문 리뷰] Pessimistic Model-based Offline RL: PAC Bounds and Posterior Sampling under Partial Coverage
이 논문은 일반 함수 근사에서 부분 커버리지 하에서 샘플 효율적인 학습을 가능하게 하는 제약을 통한 낙관적 정책 최적화(CPPO)를 제안한다. 이는 일반 함수 클래스에서 편향성의 원칙을 제약 조건을 통해 강제함으로써, 선형 구조나 명시적 보상 페널티에 의존하지 않고 편향성을 구현한다. 또한, 명시적 편향성 없이 후행 분포 샘플링을 활용하는 PS-PO 방법을 도입하여, 부분 커버리지 하에서 기대값 기반 다항 수준의 샘플 복잡도를 확보한다.
We study model-based offline Reinforcement Learning with general function approximation. We present an algorithm named Constrained Pessimistic Policy Optimization (CPPO) which leverages a general function class and uses a constraint to encode pessimism. Under the assumption that the ground truth model belongs to our function class, CPPO can learn with the offline data only providing partial coverage, i.e., it can learn a policy that completes against any policy that is covered by the offline data, in polynomial sample complexity with respect to the statistical complexity of the function class. We then demonstrate that this algorithmic framework can be applied to many specialized Markov Decision Processes where the additional structural assumptions can further refine the concept of partial coverage. One notable example is low-rank MDP with representation learning where the partial coverage is defined using the concept of relative condition number measured by the underlying unknown ground truth feature representation. Finally, we introduce and study the Bayesian setting in offline RL. The key benefit of Bayesian offline RL is that algorithmically, we do not need to explicitly construct pessimism or reward penalty which could be hard beyond models with linear structures. We present a posterior sampling-based incremental policy optimization algorithm (PS-PO) which proceeds by iteratively sampling a model from the posterior distribution and performing one-step incremental policy optimization inside the sampled model. Theoretically, in expectation with respect to the prior distribution, PS-PO can learn a near optimal policy under partial coverage with polynomial sample complexity.
연구 동기 및 목표
- 일반 함수 근사를 사용하여 부분 커버리지 하에서 샘플 효율적인 학습을 보장하는 모델 기반 오프라인 강화학습 알고리즘을 개발하는 것.
- 선형 구조나 명시적 보상 페널티에 의존하지 않고, 함수 클래스 내에서 제약 조건을 통한 편향성의 수학적 정의를 제공하는 것.
- 표현 학습과 상대 조건수를 활용하여, 저랭크 MDP와 같은 특수한 MDP에 프레임워크를 확장하여 부분 커버리지의 정밀도를 높이는 것.
- 명시적 편향성 또는 페널티 항목이 없는 베이지안 오프라인 강화학습 프레임워크를 수립하는 것.
- 부분 커버리지 하에서 빈도주의 및 베이지안 변형에 대해 샘플 복잡도에 대한 이론적 보장을 제공하는 것.
제안 방법
- 모델 클래스의 신뢰 영역 내에서 정책 업데이트를 제약하는 제약 최적화 프레임워크인 CPPO를 제안한다.
- 환경 모델을 일반 함수 클래스로 표현하고, 부분 커버리지 하에서 편향성 계획을 보장하기 위해 제약 조건을 적용한다.
- 알 수 없는 특징 표현이 있는 저랭크 MDP에 적용할 때, 부분 커버리지를 상대 조건수로 정의한다.
- 후행 분포에서 모델을 반복적으로 샘플링하고, 그 안에서 한 스텝 정책 최적화를 수행하는 후행 분포 기반 알고리즘인 PS-PO를 도입한다.
- 베이지안 추론을 활용하여 편향성을 암묵적으로 표현함으로써, 명시적 보상 조정이나 페널티 항목을 회피한다.
- 사전 분포에 대해 기대값 기반으로 CPPO와 PS-PO의 다항 수준 샘플 복잡도 경계를 확립한다.
실험 결과
연구 질문
- RQ1일반 함수 근사를 사용하여 부분 커버리지 하에서 샘플 효율적인 학습을 달성할 수 있는가?
- RQ2명시적 보상 페널티 없이 비선형 함수 클래스에 효과적으로 편향성을 구현할 수 있는가?
- RQ3저랭크 MDP와 같은 구조적 가정(예: 저랭크 MDP)은 부분 커버리지의 개념을 어떻게 정교화하고 샘플 효율성을 향상시킬 수 있는가?
- RQ4베이지안 추론을 활용하여 명시적 편향성 또는 정규화 없이 오프라인 강화학습에서 편향성을 암묵적으로 강제할 수 있는가?
- RQ5빈도주의 및 베이지안 오프라인 강화학습에 대해 부분 커버리지 하에서 샘플 복잡도에 대한 이론적 보장은 무엇인가?
주요 결과
- CPPO는 진짜 모델이 함수 클래스 내에 있을 것이라는 가정 하에, 오프라인 데이터로 커버된 모든 정책과 경쟁 가능한 정책을 학습하는 데 다항 수준의 샘플 복잡도를 달성한다.
- 알 수 없는 특징 표현의 상대 조건수를 활용하여, 저랭크 MDP에 대해 프레임워크를 일반화함으로써 샘플 효율성을 향상시킬 수 있다.
- PS-PO는 명시적 편향성 또는 보상 페널티 없이 베이지안적 대안을 제공하며, 부분 커버리지 하에서 거의 최적의 성능을 달성한다.
- 이론적 분석을 통해 PS-PO는 사전 분포에 대해 기대값 기반으로 다항 수준의 샘플 복잡도로 거의 최적의 정책을 학습함을 보였다.
- CPPO와 PS-PO는 오프라인 데이터가 모든 상태-행동 쌍을 커버하지 않더라도 부분 커버리지 하에서 증명 가능한 샘플 효율성을 확보한다.
- 이 메서드론적 프레임워크는 일반 함수 근사를 지원하며, 선형 모델을 초월한 다양한 MDP 구조에 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.