[논문 리뷰] Offline Reinforcement Learning with Realizability and Single-policy Concentrability
이 논문은 최적 가치 함수의 실현 가능성과 단일 정책 집중성이라는 두 가지 가정만을 요구하면서도 다항 시간 샘플 복잡도를 달성하는 모델 프리 오프라인 강화 학습 알고리즘을 제안한다. 이는 이전 연구에 비해 훨씬 더 약한 가정 조건이다. 보정된 이중 최적화 및 밀도 비율 모델링을 통해, 모든 정책 집중성 또는 벨만 완전성 조건을 요구하지 않으면서도 안정적인 학습을 보장한다.
Sample-efficiency guarantees for offline reinforcement learning (RL) often rely on strong assumptions on both the function classes (e.g., Bellman-completeness) and the data coverage (e.g., all-policy concentrability). Despite the recent efforts on relaxing these assumptions, existing works are only able to relax one of the two factors, leaving the strong assumption on the other factor intact. As an important open problem, can we achieve sample-efficient offline RL with weak assumptions on both factors? In this paper we answer the question in the positive. We analyze a simple algorithm based on the primal-dual formulation of MDPs, where the dual variables (discounted occupancy) are modeled using a density-ratio function against offline data. With proper regularization, we show that the algorithm enjoys polynomial sample complexity, under only realizability and single-policy concentrability. We also provide alternative analyses based on different assumptions to shed light on the nature of primal-dual algorithms for offline RL.
연구 동기 및 목표
- 데이터 커버리지와 함수 근사에 대해 약한 가정 조건 하에서도 샘플 효율적인 오프라인 강화 학습을 달성하는 데 있어 열려 있는 문제를 해결한다.
- 대부분의 이전 샘플 효율성 보장에 기반한 강력한 가정 조건인 모든 정책 집중성과 벨만 완전성 조건을 완화한다.
- 현실적이고 실용적인 가정 조건 하에서도 안정성과 성능을 유지하는 모델 프리 알고리즘을 개발한다.
- 실현 가능성과 단일 정책 집중성 조건 하에서 정규화된 이중 최적화 프레임워크와 밀도 비율 모델링을 사용한 이론적 보장을 제공한다.
제안 방법
- MDP의 선형계획형 표현을 사용하여 오프라인 강화 학습 문제를 이중 최적화 문제로 공식화한다.
- 이중 변수(할인된 점유도)를 오프라인 데이터 분포에 대한 밀도 비율 함수로 모델링한다.
- 이중 최적화에서 강한 볼록성과 안정성을 보장하기 위해 정규화된 목적 함수를 도입한다.
- 일반화 오차를 경험 손실 함수와 진짜 손실 함수 간의 차이로 유한하게 제한하기 위해 농도 불등식을 사용한다.
- 강한 볼록성과 노름 제어를 통해 정책 근사 및 가치 함수의 오차 한계를 설정한다.
- 실현 가능성과 단일 정책 집중성 조건 하에서 경험적 해가 정규화된 최적 정책과 어떻게 연결되는지 보여주는 일반화 한계를 유도한다.
실험 결과
연구 질문
- RQ1모든 정책 집중성 또는 벨만 완전성 조건 없이도 실현 가능성과 단일 정책 집중성 조건만으로 샘플 효율적인 오프라인 강화 학습을 달성할 수 있는가?
- RQ2밀도 비율 모델링을 통한 이중 최적화 공식화가 약한 데이터 커버리지 조건 하에서도 안정적인 학습을 어떻게 가능하게 하는가?
- RQ3강력한 함수 클래스 가정이 없을 경우 정규화가 수렴성과 일반화를 보장하는 데 어떤 역할을 하는가?
- RQ4약한 가정 조건 하에서 근사 오차와 최적화 오차는 알고리즘 성능에 어떻게 영향을 미치는가?
- RQ5최적 정책이 데이터에 포함되어 있지 않은 경우, 알고리즘이 오프라인 데이터에서 지원하는 정책 중 최고의 정책과 경쟁할 수 있는가?
주요 결과
- 제안된 알고리즘은 최적 가치 함수의 실현 가능성과 단일 정책 집중성 조건만을 요구하면서도 다항 샘플 복잡도를 달성한다.
- 이 방법은 통계 오차 항 $\epsilon_{\text{stat}}$ 에 비례하는 일반화 한계를 제공한다. 이 항은 오프라인 샘플 수와 함수 클래스 용량에 의존한다.
- 정책 근사 오차는 $\|\widehat{w} - w^*_{\alpha}\|_{2,d^D} \leq \sqrt{\frac{4\epsilon_{\text{stat}}}{\alpha M_f}}$ 로 유한하게 제한되며, 이는 정규화된 최적 정책로의 수렴을 보장한다.
- 부적합성 갭 $J(\pi^*_{\alpha}) - J(\widehat{\pi})$ 는 $\frac{1}{1-\gamma} \mathbb{E}_{s \sim d^*_{\alpha}}[\|\pi^*_{\alpha}(s,\cdot) - \widehat{\pi}(s,\cdot)\|_1]$ 로 유한하게 제한되며, 이는 정책 오차와 분포 이탈 간의 연결 고리를 제공한다.
- 근사 오차와 최적화 오차가 존재하는 경우에도 분석이 확장되어 현실 조건 하에서도 강건함을 보인다.
- 최적 정책이 데이터에 포함되어 있지 않더라도, 알고리즘은 데이터에서 지원하는 정책 중 최고의 정책과 경쟁 가능한 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.