[논문 리뷰] Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity
이 논문은 분포로 부터의 강건성과 데이터 기반의 경솔성 페널티를 조합한 강건한 가치 반복 기반의 오프라인 강화학습 알고리즘을 제안한다. 이 알고리즘은 유사한 표본 복잡도를 달성하며, 약간의 분포 이탈 가정 하에 유한 표본 성능 보장을 수립하고, (효율적) 수명 길이의 다항 인자 수준까지 경계의 날카로움을 증명한다.
This paper concerns the central issues of model robustness and sample efficiency in offline reinforcement learning (RL), which aims to learn to perform decision making from history data without active exploration. Due to uncertainties and variabilities of the environment, it is critical to learn a robust policy -- with as few samples as possible -- that performs well even when the deployed environment deviates from the nominal one used to collect the history dataset. We consider a distributionally robust formulation of offline RL, focusing on tabular robust Markov decision processes with an uncertainty set specified by the Kullback-Leibler divergence in both finite-horizon and infinite-horizon settings. To combat with sample scarcity, a model-based algorithm that combines distributionally robust value iteration with the principle of pessimism in the face of uncertainty is proposed, by penalizing the robust value estimates with a carefully designed data-driven penalty term. Under a mild and tailored assumption of the history dataset that measures distribution shift without requiring full coverage of the state-action space, we establish the finite-sample complexity of the proposed algorithms. We further develop an information-theoretic lower bound, which suggests that learning RMDPs is at least as hard as the standard MDPs when the uncertainty level is sufficient small, and corroborates the tightness of our upper bound up to polynomial factors of the (effective) horizon length for a range of uncertainty levels. To the best our knowledge, this provides the first provably near-optimal robust offline RL algorithm that learns under model uncertainty and partial coverage.
연구 동기 및 목표
- 모델 불확실성과 제한된 데이터 하에서 강건한 정책 학습의 과제를 해결한다.
- 완전한 상태-행동 공간 커버리지가 필요 없이 분포 이탈과 부분 커버리지 문제를 해결한다.
- 유한 수명 길이 및 무한 수명 길이 설정 모두에서 near-optimal 표본 복잡도를 달성한다.
- KL 발산 불확실성 집합을 가진 분포로 부터의 강건한 MDP에서 성능에 대한 이론적 보장을 제공한다.
- 정보 이론적으로 최적인 다항 인자 수준까지 날카로운 유한 표본 경계를 수립한다.
제안 방법
- 경험 전이 모델 주변의 KL 발산 기반 불확실성 집합을 사용하여 분포로 부터의 강건한 MDP(RMDP)를 수립한다.
- 불확실성을 다루기 위해 데이터 기반 페널티 항을 포함한 강건한 가치 반복의 경솔성 변형인 DRVI-LCB를 제안한다.
- 오프라인 데이터로부터의 경험적 명시적 MDP를 구성하여 분포 이탈에 대한 강건성을 확보한다.
- 상태-행동 방문 빈도의 역수 비례로 조정되는 새로운 데이터 기반 페널티 항을 도입하여 경솔성을 강화한다.
- 집중 불등식과 KL 발산 성질을 사용하여 정책의 강건한 가치 함수에 대한 유한 표본 경계를 유도한다.
- 정보 이론적 하한을 증명하여 상한 경계의 날카로움이 (효율적) 수명 길이의 다항 인자 수준까지 정보 이론적으로 최적임을 확인한다.
실험 결과
연구 질문
- RQ1분포 이탈에 강건하고 표본 효율적인 모델 기반 오프라인 강화학습 알고리즘을 설계할 수 있는가?
- RQ2데이터 부족 상황에서 데이터 기반의 경솔성을 분포로 부터의 강건한 가치 반복에 효과적으로 통합할 수 있는가?
- RQ3부분 커버리지가 있는 오프라인 강화학습에서 강건한 정책 학습의 기본 표본 복잡도 한계는 무엇인가?
- RQ4제안된 알고리즘의 표본 복잡도는 near-optimal한가? 정보 이론적 하한과 비교해보면 어떻게 되는가?
- RQ5어떤 데이터 가정 하에 알고리즘이 유한 표본 성능 보장을 달성하는가?
주요 결과
- 제안된 DRVI-LCB 알고리즘은 완전한 커버리지가 필요 없이도 역사 데이터 세트의 분포 이탈 정도를 측정하는 약한 가정 하에 유한 표본 성능 보장을 달성한다.
- 알고리즘의 표본 복잡도는 near-optimal이며, 상한 경계가 (효율적) 수명 길이의 다항 인자 수준까지 정보 이론적 하한과 일치한다.
- 정보 이론적 하한은 불확실성 수준이 작을 경우 RMDP 학습이 표준 MDP 학습만큼 어렵다는 것을 보여주며, 상한 경계의 날카로움을 확인한다.
- 데이터 기반 페널티 항은 효과적으로 경솔성을 강화하여, 불확실성 집합에 대한 사전 지식이 없이도 저자원 환경에서의 강건성을 향상시킨다.
- 이론적 분석은 행동 정책가 상태-행동 공간을 완전히 커버하지 않더라도 알고리즘이 여전히 효과적임을 확인한다.
- 결과는 유한 수명 길이 및 무한 수명 길이 설정 모두에 대해 유효하여 광범위한 적용 가능성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.