Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Based Offline Reinforcement Learning with Pessimism-Modulated Dynamics Belief

Kaiyang Guo, Yunfeng Shao|arXiv (Cornell University)|2022. 10. 13.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 모델 기반 오프라인 강화 학습 방법인 Pessimism-Modulated Dynamics Belief (PMDB)을 제안한다. 이 방법은 동역학에 대한 믿음 분포를 유지하고 정책 최적화를 위해 편향된 샘플링을 사용한다. 오프라인 RL을 교차 마르코프 게임으로 공식화함으로써, 정책의 페시즘에 기반해 동역학 믿음의 재가중치를 동적으로 조정하여, 보상에 대한 명시적 불확실성 페널티 없이도 D4RL 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Model-based offline reinforcement learning (RL) aims to find highly rewarding policy, by leveraging a previously collected static dataset and a dynamics model. While the dynamics model learned through reuse of the static dataset, its generalization ability hopefully promotes policy learning if properly utilized. To that end, several works propose to quantify the uncertainty of predicted dynamics, and explicitly apply it to penalize reward. However, as the dynamics and the reward are intrinsically different factors in context of MDP, characterizing the impact of dynamics uncertainty through reward penalty may incur unexpected tradeoff between model utilization and risk avoidance. In this work, we instead maintain a belief distribution over dynamics, and evaluate/optimize policy through biased sampling from the belief. The sampling procedure, biased towards pessimism, is derived based on an alternating Markov game formulation of offline RL. We formally show that the biased sampling naturally induces an updated dynamics belief with policy-dependent reweighting factor, termed Pessimism-Modulated Dynamics Belief. To improve policy, we devise an iterative regularized policy optimization algorithm for the game, with guarantee of monotonous improvement under certain condition. To make practical, we further devise an offline RL algorithm to approximately find the solution. Empirical results show that the proposed approach achieves state-of-the-art performance on a wide range of benchmark tasks.

연구 동기 및 목표

  • 정적 데이터셋을 초월한 동역학 일반화를 향상시켜 오프라인 강화 학습에서 분포 이탈 문제를 해결하기 위해.
  • 모델 기반 오프라인 RL에서 보상 기반 불확실성 페널티의 한계를 극복하여 과도한 보수성으로 이어질 수 있는 문제를 해결하기 위해.
  • 명시적인 Q-값 또는 보상 페널티에 의존하지 않고 동역학 불확실성을 정책 학습에 통합하는 원칙적인 방법을 개발하기 위해.
  • 정책에 의존하는 재가중치를 통해 자연스럽게 페시즘 행동을 유도하는 믿음 기반 정책 최적화 프레임워크를 체계화하기 위해.
  • 샘플 효율성과 강건성을 유지하면서도 표준 오프라인 RL 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 정책과 동역학 적대자 간의 교차 마르코프 게임(AMG)으로 오프라인 RL을 공식화하여 페시즘 행동을 유도한다.
  • 정책에 따라 재가중되는 방식으로 동역학 모델에 대한 믿음 분포를 유지하여 페시즘을 반영한다.
  • AMG 공식화에서 파생된 편향된 샘플링 절차를 통해 자연스럽게 Pessimism-Modulated Dynamics Belief (PMDB)를 유도한다.
  • 일부 조건 하에서 단조적 향상 보장을 갖는 반복적 정규화 정책 최적화 알고리즘을 제안한다.
  • Q-함수와 믿음 분포를 위한 공동 학습 목표를 사용해 AMG 해를 근사하는 실용적인 오프라인 RL 알고리즘을 설계한다.
  • AMG와 경험적 MDP 손실을 모두 통합하여 학습하고, 믿음과 데이터 기반 학습을 균형 잡기 위해 조정 가능한 가중치를 적용한다.

실험 결과

연구 질문

  • RQ1보상에 대한 명시적 페널티 없이도 오프라인 RL에서 과도한 보수성을 피하면서 동역학 불확실성을 효과적으로 모델링할 수 있는가?
  • RQ2정책에 따라 동역학에 대한 믿음 분포를 어떻게 업데이트할 수 있으며, 이는 페시즘을 반영할 수 있는가?
  • RQ3교차 마르코프 게임 공식화가 오프라인 환경에서 안정적이고 향상되는 정책 최적화 과정을 이끌 수 있는가?
  • RQ4믿음 기반 샘플링이 외부 데이터 분포를 벗어난 상태-행동 쌍을 다룰 때 불확실성 기반 보상 페널티보다 우수한가?
  • RQ5제안된 방법이 다양한 오프라인 RL 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 제안된 PMDB 방법은 D4RL 벤치마크 세트에서 최고 성능을 기록했으며, 대부분의 작업에서 이전 방법들인 RAMBO를 능가한다.
  • hopper-medium 작업에서 PMDB는 106.8 ± 0.2를 기록했으며, CQL(61.9 ± 6.4), MOReL(84.0 ± 17.0), RAMBO(87.0 ± 15.4)를 모두 초월한다.
  • walker2d-medium에서 PMDB는 94.2 ± 1.1을 기록했으며, BEAR(59.8 ± 40.0), BRAC(59.7 ± 39.9), RAMBO(84.9 ± 2.6)를 모두 능가한다.
  • halfcheetah-medium에서 PMDB는 75.6 ± 1.3을 기록했으며, CQL(46.9 ± 0.4), MOReL(60.7 ± 4.4), RAMBO(77.9 ± 4.0)를 초월한다.
  • 이 방법은 랜덤, 중간, 전문가, 재생 데이터셋을 포함한 다양한 유형의 데이터셋에서 강건한 성능을 보이며, 뛰어난 일반화 능력을 보여준다.
  • 제거 실험 결과, AMG와 MDP 손실의 가중치 설정에 민감하지 않아 안정적인 학습 동역학을 보임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.