Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Based Offline Meta-Reinforcement Learning with Regularization

Sen Lin, Jialin Wan|arXiv (Cornell University)|2022. 02. 07.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 메타정책을 통한 탐색과 오프라인 데이터셋의 이용을 균형 있게 조절하기 위해 정규화된 정책 최적화를 통한 모델 기반 오프라인 메타강화학습 프레임워크인 MerPO를 제안한다. 메타정책 정규화자와 행동정책 정규화자 간의 보간을 통해 메타정규화된 액터크리틱 방법을 도입함으로써, 두 정책 모두에 대해 보장된 성능 향상을 보장하며, 오프라인 메타강화학습 환경에서 더 안전하고 일반화 능력이 뛰어난 정책 학습을 달성한다.

ABSTRACT

Existing offline reinforcement learning (RL) methods face a few major challenges, particularly the distributional shift between the learned policy and the behavior policy. Offline Meta-RL is emerging as a promising approach to address these challenges, aiming to learn an informative meta-policy from a collection of tasks. Nevertheless, as shown in our empirical studies, offline Meta-RL could be outperformed by offline single-task RL methods on tasks with good quality of datasets, indicating that a right balance has to be delicately calibrated between "exploring" the out-of-distribution state-actions by following the meta-policy and "exploiting" the offline dataset by staying close to the behavior policy. Motivated by such empirical analysis, we explore model-based offline Meta-RL with regularized Policy Optimization (MerPO), which learns a meta-model for efficient task structure inference and an informative meta-policy for safe exploration of out-of-distribution state-actions. In particular, we devise a new meta-Regularized model-based Actor-Critic (RAC) method for within-task policy optimization, as a key building block of MerPO, using conservative policy evaluation and regularized policy improvement; and the intrinsic tradeoff therein is achieved via striking the right balance between two regularizers, one based on the behavior policy and the other on the meta-policy. We theoretically show that the learnt policy offers guaranteed improvement over both the behavior policy and the meta-policy, thus ensuring the performance improvement on new tasks via offline Meta-RL. Experiments corroborate the superior performance of MerPO over existing offline Meta-RL methods.

연구 동기 및 목표

  • 다양한 품질의 데이터셋에서 일반화 성능이 떨어지는 기존 방법들이 고질적인 행동정책이 존재하는 경우에도 잘 작동하지 않는 문제를 해결하기 위해.
  • 오프라인 메타강화학습에서 탐색과 이용의 균형이 깨질 경우 발생하는 분포 이탈 문제를 규명하고 해결하기 위해. 특히 메타정책에 과도하게 의존할 경우 분포 이탈이 발생하고, 행동정책에 과도하게 충실할 경우 일반화 능력이 제한된다.
  • 행동정책과 메타정책 모두에 대해 성능 향상을 보장하는 방법을 개발하여 오프라인 환경에서 안전하고 신뢰할 수 있는 정책 업데이트를 보장하기 위해.
  • 학습된 메타모델과 시뮬레이션 롤아웃을 통해 효율적인 작업 구조 추론과 분포 외 상태-행동 탐색을 가능하게 하기 위해.

제안 방법

  • 내부 작업 정책 최적화를 위한 메타정규화된 모델 기반 액터크리틱(RAC) 방법을 제안하며, 보수적인 정책 평가와 정규화된 정책 개선을 사용한다.
  • 행동정책 기반 정규화자와 메타정책 기반 정규화자 간의 새로운 보간 기법을 도입하여 탐색과 이용을 균형 있게 조절한다.
  • 오프라인 데이터셋에서 메타모델을 학습하여 작업별로 빠르고 정확한 모델 학습과 효율적인 구조 추론을 가능하게 한다.
  • 학습된 동역학 모델을 사용해 분포 외 상태-행동 탐색을 위한 시뮬레이션 롤아웃을 생성한다.
  • 엔트로피 정규화와 분포 제약 조건을 결합한 정규화된 정책 개선 모듈을 활용하여 과도한 낙관성과 분포 이탈을 방지한다.
  • 이론적 분석을 통해, 미약한 조건 하에 결과 정책가 행동정책과 메타정책 모두에 대해 높은 확률로 성능 향상을 보장함을 입증한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 메타정책을 통한 탐색과 주어진 오프라인 데이터셋의 이용을 안전하게 균형 있게 조절할 수 있는 오프라인 메타강화학습 알고리즘을 설계할 수 있는가?
  • RQ2기존 오프라인 메타강화학습 방법들이 고품질 데이터셋에서는 단일 태스크 강화학습보다 성능이 열 劣하는 이유는 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ3보수적인 동역학 모델링과 정규화된 정책 최적화를 갖춘 모델 기반 접근법이 행동정책과 메타정책 모두에 대해 보장된 성능 향상을 보장할 수 있는가?
  • RQ4메타모델에서 생성된 시뮬레이션 데이터는 오프라인 메타강화학습에서 일반화 능력을 어떻게 향상시킬 수 있는가?
  • RQ5성능 보장을 위한 정규화자 가중치 측면에서 행동정책 충실도와 메타정책 안내 간 최적의 트레이드오프는 무엇인가?

주요 결과

  • 이론적으로 미약한 조건 하에 MerPO는 행동정책과 메타정책 모두에 대해 높은 확률로 성능 향상을 보장하며, 이는 실제로도 확인되었다.
  • 다양한 오프라인 데이터셋에 걸쳐 최신의 오프라인 메타강화학습 베이스라인, 특히 FOCAL과 COMBO를 능가하는 일반화 성능을 보였다.
  • 고품질 데이터셋을 사용하는 작업에서는 COMBO와 같은 강력한 단일 태스크 오프라인 강화학습 방법을 뛰어넘었으며, 이는 뛰어난 일반화 능력을 보여준다.
  • 성능 향상의 원인은 이중 정규화자 보간을 통한 메타정책 탐색과 행동정책 이용 간 효과적인 균형 조절에 기인한다.
  • 실험 결과 MerPO는 행동정책이 강력한 경우에도 안전한 정책 향상을 유지하며, 분포 이탈로 인한 성능 저하를 방지함을 확인했다.
  • 이론적 분석은 정규화자 가중치를 선택하는 데 대한 설계 가이드라인을 제공하며, 메타정책 정규화자 가중치를 적절히 조정할 경우 성능 향상이 보장됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.