Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Task Representations for Offline Meta-Reinforcement Learning via Contrastive Learning

Haoqi Yuan, Zongqing Lu|arXiv (Cornell University)|2022. 06. 21.
Reinforcement Learning in Robotics인용 수 11
한 줄 요약

이 논문은 오프라인 메타강화학습에서 작업 정책의 분리된 표현 학습을 위한 대trastive 학습 프레임워크인 CORRO를 제안한다. 이는 작업 정체성과 행동 정책 특성 간의 분리에 기여한다. 이중 네트워크를 통해 개별 전이 튜플을 인코딩하고, 정책에 강건한 음성 샘플링을 사용한 InfoNCE 기반 대비 목적 함수를 최적화함으로써, CORRO는 분포를 벗어난 행동 정책에 대해 뛰어난 일반화 성능을 달성하며, OOD 기준에서 이전 방법 대비 최대 115% 높은 수익을 기록한다.

ABSTRACT

We study offline meta-reinforcement learning, a practical reinforcement learning paradigm that learns from offline data to adapt to new tasks. The distribution of offline data is determined jointly by the behavior policy and the task. Existing offline meta-reinforcement learning algorithms cannot distinguish these factors, making task representations unstable to the change of behavior policies. To address this problem, we propose a contrastive learning framework for task representations that are robust to the distribution mismatch of behavior policies in training and test. We design a bi-level encoder structure, use mutual information maximization to formalize task representation learning, derive a contrastive learning objective, and introduce several approaches to approximate the true distribution of negative pairs. Experiments on a variety of offline meta-reinforcement learning benchmarks demonstrate the advantages of our method over prior methods, especially on the generalization to out-of-distribution behavior policies. The code is available at https://github.com/PKU-AI-Edge/CORRO.

연구 동기 및 목표

  • 학습 시 사용된 행동 정책와 테스트 시 사용된 행동 정책가 다를 경우 오프라인 메타강화학습에서 작업 표현의 불안정성을 해결하기 위해.
  • 오프라인 데이터셋에서 작업 정체성과 행동 정책 특성을 분리하기 위해, 이 둘은 함께 데이터 분포를 형성한다.
  • 실제로 사용되지 않는 행동 정책(OOD)에 대한 일반화를 향상시키기 위해, 이는 실용적인 오프라인 메타강화학습의 핵심 과제이다.
  • 행위 정책의 변화에 강인한 작업 표현을 학습하는 대비 학습 프레임워크를 개발하기 위해.
  • 진정한 음성 전이의 분포를 근사하는 효과적인 음성 쌍 생성 전략을 설계하기 위해.

제안 방법

  • 이중 인코더 아키텍처를 제안한다: 첫 번째 레벨은 개별 전이 튜플 (s, a, r, s')을 인코딩하고, 두 번째 레벨은 튜플 간 표현을 집계하여 작업 임베딩을 생성한다.
  • 작업 표현 학습을 진짜 작업과 표현 간 상호정보량 최대화 문제로 공식화하여, 행동 정책의 영향을 최소화한다.
  • InfoNCE 하한을 기반으로 한 대비 목적 함수를 유도하여, 동일한 작업에 속하는 양성 쌍 간 유사도를 최대화하고, 다른 작업에 속하는 음성 쌍 간 유사도를 최소화한다.
  • 두 가지 음성 쌍 생성 방법을 도입한다: 생성 모델링(CVAE를 사용해 전이를 샘플링)과 보상 랜덤화(보상을 변형하여 다양한 음성을 생성).
  • 비교를 위해 리라벨링과 기본 설정 'None' 방법을 사용하며, 이 경우 다른 작업의 전이에서 음성 쌍을 형성한다. 이때 (s, a)가 다를 수 있다.
  • 대비 손실을 InfoNCE 기반으로 사용하여 표현 네트워크를 최적화하며, 행동 정책의 분포 변화에 대한 강인함을 확보한다.

실험 결과

연구 질문

  • RQ1오프라인 메타강화학습에서 전이 튜플에 대한 대비 학습이 행동 정책의 분포 변화에 강인한 작업 표현 학습에 기여하는가?
  • RQ2다양한 음성 쌍 생성 전략이 오프라인 메타강화학습에서 OOD 일반화에 어떤 영향을 미치는가?
  • RQ3전체 트레이젝터리가 아닌 개별 전이에서 학습하는 것이 행동 정책 특성의 기억을 줄이는가?
  • RQ4제안된 방법이 진짜 작업 설명을 사용하는 지도 학습 기반 방법보다 더 나은 일반화 성능을 보이는가?
  • RQ5음성 샘플링 전략의 선택이 분포를 벗어난 행동 정책에서의 성능에 어떤 영향을 미치는가?

주요 결과

  • Point-Robot 벤치마크에서 CORRO는 OOD 행동 정책 하에서 평균 수익 -5.59 ± 0.57을 기록하며, FOCAL(-8.64 ± 0.26)과 PEARL(-7.06 ± 0.99)을 모두 앞서며 최고의 성능을 보였다.
  • Half-Cheetah-Vel 환경에서 CORRO는 OOD 테스트에서 -42.9 ± 0.7의 성능을 기록했으며, FOCAL(-208.2)과 PEARL(-35.4 ± 1.8)에 비해 뚜렷한 우월성을 보였다.
  • Point-Robot에서 보상 랜덤화 방법이 생성 모델링보다 우수했으며, 이는 행동 정책가 고도로 방향성 있고 겹치지 않는 경우에 특화된 효과를 보임을 시사한다.
  • 'None' 음성 샘플링 방법은 다른 작업의 랜덤 전이를 사용하여 OOD Half-Cheetah-Vel에서 -97.6의 성능을 기록했으며, FOCAL(-204.1)을 능가했고, 이는 전이 수준의 학습이 OOD 일반화를 향상시킨다는 것을 의미한다.
  • CORRO의 InfoNCE 손실을 사용해 FOCAL를 재구현한 결과, OOD Half-Cheetah-Vel에서 -208.2를 기록했으며, 원본 FOCAL와 유사한 성능을 보였다. 이는 대비 손실 자체만으로는 부족하며, 전이 수준의 인코딩이 핵심임을 시사한다.
  • 랜덤 탐색을 통해 컨텍스트 데이터를 수집하는 환경에서는 CORRO가 가장 뛰어난 적응 성능을 보였으며, 이는 비최적의 정책으로 컨텍스트 데이터를 수집하더라도 강인함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.