Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Meta-Reinforcement Learning with Advantage Weighting

Eric Mitchell, Rafael Rafailov|arXiv (Cornell University)|2020. 08. 13.
Reinforcement Learning in Robotics참고 문헌 47인용 수 11
한 줄 요약

이 논문은 여러 작업에서 사전에 수집된 고정된 데이터를 기반으로 메타학습을 수행하고, 새로운 작업에 대해 몇 개의 트레이젝터리만으로도 적응할 수 있는 오프라인 메타강화학습(offline meta-RL)을 소개한다. 제안된 MACAW 알고리즘은 MAML 스타일의 메타학습과 이점 가중 회귀(advantage-weighted regression, AWR)를 결합하여 완전히 오프라인 환경에서도 일관되고 샘플 효율적인 적응을 가능하게 하며, 연속 제어 벤치마크에서 이전 방법들을 능가한다.

ABSTRACT

This paper introduces the offline meta-reinforcement learning (offline meta-RL) problem setting and proposes an algorithm that performs well in this setting. Offline meta-RL is analogous to the widely successful supervised learning strategy of pre-training a model on a large batch of fixed, pre-collected data (possibly from various tasks) and fine-tuning the model to a new task with relatively little data. That is, in offline meta-RL, we meta-train on fixed, pre-collected data from several tasks in order to adapt to a new task with a very small amount (less than 5 trajectories) of data from the new task. By nature of being offline, algorithms for offline meta-RL can utilize the largest possible pool of training data available and eliminate potentially unsafe or costly data collection during meta-training. This setting inherits the challenges of offline RL, but it differs significantly because offline RL does not generally consider a) transfer to new tasks or b) limited data from the test task, both of which we face in offline meta-RL. Targeting the offline meta-RL setting, we propose Meta-Actor Critic with Advantage Weighting (MACAW), an optimization-based meta-learning algorithm that uses simple, supervised regression objectives for both the inner and outer loop of meta-training. On offline variants of common meta-RL benchmarks, we empirically find that this approach enables fully offline meta-reinforcement learning and achieves notable gains over prior methods.

연구 동기 및 목표

  • 메타학습이 온라인 상호작용 없이 고정된 사전 수집 데이터에서 완전히 이루어지는 오프라인 메타-RL 문제 설정을 정식화한다.
  • 메타학습 중에 온라인 데이터 수집이 없는 상황에서도 분포 내 및 분포 외 테스트 작업 모두에서 양호한 성능을 달성하는 일관성을 유지하는 메타-RL 알고리즘을 설계한다.
  • 오프라인 환경에서 MAML과 가치 기반 강화학습을 결합할 때 발생하는 불안정성을 해결하기 위해 정책 업데이트의 표현 능력을 향상시키고, 지도학습 회귀 목표함수를 사용한다.
  • 메타학습에 오프라인 데이터만을 기반으로 하되, 테스트 작업에서 소수의 트레이젝터리(5개 이하)만으로도 새로운 작업에 빠르게 적응할 수 있도록 한다.
  • 샘플 효율적이고 낮은 품질 또는 희박한 훈련 데이터에 대해도 강건한 실용적인 종단 간 오프라인 메타-RL 프레임워크를 개발한다.

제안 방법

  • 내부 및 외부 루프 모두에서 지도학습 회귀를 사용하여 온라인 정책 기울기 없이 작동하는 최적화 기반 메타-RL 알고리즘인 MACAW를 제안한다.
  • 부트스트랩핑이나 동적 프rogram밍 없이 가치 함수를 피팅하기 위해 핵심적으로 이점 가중 회귀(advantage-weighted regression, AWR)를 사용한다.
  • 메타학습자의 표현 능력을 향상시키기 위해 내부 루프에서 정책 업데이트를 수정하여 적응 성능을 향상시킨다.
  • 오프라인 환경에서 안정적이고 효과적인 메타학습을 위해 특정 아키텍처 설계를 갖춘 얕은 피드포워드 신경망을 사용한다.
  • 테스트 작업의 소규모 데이터셋에서 기울기를 사용하여 메타파rameter를 업데이트하는 MAML 스타일의 메타최적화를 적용하여 빠른 적응을 가능하게 한다.
  • TD 백업의 불안정성과 장수평 문제를 피하기 위해 가치 함수 추정에 몬테카를로 수익을 적용한다.

실험 결과

연구 질문

  • RQ1메타학습 중에 온라인 상호작용이 전혀 없는 오프라인 데이터 전용으로 훈련된 메타-RL 알고리즘이 새로운 작업에 대해 일관된 적응을 이룰 수 있는가?
  • RQ2TD 백업이 불안정한 오프라인 환경에서 MAML 스타일의 메타학습과 오프폴리시, 가치 기반 강화학습을 효과적으로 통합할 수 있는가?
  • RQ3내부 루프 정책 업데이트의 표현 능력을 향상시키면 오프라인 메타-RL에서 적응 성능과 안정성이 향상되는가?
  • RQ4완전히 오프라인인 메타-RL 알고리즘이 낮은 데이터 환경에서 기존의 오프폴리시 및 온라인 메타-RL 기준선을 능가할 수 있는가?
  • RQ5제안된 방법은 희박하거나 품질이 낮은 메타학습 데이터에 대해 얼마나 강건한가? 이러한 조건에서도 성능을 유지하는가?

주요 결과

  • MACAW는 표준 연속 제어 메타-RL 벤치마크의 오프라인 변형에서 기존 최고 성능 방법들보다 뚜렷한 성능 향상을 보였다.
  • 새로운 작업에서 5개 이하의 트레이젝터리만으로도 분포 내 및 분포 외 테스트 작업 모두에서 일관된 적응 성능을 보였다.
  • MACAW는 오프폴리시 RL 및 메타-RL 기준선의 완전히 오프라인 변형을 모두 능가했으며, 특히 완전히 오프라인 환경에서 성능이 떨어지는 PEARL과 비교해도 유의미하게 뛰어났다.
  • 수정된 내부 루프 정책 업데이트가 어려운 또는 희박한 데이터 환경에서 적응 안정성과 성능 향상에 크게 기여했다.
  • AWR 기반 가치 추정에서 몬테카를로 수익의 사용은 오프라인 메타-RL 환경에서 효과적이고 안정적이며, TD 백업의 불안정성을 피할 수 있었다.
  • MACAW의 아키텍처 설계—특히 얕은 피드포워드 신경망—은 우수한 성능을 달성하는 데 핵심적인 역할을 했으며, 더 깊거나 표준 아키텍처보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.