Skip to main content
QUICK REVIEW

[논문 리뷰] MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning

Li, Kevin, Abhishek Gupta|arXiv (Cornell University)|2021. 07. 15.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

MURAL은 강화학습에서의 보상 희박성과 열악한 탐색 문제를 해결하기 위해 사용자 제공 성공 사례를 기반으로 한 불확실성 인식 분류기 학습을 위한 메타학습 접근법을 제안한다. NML 추정을 메타학습을 통해 구현함으로써, 복잡한 탐색 및 로봇 조작 작업에서 효과적인 탐색과 방향성 있는 정책 학습을 가능하게 하며, 어려운 환경에서 기존 방법들을 능가한다.

ABSTRACT

Exploration in reinforcement learning is a challenging problem: in the worst case, the agent must search for high-reward states that could be hidden anywhere in the state space. Can we define a more tractable class of RL problems, where the agent is provided with examples of successful outcomes? In this problem setting, the reward function can be obtained automatically by training a classifier to categorize states as successful or not. If trained properly, such a classifier can provide a well-shaped objective landscape that both promotes progress toward good states and provides a calibrated exploration bonus. In this work, we show that an uncertainty aware classifier can solve challenging reinforcement learning problems by both encouraging exploration and provided directed guidance towards positive outcomes. We propose a novel mechanism for obtaining these calibrated, uncertainty-aware classifiers based on an amortized technique for computing the normalized maximum likelihood (NML) distribution. To make this tractable, we propose a novel method for computing the NML distribution by using meta-learning. We show that the resulting algorithm has a number of intriguing connections to both count-based exploration methods and prior algorithms for learning reward functions, while also providing more effective guidance towards the goal. We demonstrate that our algorithm solves a number of challenging navigation and robotic manipulation tasks which prove difficult or impossible for prior methods.

연구 동기 및 목표

  • 사용자 제공 성공 사례를 통해 보상 희박성과 열악한 탐색 문제를 해결하고자 한다.
  • 수동 보상 설계 없이도 잘 형성된 보상 신호를 도출할 수 있는 실용적이고 확장 가능한 방법을 개발하고자 한다.
  • 불확실성 추정을 보상 함수에 통합하여 탐색을 향상시키고, 새로운 유망한 상태로의 이동을 유도하고자 한다.
  • 로봇 조작 및 탐색과 같은 고차원 연속 제어 작업에서 효과적인 학습을 가능하게 하고자 한다.
  • 정규화 최대우도(NML) 추정을 통해 이론적으로 탄탄하고 校정된 보상 신호를 제공하고자 한다.

제안 방법

  • 사용자가 제공한 성공 상태와 현재 정책이 방문한 상태를 구분하는 이진 분류기를, GAN 유사한 대립 목적함수를 사용해 학습한다.
  • 메타학습 프레임워크를 활용해 정규화 최대우도(NML) 분포를 효율적으로 추정함으로써 분류기 예측에 대한 校정된 불확실성 추정을 제공한다.
  • 분류기 예측의 불확실성을 탐색 보너스로 통합하여, 모델이 불확실한 상태로의 이동을 장려한다.
  • 분류기의 성공 확률 예측과 불확실성을 조합하여, 안내성과 탐색성을 균형 잡은 복합 보상 신호를 형성한다.
  • 일반화 및 강인성을 향상시키기 위해 데이터 증강(예: mixup)과 가중치 감소를 적용하여 메타학습 중 분류기 성능을 향상시킨다.
  • 성공 및 실패 상태의 서포트 세트를 기반으로 NML 손실을 최소화하는 메타최적화 과정을 통해 분류기를 업데이트한다.

실험 결과

연구 질문

  • RQ1성공 사례에 기반해 학습된 분류기가 탐색을 향상시키는 잘 형성된 불확실성 인식 보상 신호를 제공할 수 있는가?
  • RQ2NML을 통한 불확실성 추정은 표준 분류기 기반 보상 설계에 비해 샘플 효율성과 최종 성능을 얼마나 향상시키는가?
  • RQ3메타학습을 통해 고차원 연속 제어 환경에서 NML 기반 불확실성 추정 계산이 실현 가능한가?
  • RQ4제안된 방법은 복잡한 로봇 작업에서 카운트 기반 탐색 및 기존 분류기 기반 보상 학습 방법보다 뛰어나게 성능을 발휘하는가?
  • RQ5이 방법은 다양한 탐색 및 조작 환경 간에 얼마나 잘 일반화되는가?

주요 결과

  • MURAL은 이전 방법들이 실패하는 어려운 로봇 조작 및 탐색 작업(예: Sawyer 도어 열기, 민감한 손가락 재배치, 개의 이동)을 성공적으로 해결한다.
  • 모든 평가 환경에서 VICE, RND 및 표준 분류기 기반 강화학습 기준선보다 더 높은 샘플 효율성과 최종 성능를 달성한다.
  • 불확실성 인식 보상 신호는 더 방향성 있는 탐색을 이끌어내어, 카운트 기반 또는 불확실성 인식이 없는 방법에 비해 목표 상태 도달 시간을 단축시킨다.
  • 메타학습된 NML 추정은 명시적 밀도 추정이 필요 없이 정확한 불확실성 정량화를 가능하게 하여 고차원 관측에 대한 확장성을 확보한다.
  • 제거 실험 결과, 불확실성 추정 또는 메타학습을 제거할 경우 성능가 급격히 악화되어 두 구성 요소의 필요성을 입증한다.
  • 이 방법은 보상 희박성과 복잡한 역학을 가진 다양한 작업에 대해 잘 일반화되며, 환경 변화에 대한 강인함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.