Skip to main content
QUICK REVIEW

[논문 리뷰] MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration

Jin Zhang, Jianhao Wang|arXiv (Cornell University)|2020. 06. 15.
Reinforcement Learning in Robotics참고 문헌 40인용 수 9
한 줄 요약

MetaCURE는 태스크 식별을 위한 정보량을 극대화하기 위해 탐색 및 이용 정책을 분리하고, 능력 기반 내재 보상( intrinsic reward )을 사용하는 새로운 이완정책 메타강화학습 프레임워크를 제안한다. 이는 메타학습 및 적응 단계에서 효율적이고 맥락 인식 탐색이 가능하게 하여 희박 보상 환경인 MuJoCo 및 Meta-World 태스크에서 최신 기준 성능을 달성한다.

ABSTRACT

Meta reinforcement learning (meta-RL) extracts knowledge from previous tasks and achieves fast adaptation to new tasks. Despite recent progress, efficient exploration in meta-RL remains a key challenge in sparse-reward tasks, as it requires quickly finding informative task-relevant experiences in both meta-training and adaptation. To address this challenge, we explicitly model an exploration policy learning problem for meta-RL, which is separated from exploitation policy learning, and introduce a novel empowerment-driven exploration objective, which aims to maximize information gain for task identification. We derive a corresponding intrinsic reward and develop a new off-policy meta-RL framework, which efficiently learns separate context-aware exploration and exploitation policies by sharing the knowledge of task inference. Experimental evaluation shows that our meta-RL method significantly outperforms state-of-the-art baselines on various sparse-reward MuJoCo locomotion tasks and more complex sparse-reward Meta-World tasks.

연구 동기 및 목표

  • 희박 보상 설정에서 태스크 관련 정보가 부족한 환경에서 효율적 탐색을 해결하기 위해.
  • 탐색 정책 학습과 이용 정책 학습을 분리하여 정보성 경험을 수집하는 데 집중할 수 있도록 하기 위해.
  • 수집된 경험과 태스크 식별 간 상호정보량을 극대화하는 새로운 능력 기반 탐색 목표를 설계하기 위해.
  • 행동 간 모델 예측 오차의 차이를 바탕으로 내재 보상을 유도하여 메타학습 및 적응 단계에서 효과적인 탐색을 이끌기 위해.
  • 탐색 및 이용 정책 간 태스크 추론을 공유하는 통합된 이완정책 메타강화학습 프레임워크를 개발하여 학습 효율성을 향상시키기 위해.

제안 방법

  • 탐색 궤적과 태스크 정체성 간 상호정보량을 극대화하는 능력 기반 탐색 목표를 수립한다.
  • 행동 간 예측 오차의 차이를 기반으로 탐색 목표에서 내재 보상을 유도한다.
  • 새로운 이완정책 메타강화학습 프레임워크인 MetaCURE를 개발하여 맥락 인식 탐색 정책과 이용 정책을 별도로 학습한다.
  • 탐색 및 이용 정책 간 공통된 태스크 추론 모듈을 공유하여 샘플 효율성과 지식 전이를 향상시킨다.
  • 적응 단계에서 확률적 태스크 추론을 사용하며, 탐색 정책은 에피소드 간 순차적 탐색 행동을 수행한다.
  • 적응 단계에서 내재 보상을 사용하여 탐색 정책이 정보성 경험 쪽으로 유도되도록 하며, 이용 정책은 최종 에피소드에서 외재적 보상을 최적화하도록 한다.

실험 결과

연구 질문

  • RQ1정보량 기반 내재 보상이 희박 보상 환경에서 메타강화학습의 탐색 효율성을 향상시키는가?
  • RQ2탐색 및 이용 정책을 분리하면 희박 보상 조건 하에서 메타강화학습 성능이 향상되는가?
  • RQ3태스크 정체성과의 상호정보량을 극대화하는 능력 기반 목표가 태스크 추론 및 적응 속도를 향상시키는가?
  • RQ4MetaCURE는 희박 보상 환경에서 MuJoCo 및 Meta-World 태스크의 샘플 효율성과 최종 성능 측면에서 최신 기준 베이스라인과 어떻게 비교되는가?
  • RQ5예측 오차의 차이에서 파생된 내재 보상이 메타학습 및 적응 단계에서 효과적인 탐색을 얼마나 잘 촉진하는가?

주요 결과

  • MetaCURE는 다양한 희박 보상 MuJoCo 이동 태스크에서 최신 기준 베이스라인을 크게 앞서며, 뛰어난 샘플 효율성과 최종 성능을 보였다.
  • 이러한 방법은 더 복잡한 희박 보상 Meta-World 태스크에서도 강력한 일반화 성능을 달성했으며, 이는 이전 메타강화학습 접근법이 탐색이 제한되어 어려움을 겪는 영역에서의 성과이다.
  • 제거 실험 결과 내재 보상 구성 요소가 성능에 매우 중요하며, 이를 제거하면 성능이 크게 하락하는 것으로 확인되었다.
  • 시각화 결과 MetaCURE의 탐색 정책은 무작위나 비구조적인 탐색이 아닌 체계적이고 순차적인 행동을 수행하여 태스크 관련 정보를 체계적으로 수집하는 것으로 나타났다.
  • 탐색 및 이용 정책의 분리로 인해 특히 낮은 데이터 환경에서 더 빠른 적응과 더 안정적인 학습이 가능했다.
  • 예측 오차의 차이에서 파생된 내재 보상은 정보량을 효과적으로 측정하여 에이전트가 태스크 식별에 가장 정보성 있는 경험을 얻을 수 있도록 하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.