Skip to main content
QUICK REVIEW

[논문 리뷰] MHER: Model-based Hindsight Experience Replay

Rui Yang, Meng Fang|arXiv (Cornell University)|2021. 07. 01.
Reinforcement Learning in Robotics참고 문헌 32인용 수 13
한 줄 요약

MHER는 학습된 동역학 모델을 통해 가상의 달 достиг은 목표를 생성함으로써 보다 효과적인 목표 재표기 가능성을 제공하는 모델 기반 후회 경험 재생 프레임워크를 제안한다. 이는 강화학습과 모델에 의해 생성된 재표기 데이터 기반의 목표 조건부 지도학습을 결합하여 희소 보상 환경에서 기존의 모델리스 및 모델기반 방법보다 뛰어난 샘플 효율성을 달성한다.

ABSTRACT

Solving multi-goal reinforcement learning (RL) problems with sparse rewards is generally challenging. Existing approaches have utilized goal relabeling on collected experiences to alleviate issues raised from sparse rewards. However, these methods are still limited in efficiency and cannot make full use of experiences. In this paper, we propose Model-based Hindsight Experience Replay (MHER), which exploits experiences more efficiently by leveraging environmental dynamics to generate virtual achieved goals. Replacing original goals with virtual goals generated from interaction with a trained dynamics model leads to a novel relabeling method, model-based relabeling (MBR). Based on MBR, MHER performs both reinforcement learning and supervised learning for efficient policy improvement. Theoretically, we also prove the supervised part in MHER, i.e., goal-conditioned supervised learning with MBR data, optimizes a lower bound on the multi-goal RL objective. Experimental results in several point-based tasks and simulated robotics environments show that MHER achieves significantly higher sample efficiency than previous model-free and model-based multi-goal methods.

연구 동기 및 목표

  • 희소 보상 환경에서 다목표 강화학습의 낮은 샘플 효율성 문제를 해결한다.
  • 기존의 목표 재표기 방법이 실재 수집된 트레이젝터리에만 의존하는 한계를 극복한다.
  • 학습된 환경 동역학을 활용해 더 효과적인 경험 재표기를 위한 가상의 달 достиг은 목표를 생성한다.
  • 모델 기반 재표기 데이터 기반의 강화학습과 지도학습을 결합한 공동 학습 프레임워크를 개발한다.
  • 제안된 방법의 효과성을 이론적으로 정당화하기 위해 원래의 다목표 강화학습 목표의 하한을 최소화함을 증명한다.

제안 방법

  • 학습된 동역학 모델을 사용해 환경 상호작용에서 가상의 달 достиг은 목표를 생성하는 모델 기반 재표기(MBR)를 도입한다.
  • 현재 정책을 동역학 모델로 전개하여 가상의 트레이젝터리를 생성함으로써 재표기된 목표를 가진 가짜 시연 데이터를 생성한다.
  • MBR에 의해 생성된 데이터 기반의 목표 조건부 지도학습을 적용하여 정책의 일반화 능력과 샘플 효율성을 향상시킨다.
  • MBR 데이터 기반의 강화학습 손실과 지도학습 손실을 조합한 공동 손실 함수를 정의하여 엔드 투 엔드 정책 최적화를 수행한다.
  • 이론적 분석을 통해 MBR 데이터 기반의 지도학습 손실 최소화가 원래의 다목표 강화학습 목표의 하한을 최소화함을 증명한다.
  • 실제 환경 상호작용 없이도 동역학 모델을 사용해 향후 상태와 목표를 시뮬레이션함으로써 데이터 수집 비용을 절감한다.

실험 결과

연구 질문

  • RQ1모델에 의해 생성된 가상의 목표는 희소 보상 환경에서 다목표 강화학습의 샘플 효율성을 향상시킬 수 있는가?
  • RQ2MBR에 의해 생성된 데이터 기반의 지도학습을 강화학습과 조합하면 표준 HER나 모델리스 기반 보다 더 나은 정책 성능을 달성하는가?
  • RQ3공동 강화학습 및 지도학습 프레임워크에서 MBR 데이터를 사용하는 데 이론적 근거가 존재하는가?
  • RQ4최신의 모델기반 및 모델리스 다목표 강화학습 방법과 비교했을 때 MHER는 샘플 효율성이 어떻게 되는가?
  • RQ5완전히 가상의 상태에 대해 학습하지 않기 때문에 MHER는 모델 정확도 부족에 대해 어떻게 강건성을 유지하는가?

주요 결과

  • MHER는 포인트 기반 및 Mujoco 환경에서 HER, 커리큘럼 가이드드 HER, 최대 엔트로피 기반 우선순위 지정, 목표 조건부 지도학습보다 유의미하게 높은 샘플 효율성을 달성한다.
  • Point2DLarge 및 Point2D-FourRoom 환경에서 MHER는 기준 방법들보다 훨씬 적은 환경 상호작용 수로 목표 목표에 도달한다.
  • FetchReach 및 SawyerReachXYZ 작업에서 MHER는 특히 희소 보상 설정에서 이전 방법들보다 샘플 효율성이 뛰어나다.
  • 제거 실험 결과, 강화학습과 함께 MBR를 사용할 경우 단순 강화학습만 사용하는 것보다 학습 속도와 최종 성능이 향상됨을 확인하였다.
  • 실제 데이터에서만 목표를 생성함으로써 MHER는 완전히 가상의 상태에 대해 학습하지 않아 모델 오차에 대해 강건성을 유지한다.
  • 복잡한 동역학을 가진 연속 제어 작업을 포함한 다양한 환경에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.