Skip to main content
QUICK REVIEW

[논문 리뷰] Imaginary Hindsight Experience Replay: Curious Model-based Learning for Sparse Reward Tasks

Robert McCarthy, Stephen J. Redmond|arXiv (Cornell University)|2021. 10. 05.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 Hindsight Experience Replay(HER)를 동적 모델 앙상블에서 유도된 상상 속 롤아웃과 결합한 모델 기반 강화학습 방법인 상상 속 후회 경험 재생(I-HER)을 제안한다. 이는 희박 보상 환경에서 로봇 작업의 데이터 효율성을 햖스킨다. 정책 학습 중 실제와 상상된 전이를 명시적으로 구분하고, 궁극적으로 보상 기반 내재 보상( curiosity-driven intrinsic rewards)을 통합함으로써, OpenAI Gym Fetch 작업에서 최신 모델리스 방법 대비 샘플 복잡도를 한 단계 낮추며, 한 가지 작업를 제외한 나머지 모든 작업에서 동일한 최종 성능을 달성한다.

ABSTRACT

Model-based reinforcement learning is a promising learning strategy for practical robotic applications due to its improved data-efficiency versus model-free counterparts. However, current state-of-the-art model-based methods rely on shaped reward signals, which can be difficult to design and implement. To remedy this, we propose a simple model-based method tailored for sparse-reward multi-goal tasks that foregoes the need for complicated reward engineering. This approach, termed Imaginary Hindsight Experience Replay, minimises real-world interactions by incorporating imaginary data into policy updates. To improve exploration in the sparse-reward setting, the policy is trained with standard Hindsight Experience Replay and endowed with curiosity-based intrinsic rewards. Upon evaluation, this approach provides an order of magnitude increase in data-efficiency on average versus the state-of-the-art model-free method in the benchmark OpenAI Gym Fetch Robotics tasks.

연구 동기 및 목표

  • 현실 세계의 로봇 강화학습에서 높은 데이터 요구량과 복잡한 보상 설계 문제를 해결하기 위해.
  • 밀도 없는 보상이 설계하기 어렵기 때문에, 희박 보상 다중목표 작업에서의 샘플 효율성을 향상시키기 위해.
  • 전문가 지시나 복잡한 보상 형태 조정에 의존하지 않고도, 희박 보상 환경에서 효과적인 탐색을 가능하게 하기 위해.
  • 모델 정확도 부족에 의한 과적합을 방지하기 위해 동적 모델 앙상블을 사용하고, 각 모델 업데이트 후 상상된 데이터를 재생성함으로써 일반화 능력을 향상시키기 위해.
  • 모델 기반 강화학습과 모델리스 강화학습 간 격차를 좁히기 위해, 모델 기반 학습의 데이터 효율성과 HER 및 궁금증 기반 보상의 샘플 효율성과 강건성을 결합하기 위해.

제안 방법

  • I-HER는 다중목표 강화학습 작업에서 희박 보상을 가지는 경우 성능을 향상시키기 위해 후회 경험 재생(HER)을 사용하여 정책을 훈련시킨다.
  • 5개의 전방향 신경망 동적 모델 앙상블을 사용하여 상상된 롤아웃을 생성하며, 이 모델들은 ReLU 활성화 함수를 사용하고, 512개의 뉘앙스를 가진 레이어를 갖는다. 이들은 Adam 최적화기를 사용하여 학습률 0.001로 훈련된다.
  • 모델 업데이트 후마다 상상된 데이터를 재생성하여, 모델 정확도 부족에 의한 과적합을 방지하고 일반화 능력을 향상시킨다.
  • 앙상블은 모델 간 예측 불일치를 기반으로 내재 보상을 제공하여, 아직 방문하지 않은 상태 공간 영역 탐색을 장려한다.
  • 정책 학습 중 실제 전이와 상상된 전이를 이진 'env_is_real' 신호를 통해 명시적으로 구분한다. 그러나 데이터 수집 시 10%의 실제 및 상상된 롤아웃을 혼합하여 교차 도메인 일반화 능력을 향상시킨다.
  • 혼합 전략을 적용하여, 10%의 실제 롤아웃은 'env_is_real = 0'으로, 10%의 상상된 롤아웃은 'env_is_real = 1'로 제공함으로써, 실제 환경에서 상상된 행동이 수정되도록 보장한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화학습 방법이 밀도 없는 보상 설계 없이도 희박 보상 로봇 작업에서 높은 데이터 효율성을 달성할 수 있는가?
  • RQ2동적 모델 앙상블에서 유도된 상상된 롤아웃과 HER를 결합할 경우, 다중목표 작업에서 샘플 효율성과 최종 성능에 어떤 영향을 미치는가?
  • RQ3모델 불일치에서 유도된 궁금증 기반 내재 보상이 모델 기반 롤아웃과 결합되었을 때, 희박 보상 환경에서 탐색 능력을 어떻게 향상시키는가?
  • RQ4정책 학습 중 실제 전이와 상상된 전이를 명시적으로 구분할 경우, 일반화 능력과 모델 정확도 부족에 대한 강건성에 어떤 영향을 미치는가?
  • RQ5상상된 롤아웃이 현실 세계 상호작용을 얼마나 줄일 수 있으며, 이로 인해 실제 로봇 환경에서 학습 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • I-HER는 OpenAI Gym Fetch 로봇 벤치마크에서 최신 모델리스 방법 대비 평균적으로 샘플 복잡도를 한 단계 낮춘다.
  • I-HER는 네 가지 Fetch 작업(Reach, Push, PickAndPlace, Slide) 중 한 가지를 제외한 나머지 모든 작업에서 최신 모델리스 알고리즘의 최종 성능을 재현한다.
  • 제거 실험 결과, HER와 앙상블 기반 상상된 롤아웃 생성 방식이 다양한 로봇 작업에서 모델 기반 강화학습의 실패 원인을 극복하는 데 핵심적임을 확인하였다.
  • 모델 불일치 기반 내재 보상의 사용은 특히 쉽게 잘못된 내재 보상을 유도할 수 있는 PickAndPlace와 같은 작업에서 탐색 능력을 크게 향상시킨다.
  • 데이터 수집 중 실제 및 상상된 롤아웃을 혼합함으로써 정책의 일반화 능력이 향상되었으며, 이는 상상된 행동이 실제 환경에서 수정됨을 보장한다.
  • 모델 업데이트 후 상상된 데이터를 재생성함으로써, 모델 정확도 부족에 의한 정책 과적합을 방지함으로써, 모델 정확도 부족에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.