Skip to main content
QUICK REVIEW

[논문 리뷰] Sample Efficient Reinforcement Learning through Learning from Demonstrations in Minecraft

Christian Scheller, Yanick Schraner|arXiv (Cornell University)|2020. 03. 12.
Reinforcement Learning in Robotics참고 문헌 21인용 수 9
한 줄 요약

이 논문은 인간의 시연 데이터를 기반으로 한 이민러닝과 IMPALA를 통한 피니튜닝을 조합하여, MineRL ObtainDiamond 작업을 위한 샘플 효율적인 강화학습 파이프라인을 제안한다. 이 방법은 경험 재현, 이점 클리핑, 치명적인 잊음 방지를 위한 CLEAR, 별도의 액터-크리틱 네트워크를 사용하며, 환경 프레임 수 800만 건으로 평균 점수 48을 기록하여 NeurIPS 2019 MineRL 경연에서 3위를 차지했다.

ABSTRACT

Sample inefficiency of deep reinforcement learning methods is a major obstacle for their use in real-world applications. In this work, we show how human demonstrations can improve final performance of agents on the Minecraft minigame ObtainDiamond with only 8M frames of environment interaction. We propose a training procedure where policy networks are first trained on human data and later fine-tuned by reinforcement learning. Using a policy exploitation mechanism, experience replay and an additional loss against catastrophic forgetting, our best agent was able to achieve a mean score of 48. Our proposed solution placed 3rd in the NeurIPS MineRL Competition for Sample-Efficient Reinforcement Learning.

연구 동기 및 목표

  • Minecraft와 같은 복잡하고 보상이 희박한 환경에서 딥 강화학습의 샘플 비효율 문제를 해결한다.
  • 오직 800만 개의 환경 상호작용만을 사용하여 ObtainDiamond 작업에서 최종 성능을 향상시킨다.
  • 표준 강화학습을 통한 이민러닝 정책의 피니튜닝 시 성능 붕괴 문제를 해결한다.
  • 훈련을 안정화하고 시연에서 얻은 드문 고보상 행동의 치명적인 잊음 방지를 방지한다.
  • 이민러닝과 향상된 강화학습 기법을 조합함으로써 엄격한 샘플 제약 조건 하에서도 뛰어난 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 6000만 건 이상의 인간 시연 트레이젝터리 데이터를 기반으로 감독학습을 통해 정책 및 가치 네트워크를 사전 훈련한다.
  • 대규모 경험 재현 버퍼(재현 비율 15)를 사용한 IMPALA를 통해 사전 훈련된 정책을 피니튜닝한다.
  • 이점 클리핑을 적용하여 평균 이상의 성능을 보인 트레이젝터리에 한해 정책 업데이트를 제한함으로써 시연된 행동의 효과적 이용을 향상시킨다.
  • 정규화를 통한 정책 및 가치 네트워크 동시 최적화를 통해 치명적인 잊음을 줄이는 CLEAR(지속적 학습을 위한 경험 재현)를 도입한다.
  • 훈련 안정성과 성능 향상을 위해 공유 아키텍처 대신 별도의 액터 및 크리틱 네트워크를 사용한다.
  • 다중 구성 요소 훈련 파이프라인을 활용한다: 이민러닝 → 경험 재현 → 이점 클리핑 → CLEAR → 최종 피니튜닝.

실험 결과

연구 질문

  • RQ1인간의 시연은 Minecraft의 계층적이고 보상이 희박한 작업인 ObtainDiamond에 대해 딥 강화학습의 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2이민러닝 정책을 단순히 피니튜닝할 경우 성능 붕괴가 발생하는 이유는 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ3경험 재현, 이점 클리핑, CLEAR가 개별적으로나 함께 작용할 때 800만 프레임 제약 조건 하에서 최종 성능에 얼마나 기여하는가?
  • RQ4공유 네트워크 아키텍처 대비 별도의 액터-크리틱 네트워크가 성능과 안정성 측면에서 더 우수한가?
  • RQ5제한된 인간 시연 데이터로 훈련된 에이전트가 랜덤으로 생성된 Minecraft 지도에서 얼마나 효과적으로 일반화할 수 있는가?

주요 결과

  • 최고의 에이전트는 평균 점수 48을 기록하여, 단순 피니튜닝(평균 점수 2.9)과 감독 기반 베이스라인(평균 10.3)을 크게 앞서며 뛰어난 성능을 보였다.
  • 재현 비율 15를 가진 경험 재현이 가장 높은 성능을 내어 샘플 효율성에서 핵심적인 역할을 함을 입증했다.
  • CLEAR와 함께 이점 클리핑을 적용한 결과 학습이 안정화되었고, 평균 점수가 37.5에서 39.9로 향상되어, 시연된 행동의 효과적 이용이 가능함을 보였다.
  • CLEAR는 치명적인 잊음을 효과적으로 방지하여 다이아몬드 광물 채굴과 같은 고보상 하위 작업 수행 능력을 유지시켰다.
  • 별도의 액터-크리틱 네트워크와 CLEAR의 조합은 공동 네트워크 대비 더 안정적인 학습과 높은 최고 점수(163)를 달성했다.
  • 전체 파이프라인(이민러닝 + 경험 재현 + 이점 클리핑 + CLEAR + 별도 네트워크)은 평균 점수 40을 기록하였으며, 한 에이전트는 48에 도달하여 NeurIPS 2019 MineRL 경연에서 3위를 차지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.