Skip to main content
QUICK REVIEW

[논문 리뷰] The MineRL 2020 Competition on Sample Efficient Reinforcement Learning using Human Priors

William H. Guss, Castro, Mario Ynocente|arXiv (Cornell University)|2021. 01. 26.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 인간의 사전 지식을 활용하여 환경 샘플 수요를 줄이는 샘플 효율적인 강화학습 도전 과제인 MineRL 2020 경쟁을 제시한다. 참가자들은 대규모 인간 시연 데이터셋(6000만 개의 트레이젝터리)을 기반으로, 샘플 예산이 철저히 제한된 상황에서 계층적이고 희박한 MineRL ObtainDiamond 과제를 해결하기 위해 에이전트를 훈련시켰으며, 환경 상호작용을 允허하는 팀과 허용하지 않는 팀의 두 트랙으로 나누어, 이민학습 및 효율적 탐색에 관한 연구를 촉진한다.

ABSTRACT

Although deep reinforcement learning has led to breakthroughs in many difficult domains, these successes have required an ever-increasing number of samples, affording only a shrinking segment of the AI community access to their development. Resolution of these limitations requires new, sample-efficient methods. To facilitate research in this direction, we propose this second iteration of the MineRL Competition. The primary goal of the competition is to foster the development of algorithms which can efficiently leverage human demonstrations to drastically reduce the number of samples needed to solve complex, hierarchical, and sparse environments. To that end, participants compete under a limited environment sample-complexity budget to develop systems which solve the MineRL ObtainDiamond task in Minecraft, a sequential decision making environment requiring long-term planning, hierarchical control, and efficient exploration methods. The competition is structured into two rounds in which competitors are provided several paired versions of the dataset and environment with different game textures and shaders. At the end of each round, competitors submit containerized versions of their learning algorithms to the AIcrowd platform where they are trained from scratch on a hold-out dataset-environment pair for a total of 4-days on a pre-specified hardware platform. In this follow-up iteration to the NeurIPS 2019 MineRL Competition, we implement new features to expand the scale and reach of the competition. In response to the feedback of the previous participants, we introduce a second minor track focusing on solutions without access to environment interactions of any kind except during test-time. Further we aim to prompt domain agnostic submissions by implementing several novel competition mechanics including action-space randomization and desemantization of observations and actions.

연구 동기 및 목표

  • 딥 강화학습의 높은 샘플 복잡도 문제를 해결하여 접근성과 실생활 적용 가능성을 높이기 위해.
  • 인간 시연을 활용해 환경 상호작용 수를 줄여 샘플 효율적 학습을 가능하게 하기 위해.
  • 마인크래프트와 같은 희박한 환경에서의 계층적이고 장기적인 의사결정 문제에 대한 연구를 촉진하기 위해.
  • 컴퓨팅 기부와 해외 여행 장학금을 통해 다양한 참가자를 지원하여 강화학습 연구의 포용성을 높이기 위해.
  • 표준화된 평가를 갖춘 확장 가능한 개방형 경쟁 프레임워크를 제공하여 이민학습 및 강화학습 분야의 벤치마킹을 발전시키기 위해.

제안 방법

  • 마인크래프트 기반의 부분관측 가능하고 보상이 희박하며 계층적인 환경인 MineRL-v0 환경을 사용하여 복잡한 의사결정 과제를 시뮬레이션한다.
  • 6000만 개 이상의 상태-행동 쌍으로 구성된 대규모 인간 시연 데이터셋을 제공하며, 수정된 게임 상태와 시각적 요소로 에이전트 트레이젝터리로 재시뮬레이션 가능하다.
  • 다른 텍스처와 쉐이더를 사용하여 환경-데이터셋 변형을 조합한 두 라운드로 구성된 경쟁 구조를 마련하여 일반화 능력을 테스트한다.
  • 제출물은 컨테이너화되어야 하며, 표준 하드웨어 플랫폼에서 4일간의 훈련을 통해 보류된 데이터셋-환경 조합에서부터 완전히 새로 훈련되어야 한다.
  • 행동 공간의 랜덤화와 관측 및 행동의 의미 해체를 통해 학습된 정책의 도메인 및 작업 일반화 능력을 향상시킨다.
  • 훈련 후 최종 에이전트 성능을 기반으로 제출물을 순위 매기며, AIcrowd 플랫폼에서 평가하여 재현 가능성과 공정성을 확보한다.

실험 결과

연구 질문

  • RQ1인간 시연는 복잡하고 계층적인 환경에서 샘플 효율적 강화학습 에이전트를 훈련시키기 위해 필요한 환경 샘플 수를 상당히 줄일 수 있는가?
  • RQ2마인크래프트에서 다이아몬드를 확보하는 것과 같은 희박한 보상, 장기적인 과제에 대해 이민학습 및 계층적 이민학습 방법은 얼마나 효과적인가?
  • RQ3다른 시각적 및 환경 구성(예: 텍스처, 쉐이더) 간에 인간 시연 기반으로 훈련된 정책이 얼마나 일반화되는가?
  • RQ4훈련 중에 어떤 환경 상호작용도 하지 않고, 오직 시연와 자기지도 사전 훈련에 의존하여 강력한 성능을 달성할 수 있는가?
  • RQ5실생활에 유사한 환경에서 샘플 효율성을 향상시키기 위해 이민학습과 강화학습을 어떻게 효과적으로 조합할 수 있는가?

주요 결과

  • 경쟁에는 1,000명 이상의 참가자가 등록되었고, 660건 이상의 완전한 제출이 이루어져 샘플 효율적 강화학습 분야에 대한 공동체의 높은 참여도와 관심을 보였다.
  • 6000만 개 이상의 인간 트레이젝터리를 포함하는 MineRL-v0 데이터셋은 다양한 시각적 및 상태 조건에서 에이전트 행동의 고정밀 재시뮬레이션을 가능하게 하였다.
  • 이전 경쟁의 상위 제출물들은 역강화학습 및 계층적 이민학습 분야의 새로운 방법론을 도입하여 샘플 효율성 향상에 있어 상당한 진전을 보였다.
  • 컨테이너 기반 평가 및 표준 하드웨어를 포함한 경쟁 프레임워크는 제출물 간의 재현 가능성과 공정성을 보장하였다.
  • 조직위원회는 소수자 그룹에게 컴퓨팅 기부와 해외 여행 장학금을 제공하여 강화학습 연구의 다양성과 접근성 향상에 기여하였다.
  • 상호작용 기반 및 시연 전용 훈련을 모두 허용하는 두 트랙 구조 덕분에 도메인에 관계없이 일반화 가능한 강화학습 알고리즘에 대한 혁신이 촉진되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.