Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Imitation Learning in Minecraft

Artemij Amiranashvili, Nicolai Dorka|arXiv (Cornell University)|2020. 07. 06.
Human Pose and Action Recognition참고 문헌 20인용 수 7
한 줄 요약

이 논문은 메인크래프트에서 복잡하고 보상이 희박한 작업(예: 철도구 제작)을 습득하기 위해 전문가 시범 데이터와 아키텍처 혁신을 활용한 강력한 모방 학습 프레임워크를 제시한다. 딥 임팔라 네트워크, 교차 엔트로피 손실, 데이터 증강, 트리초프 시범 데이터를 조합함으로써 ObtainIronPickaxe 태스크에서 평균 수익 74.5를 기록하여 기존 방법과 강화 학습 기준선을 모두 능가하는 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Imitation learning is a powerful family of techniques for learning sensorimotor coordination in immersive environments. We apply imitation learning to attain state-of-the-art performance on hard exploration problems in the Minecraft environment. We report experiments that highlight the influence of network architecture, loss function, and data augmentation. An early version of our approach reached second place in the MineRL competition at NeurIPS 2019. Here we report stronger results that can be used as a starting point for future competition entries and related research. Our code is available at https://github.com/amiranas/minerl_imitation_learning.

연구 동기 및 목표

  • 메인크래프트와 같은 보상이 희박하고 행동 공간이 넓은 환경에서 강화 학습의 샘플 비효율성을 해결하기 위해.
  • 네트워크 아키텍처, 손실 함수, 데이터 증강 기법이 이미지 기반 3차원 환경에서의 모방 학습 성능에 미치는 영향을 평가하기 위해.
  • 향후 메인크래프트 리그 경쟁 참가 및 몰입형 환경에서의 모방 학습 연구를 위한 강력한 기준을 설정하기 위해.
  • 학습 중 환경 상호작용 없이도 모방 학습이 최적에 가까운 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 이 방법은 메인크래프트-v0 데이터셋의 전문가 시범 데이터를 사용하며, 이는 ObtainIronPickaxe 작업에 대해 500시간이 넘는 인간의 경로 데이터를 포함한다.
  • 입력 관측치로는 1인칭 시점과 자원 인벤토리가 사용되며, 이는 컨볼루션 인코더와 순환 처리를 거쳐 처리되는 딥 임팔라 신경망 아키텍처를 활용한다.
  • 정책은 전문가 행동에 대해 교차 엔트로피 손실을 사용하여 훈련되며, 이미지 뒤집기, 밝기 조정, 선명도, 대trast, 포스터라이제이션 등의 추가 데이터 증강 기법이 적용된다.
  • 일관된 하위작업에서의 일반화 및 성능 향상을 위해 트리초프 시범 데이터도 추가로 통합된다.
  • 성능 평가는 100개의 테스트 에피소드에 대한 평균 수익을 통해 평가되며, 결과는 여러 훈련 런에 걸쳐 평균화되고 표준편차가 보고된다.
  • 이 방법은 DQfD 및 레인보우 RL 에이전트와 비교되어 보상이 희박한 환경에서의 상대적 성능을 평가한다.

실험 결과

연구 질문

  • RQ1다양한 신경망 아키텍처(예: DQN, 임팔라, 딥 임팔라)가 메인크래프트에서의 모방 학습 성능에 미치는 영향은 무엇인가?
  • RQ2데이터 증강 기법(예: 뒤집기, 밝기, 대trast)이 정책의 일반화 및 최종 성능에 미치는 영향은 무엇인가?
  • RQ3다양한 손실 함수(교차 엔트로피 대비 마진 손실)가 모방 학습에서 정책의 안정성과 수익에 미치는 영향은 무엇인가?
  • RQ4모방 학습이 메인크래프트와 같은 보상이 희박하고 관측 공간이 넓은 환경에서 강화 학습을 능가할 수 있는가?
  • RQ5관련 작업(예: 트리초프)에서 유래한 추가 시범 데이터를 통합할 경우, 목표 작업에서의 성능 향상은 어떻게 이루어지는가?

주요 결과

  • 교차 엔트로피 손실과 완전한 데이터 증강(뒤집기, 밝기, 사각형 제거)을 적용한 딥 임팔라 네트워크는 ObtainIronPickaxe 작업에서 평균 수익 53.4 ± 7.5를 기록하여 가장 높은 성능을 달성했다.
  • 최고의 성능을 보인 정책은 교차 엔트로피 손실과 트리초프 시범 데이터를 사용하여 세 번의 훈련 런 동안 평균 수익 74.5를 기록했으며, 이는 이전 경쟁 참가 기록(42.4)과 최고의 강화 학습 기준선을 크게 능가했다.
  • 데이터 증강, 특히 이미지 뒤집기와 밝기 조정이 평균 수익을 49.7 ± 2.0에서 53.4 ± 7.5로 향상시켜 강력한 일반화 이점을 보였다.
  • 아규맥스 행동 선택을 사용하는 교차 엔트로피 손실이 마진 손실과 병합 손실(Margin + TD)보다 성능이 뛰어나, 이 설정에서는 하이브리드 DQfD 스타일 훈련보다 순수 모방 학습이 더 효과적임을 시사했다.
  • 모방 학습은 단지 50,000개의 훈련 스텝 후에 거의 최적의 성능를 달성한 반면, 레인보우 RL은 세 번의 훈련 런 중 두 번에서 비제로 보상을 기록하지 못해, 모방 학습의 샘플 효율성이 뛰어나다는 점을 입증했다.
  • 정책은 82%의 에피소드에서 돌도구를 성공적으로 확보했고, 가끔는 철 인고를 확보했지만, 철도구 제작은 여전히 드물게 발생(1% 성공률)하여 장기적이고 순차적인 의사결정 과제에서 지속적인 과제가 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.