[논문 리뷰] JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical Reinforcement Learning
JueWu-MC는 행동 인식 표현 학습, 판별자 기반 자기 모방 학습, 일致성 필터링을 통한 앙상블 행동 클로닝을 조합한 샘플 효율적인 계층적 강화 학습 프레임워크를 제안한다. 이는 단지 250만 개의 훈련 샘플로만으로도 NeurIPS MineRL 2021 경쟁에서 최고의 성능 점수를 기록하였다.
Learning rational behaviors in open-world games like Minecraft remains to be challenging for Reinforcement Learning (RL) research due to the compound challenge of partial observability, high-dimensional visual perception and delayed reward. To address this, we propose JueWu-MC, a sample-efficient hierarchical RL approach equipped with representation learning and imitation learning to deal with perception and exploration. Specifically, our approach includes two levels of hierarchy, where the high-level controller learns a policy to control over options and the low-level workers learn to solve each sub-task. To boost the learning of sub-tasks, we propose a combination of techniques including 1) action-aware representation learning which captures underlying relations between action and representation, 2) discriminator-based self-imitation learning for efficient exploration, and 3) ensemble behavior cloning with consistency filtering for policy robustness. Extensive experiments show that JueWu-MC significantly improves sample efficiency and outperforms a set of baselines by a large margin. Notably, we won the championship of the NeurIPS MineRL 2021 research competition and achieved the highest performance score ever.
연구 동기 및 목표
- 열린 세계의 Minecraft 환경에서 부분 관측, 고차원 시각적 인식, 지연 보상 등의 복합적 과제를 해결하기 위해.
- 비정형 인간 시연을 활용하여 장기적 결정의 샘플 효율성을 향상시키기 위해.
- 새로운 표현 학습 및 모방 학습 기법을 통해 탐색 능력과 정책의 강건성을 향상시키기 위해.
- 시연에서 자동으로 하위 목표를 추출하고 하위 작업을 수행하는 저수준 워커를 훈련시켜 계층적 결정을 가능하게 하기 위해.
- 최소한의 훈련 샘플로 MineRL 2021 경쟁에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 고수준 제어자와 저수준 워커를 갖춘 이중 수준의 계층적 강화 학습 프레임워크로, 고수준 제어자가 옵션을 관리하고 저수준 워커가 하위 작업을 수행한다.
- 행동 인식 표현 학습(A2RL): 학습된 마스크 네트워크를 사용해 행동과 시각적 표현 간의 동적 관계를 포착한다.
- 판별자 기반 자기 모방 학습(DSIL): 과거에 성공한 행동을 재현하고 고수익 상태 분포에 집중함으로써 탐색을 장려한다.
- 일致성 필터링을 통한 앙상블 행동 클로닝: 여러 전문가 시연를 활용하고 노이즈가 있는 트레이젝터리를 걸러내어 정책의 강건성을 향상시킨다.
- 고수준 제어자는 비정형 인간 시연를 활용해 자동으로 하위 목표를 추출하고 이를 저수준 워커에 할당한다.
- 모방 학습과 표현 학습을 통합하여 복잡한 3D 환경에서 샘플 효율성과 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1비정형 시연에서 자동으로 하위 목표를 추출하는 계층적 RL 프레임워크는 장기적 Minecraft 작업에서 샘플 효율성을 향상시킬 수 있는가?
- RQ2행동 인식 표현 학습은 고차원 관측이 있는 3D 환경에서 시각적 이해력과 제어 능력을 어떻게 향상시키는가?
- RQ3표준 자기 모방 학습에 비해 판별자 기반 자기 모방 학습은 탐색 효율성을 얼마나 향상시키는가?
- RQ4일치성 필터링을 통한 앙상블 행동 클로닝은 불완전한 인간 시연가 존재하는 상황에서 정책의 강건성을 어떻게 향상시키는가?
- RQ5이러한 기법들의 통합은 기존 베이스라인을 능가하고 MineRL 2021 경쟁에서 승리할 수 있는가?
주요 결과
- JueWu-MC는 NeurIPS MineRL 2021 경쟁에서 가장 높은 성능 점수를 기록하여 단지 250만 개의 훈련 샘플로 신기록을 수립하였다.
- 모델은 단지 250만 개의 샘플로도 점수 100을 달성했으며, 이는 경쟁의 800만 개 샘플 제한에 비해 훨씬 적은 수준이었다.
- 절단 실험 결과 A2RL과 EBC가 DSIL보다 더 큰 성능 기여를 하였으며, A2RL은 학습 파이프라인에 더 이르고 광범위한 영향을 미쳤다.
- 민감도 맵 시각화 결과 A2RL 마스크 네트워크가 시각 입력의 동적이고 행동 관련 영역에 효과적으로 집중하고 있음을 확인하여 해석 가능성과 제어 능력을 향상시켰다.
- DSIL는 더 컴act하고 타겟된 탐색을 가능하게 했으며, PPO 및 PPO+SIL에 비해 학습 초반에 고수익 상태 분포에 집중하는 경향을 보였다.
- 이 프레임워크는 모든 이전 베이스라인보다 샘플 효율성과 작업 성능에서 뛰어난 성능을 보였으며, 계층적 계획과 고도의 표현 및 모방 학습 기법을 융합한 효과를 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.