Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task curriculum learning in a complex, visual, hard-exploration domain: Minecraft

Ingmar Kanitscheider, Joost Huizinga|arXiv (Cornell University)|2021. 06. 28.
Reinforcement Learning in Robotics참고 문헌 29인용 수 9
한 줄 요약

이 논문은 복잡하고 시각적이며 어려운 탐색을 요구하는 마인크래프트 환경에서 다중 작업 훈련을 위한 학습 진도 기반 커리큘럼 강화 학습 방법을 제안한다. 작업의 학습 가능성에 따라 탐색 보너스를 동적으로 조정하고, 학습 진도를 커리큘럼 스케줄링의 지침으로 사용함으로써, 82개의 작업을 성공적으로 학습하는 데 성공하였으며, 이는 균일 샘플링 및 정적 보너스 기반 베이스라인에 비해 뚜렷하게 뛰어난 성능을 보였다.

ABSTRACT

An important challenge in reinforcement learning is training agents that can solve a wide variety of tasks. If tasks depend on each other (e.g. needing to learn to walk before learning to run), curriculum learning can speed up learning by focusing on the next best task to learn. We explore curriculum learning in a complex, visual domain with many hard exploration challenges: Minecraft. We find that learning progress (defined as a change in success probability of a task) is a reliable measure of learnability for automatically constructing an effective curriculum. We introduce a learning-progress based curriculum and test it on a complex reinforcement learning problem (called "Simon Says") where an agent is instructed to obtain a desired goal item. Many of the required skills depend on each other. Experiments demonstrate that: (1) a within-episode exploration bonus for obtaining new items improves performance, (2) dynamically adjusting this bonus across training such that it only applies to items the agent cannot reliably obtain yet further increases performance, (3) the learning-progress based curriculum elegantly follows the learning curve of the agent, and (4) when the learning-progress based curriculum is combined with the dynamic exploration bonus it learns much more efficiently and obtains far higher performance than uniform baselines. These results suggest that combining intra-episode and across-training exploration bonuses with learning progress creates a promising method for automated curriculum generation, which may substantially increase our ability to train more capable, generally intelligent agents.

연구 동기 및 목표

  • 희소 보상과 어려운 탐색 문제를 동반한 복잡하고 시각적인 환경에서 강화 학습 에이전트를 훈련시키는 도전 과제를 해결한다.
  • 에이전트의 능력 수준 변화에 따라 적응하는 자동 커리큘럼을 개발하여 샘플 효율성과 성능을 향상시킨다.
  • 다중 작업 강화 학습에서 균일한 작업 샘플링과 정적 탐색 보너스의 한계를 극복한다.
  • 성공 확률 감소를 보이는 작업을 재샘플링하여 치명적인 기억 상실을 완화한다.
  • 학습 진도가 실제 강화 학습 환경에서 커리큘럼 구성에 신뢰할 수 있는 신호가 될 수 있음을 입증한다.

제안 방법

  • 학습 가능성을 타당한 지표로 사용하기 위해, 작업의 성공 확률 변화를 시간에 따라 측정하여 학습 진도를 정의한다.
  • 한 에피소드 내에서 새로운 아이템을 획득할 경우에 보상을 주는 내부 에피소드 탐색 보너스를 구현한다.
  • 기존에 안정적으로 확보할 수 있는 아이템을 제외한 동적 탐색 보너스를 도입하여 더 어려운 목표에 집중한다.
  • 성능 향상과 악화를 모두 반영하는 이중 방향 학습 진도 커리큘럼을 설계하여 작업을 샘플링한다.
  • 성공 확률 추정치를 활용해 기억 상실 위험이 있는 작업을 재샘플링하여 치명적인 기억 상실을 줄인다.
  • 동적 탐색 보너스와 학습 진도 기반 커리큘럼을 결합하여 작업 샘플링과 탐색을 지도한다.

실험 결과

연구 질문

  • RQ1학습 진도는 현재 학습 가능한 작업을 식별하는 데 신뢰할 수 있고 실시간으로 활용 가능한 신호가 될 수 있는가?
  • RQ2에이전트의 현재 능력 수준에 맞춰 조정되는 동적 탐색 보너스는 다중 작업 학습 성능에 어떤 영향을 미치는가?
  • RQ3학습 진도 기반 커리큘럼은 어려운 탐색 환경에서 균일한 작업 샘플링에 비해 우월한 성능을 보일 수 있는가?
  • RQ4이 커리큘럼은 다중 작업 강화 학습에서 치명적인 기억 상실을 어느 정도 완화하는가?
  • RQ5동적 탐색 보너스와 학습 진도 기반 커리큘럼을 결합하면 기존 방법에 비해 유의미하게 더 많은 작업을 습득할 수 있는가?

주요 결과

  • 탐색 보너스 없이 균일 샘플링을 한 경우, 단지 17개의 작업을 달성하였으며, 더 이상 학습이 진행되지 않는 플랫팅 상태에 도달했다.
  • 정적 탐색 보너스를 추가함으로써 내부 에피소드 탐색을 장려하여 작업 달성 수가 43개로 증가하였다.
  • 기존에 안정적으로 확보할 수 있는 아이템을 제외한 동적 탐색 보너스를 적용하여 성능이 70개의 작업으로 향상되었다.
  • 균일 샘플링 대비 이중 방향 학습 진도 커리큘럼을 사용함으로써 해결된 작업 수가 82개로 증가하였다.
  • 학습 진도 기반 커리큘럼은 에이전트의 학습 곡선을 자연스럽게 따르며, 능력 습득의 최전선에 집중하였다.
  • 이중 방향 커리큘럼은 성공 확률 감소를 보이는 작업을 재샘플링하여 치명적인 기억 상실을 효과적으로 완화하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.