Skip to main content
QUICK REVIEW

[논문 리뷰] Curriculum Learning for Reinforcement Learning Domains: A Framework and Survey

Sanmit Narvekar, Bei Peng|arXiv (Cornell University)|2020. 03. 10.
Reinforcement Learning in Robotics참고 문헌 114인용 수 228
한 줄 요약

이 논문은 강화 학습에서 커리큘럼 학습에 대한 형식적 프레임워크를 제안하고, 기존 방법을 조사하며, 향후 연구를 위한 미해결 문제와 방향을 식별한다.

ABSTRACT

Reinforcement learning (RL) is a popular paradigm for addressing sequential decision tasks in which the agent has only limited environmental feedback. Despite many advances over the past three decades, learning in many domains still requires a large amount of interaction with the environment, which can be prohibitively expensive in realistic scenarios. To address this problem, transfer learning has been applied to reinforcement learning such that experience gained in one task can be leveraged when starting to learn the next, harder task. More recently, several lines of research have explored how tasks, or data samples themselves, can be sequenced into a curriculum for the purpose of learning a problem that may otherwise be too difficult to learn from scratch. In this article, we present a framework for curriculum learning (CL) in reinforcement learning, and use it to survey and classify existing CL methods in terms of their assumptions, capabilities, and goals. Finally, we use our framework to find open problems and suggest directions for future RL curriculum learning research.

연구 동기 및 목표

  • RL 작업 및 샘플에 대한 일반적이고 형식적인 커리큘럼 개념을 정의한다.
  • 표현 방식, 전이, 적응성, 평가 지표에 따라 커리큘럼 학습 접근법을 분류한다.
  • RL 커리큘럼에서의 작업 생성, 시퀀싱, 및 전이 방법에 대한 기존 방법을 조사한다.
  • RL 커리큘럼 학습에서의 격차, 미해결 문제 및 향후 방향을 식별한다.

제안 방법

  • 샘플 또는 작업 위에 방향성 비순환 그래프(DAG)로 커리큘럼을 형식화하고, 샘플 집합으로의 매핑 함수 g를 도입한다.
  • 실용적 사용의 용이성을 위해 단일 작업 커리큘럼, 작업 수준 커리큘럼, 시퀀스 커리큘럼을 구분한다.
  • 약한 전이와 강한 전이 고려를 포함하여 전이 학습 평가 지표를 커리큘럼 설정으로 확장한다.
  • 작업 생성, 표현, 전이 방법, 시퀀서, 적응성, 평가 및 적용 도메인을 포함한 일곱 차원에 따라 커리큘럼 접근법을 분류한다.
  • RL 커리큘럼에서 사용되는 작업 생성, 시퀀싱 알고리즘(시퀀싱에 중점), 전이 학습 방법을 조사한다.
  • 커리큘럼 설계를 위한 중단 기준과 비용 고려를 통해 커리큘럼을 비교하는 프레임워크를 제공한다.

실험 결과

연구 질문

  • RQ1강화 학습에서 커리큘럼은 무엇을 구성하며, RL 작업에 대해 어떻게 표현될 수 있는가?
  • RQ2RL 설정 내에서 커리큘럼을 어떻게 생성하고, 시퀀싱하며, 평가할 수 있는가?
  • RQ3커리큘럼의 다양한 작업 간에 어떤 전이 메커니즘이 사용되며, 그것이 학습에 어떤 영향을 미치는가?
  • RQ4커리큘럼을 어떻게 분류해야 하며, RL 커리큘럼 학습에서 남아 있는 미해결 문제는 무엇인가?

주요 결과

  • 샘플 또는 작업의 그래프로 표현되고 싱크 노드를 갖는 일반 커리큘럼 프레임워크가 제안된다.
  • 커리큘럼은 정적일 수도 있고 적응적일 수 있으며, 평가에는 대상 작업 성능 외에 커리큘럼 설계 비용도 반영되어야 한다.
  • 대부분의 기존 연구는 시퀀싱에 초점을 맞추고 있으며 작업 생성과 전이 방법도 조사 및 분류되었다.
  • 문헌 전체에 걸친 체계적 분류를 가능하게 하는 일곱 차원이 제안된다.
  • 커리큘럼 생성은 종종 사람에 의해 설계된 커리큘럼에 의존하며, 자동화 방법이 점점 더 탐구되고 있다.
  • RL 커리큘럼 학습을 위한 미해결 문제와 향후 방향이 식별된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.