Skip to main content
QUICK REVIEW

[논문 리뷰] ACuTE: Automatic Curriculum Transfer from Simple to Complex Environments

Yash Shukla, Christopher Thierauf|arXiv (Cornell University)|2022. 04. 11.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

ACuTE는 강화학습에서 저해상도(LF) 환경에서 고해상도(HF) 환경으로의 자동 커리큘럼 전이를 위한 새로운 프레임워크를 제안한다. 여기서는 고해상도 환경에서 직접 상호작용 없이도 단순한 환경에서 최적화된 커리큘럼을 복잡한 환경으로 매핑한다. 이 방법은 어려운 고해상도 작업, 특히 실제 로봇으로의 Sim2Real 전이를 포함하여 빠른 수렴과 향상된 점프스타트 성능을 달성하며, 도메인 적응 및 자체 플레이와 같은 기준 방법들을 능가한다.

ABSTRACT

Despite recent advances in Reinforcement Learning (RL), many problems, especially real-world tasks, remain prohibitively expensive to learn. To address this issue, several lines of research have explored how tasks, or data samples themselves, can be sequenced into a curriculum to learn a problem that may otherwise be too difficult to learn from scratch. However, generating and optimizing a curriculum in a realistic scenario still requires extensive interactions with the environment. To address this challenge, we formulate the curriculum transfer problem, in which the schema of a curriculum optimized in a simpler, easy-to-solve environment (e.g., a grid world) is transferred to a complex, realistic scenario (e.g., a physics-based robotics simulation or the real world). We present "ACuTE", Automatic Curriculum Transfer from Simple to Complex Environments, a novel framework to solve this problem, and evaluate our proposed method by comparing it to other baseline approaches (e.g., domain adaptation) designed to speed up learning. We observe that our approach produces improved jumpstart and time-to-threshold performance even when adding task elements that further increase the difficulty of the realistic scenario. Finally, we demonstrate that our approach is independent of the learning algorithm used for curriculum generation, and is Sim2Real transferable to a real world scenario using a physical robot.

연구 동기 및 목표

  • 복잡하고 고해상도(HF) 환경에서 커리큘럼 생성에 드는 높은 계산 비용을 해결하기 위해.
  • HF 도메인에서 직접 상호작용 없이도 저해상도(LF) 환경에서 생성된 커리큘럼 스키마를 HF 환경으로 전이할 수 있도록 하기 위해.
  • 어려운 HF 작업, 특히 추가적인 복잡성이 가미된 작업에서 학습 효율성과 수렴 속도를 향상시키기 위해.
  • 실제 터틀봇 로봇을 사용한 Sim2Real 전이 가능성을 입증하기 위해.
  • 커리큘럼를 생성하는 데 사용된 강화학습 알고리즘에 독립적인 성능을 보장하기 위해.

제안 방법

  • 역동성 복잡도가 감소된 단순한 저해상도(LF) 환경에서 커리큘럼를 생성하고 최적화한다.
  • 경험적 매핑 함수를 사용하여 LF 커리큘럼의 작업 파라미터를 고해상도(HF) 환경의 해당 작업에 매핑한다.
  • 작업 파라미터와 순서를 포함한 커리큘럼 스키마만을 전이하며, 고수준 작업 기술자에 기반한 작업 간 관계를 유지한다.
  • 최종 목표 작업 학습 이전에 HF 환경에서 소스 작업을 반복적으로 학습한다.
  • HF 시뮬레이션에서 동일한 정책을 사용하여 물리적 로봇에 직접 Sim2Real 배포를 수행한다.
  • 물리적 동작(예: 피드유셜리딩)으로 작업 실행을 확인함으로써 성능에 대한 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1저해상도 환경에서 최적화된 커리큘럼가 고해상도 환경으로 효과적으로 전이되어 학습 속도를 가속화할 수 있는가?
  • RQ2역동성의 차이가 크더라도 커리큘럼 전이가 어려운 고해상도 작업에서 학습 속도와 점프스타트 성능을 향상시키는가?
  • RQ3제안된 방법이 커리큘럼 생성에 사용된 강화학습 알고리즘에 독립적인가?
  • RQ4커리큘럼 전이를 통해 학습된 정책이 추가 학습 없이도 물리적 로봇에 성공적으로 배포될 수 있는가?
  • RQ5계산 비용과 학습 효율성 측면에서 커리큘럼 전이가 도메인 적응 및 기타 기준 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • ACuTE는 도메인 적응, 자체 플레이, 교사-학생 커리큘럼 기준 방법과 비교해 목표 HF 작업에서 더 빠른 수렴과 향상된 임계값 도달 시간 성능을 달성했다.
  • HF 환경에 추가적인 복잡성이 가미된 상황에서도 프레임워크는 뛰어난 점프스타트 성능을 보였다.
  • HF 환경에서 다른 알고리즘을 사용했을 때 성능 향상이 관찰됨으로써, 커리큘럼 생성에 사용된 RL 알고리즘에 독립적임을 입증했다.
  • 물리적 터틀봇에서 Sim2Real 전이가 성공했으며, 정책은 직접 배포 후 물체 파손, 회수, 제작 작업을 완료했다.
  • ACuTE의 계산 비용은 기준 방법보다 크게 낮았으며, 주로 LF 커리큘럼 최적화와 HF 소스 작업 학습에 의해 결정되는 고정 비용이 지배적이었다.
  • LF와 HF 환경 간 매핑이 완벽하지 않더라도 정성적인 전이가 관찰되어 매핑 정확도에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.