Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Automatic Curricula via Self-Supervised Active Domain Randomization

Sharath Chandra Raparthy, Bhairav Mehta|arXiv (Cornell University)|2020. 02. 18.
Reinforcement Learning in Robotics참고 문헌 33인용 수 5
한 줄 요약

이 논문은 자기지도 학습을 통한 능동적 도메인 랜덤화(Self-Supervised Active Domain Randomization, SS-ADR)를 제안한다. 이 방법은 자기연합(self-play)을 통해 목표 공간과 환경 공간에서 함께 진화하는 커리큘럼을 설계하며, 자기지도 보상 신호를 생성한다. 점점 더 어려운 목표와 랜덤화된 환경을 동시에 최적화함으로써, 다양한 로봇 작업에서 낮은 변동성을 보이며 최신 기술 수준의 제로샷 sim2real 전이 성능을 달성한다.

ABSTRACT

Goal-directed Reinforcement Learning (RL) traditionally considers an agent interacting with an environment, prescribing a real-valued reward to an agent proportional to the completion of some goal. Goal-directed RL has seen large gains in sample efficiency, due to the ease of reusing or generating new experience by proposing goals. One approach,self-play, allows an agent to "play" against itself by alternatively setting and accomplishing goals, creating a learned curriculum through which an agent can learn to accomplish progressively more difficult goals. However, self-play has been limited to goal curriculum learning or learning progressively harder goals within a single environment. Recent work on robotic agents has shown that varying the environment during training, for example with domain randomization, leads to more robust transfer. As a result, we extend the self-play framework to jointly learn a goal and environment curriculum, leading to an approach that learns the most fruitful domain randomization strategy with self-play. Our method, Self-Supervised Active Domain Randomization(SS-ADR), generates a coupled goal-task curriculum, where agents learn through progressively more difficult tasks and environment variations. By encouraging the agent to try tasks that are just outside of its current capabilities, SS-ADR builds a domain randomization curriculum that enables state-of-the-art results on varioussim2real transfer tasks. Our results show that a curriculum of co-evolving the environment difficulty together with the difficulty of goals set in each environment provides practical benefits in the goal-directed tasks tested.

연구 동기 및 목표

  • 외부 보상 신호를 자기지도 내재 신호로 대체함으로써 목표 지향 강화학습에서 보상 설계 및 커리큘럼 설계의 과제를 해결한다.
  • 기존의 커리큘럼 학습과 도메인 랜덤화의 한계를 극복하기 위해 목표 변화 공간과 환경 변화 공간을 동시에 최적화한다.
  • 에이전트의 현재 능력에 맞게 적응하는 커리큘럼을 학습하여 현실성과의 격차를 줄임으로써 로봇 강화학습에서 강건한 sim2real 전이를 가능하게 한다.
  • 수동적인 랜덤화 범위 조정을 제거하고, 능동적 탐색을 통해 커리큘럼이 자가 캘리브레이션되도록 한다.
  • 최적의 작업 난이도와 환경 다양성을 동시에 학습하는 이중 최적화 프레임워크를 개발하여 정책 일반화 성능을 향상시킨다.

제안 방법

  • 문제를 이중 최적화로 공식화한다: 내부 루프는 주어진 환경-목표 쌍에 대해 정책 성능을 최적화하고, 외부 루프는 커리큘럼 진행을 안내하기 위해 자기연합 기반 지표를 최대화한다.
  • 두 에이전트(Alice와 Bob) 간의 비대칭 자기연합을 사용하여 상대적 성능 기반의 자기지도 보상 신호를 생성함으로써 점점 더 어려운 작업 탐색을 장려한다.
  • 능동적 도메인 랜덤화(ADR)를 자기연합과 통합하여 가장 정보가 많은 환경 변화를 동적으로 샘플링함으로써, 생산성 낮거나 불안정한 설정을 피한다.
  • 자기연합 결과에서 유도된 단일 자기지도 보상 신호를 활용해 목표 및 환경 커리큘럼의 진화를 동시에 안내함으로써 외부 보상 형상 조정이 필요 없도록 한다.
  • 고차원의 연속 행동 공간에서 안정적인 학습을 가능하게 하기 위해 SVPG(Soft Actor-Critic with Value Policy Gradient)를 정책 최적화에 적용한다.
  • 에이전트가 물리적으로 불안정하거나 해결 불가능한 환경(예: 극단적인 랜덤화 계수)을 피하도록 허용함으로써 자가 캘리브레이션을 구현하며, 학습 중 랜덤화 범위를 적응적으로 조정한다.

실험 결과

연구 질문

  • RQ1자기연합에서 유도된 자기지도 보상 신호가 목표 지향 강화학습에서 목표 공간과 환경 공간 양쪽 모두의 커리큘럼 학습을 효과적으로 이끄는가?
  • RQ2환경과 목표 난이도를 함께 진화시키는 것이 정적 또는 독립적으로 최적화된 커리큘럼에 비해 더 뛰어난 정책의 강건성과 sim2real 전이 성능을 제공하는가?
  • RQ3수동적인 랜덤화 범위 조정 없이도 메서드가 생산성 낮거나 불안정한 환경 설정을 자가 캘리브레이션하여 피할 수 있는가?
  • RQ4학습 안정성, 수렴 속도, 제로샷 전이 성능 측면에서 SS-ADR는 표준 도메인 랜덤화와 능동적 도메인 랜덤화에 비해 어떻게 비교되는가?
  • RQ5이중 커리큘럼 학습 프레임워크는 다양한 실제 환경에서 정책 성능의 변동성을 어느 정도 감소시키는가?

주요 결과

  • SS-ADR는 테스트된 모든 로봇 작업에서 최신 기술 수준의 제로샷 sim2real 전이 성능를 달성했으며, 시뮬레이션 및 실제 환경 모두에서 모든 기준 모델을 앞서간다.
  • 표준 도메인 랜덤화와 능동적 도메인 랜덤화에 비해 훈련 변동성이 크게 감소하여 더 안정적인 정책 학습을 보였다.
  • 캘리브레이션되지 않은 랜덤화 범위에서 SS-ADR는 물리적으로 불안정한 환경(예: 랜덤화 계수 0.05 이하)을 성공적으로 피했으며, UDR(균일 도메인 랜덤화)는 이러한 영역을 피하지 못했다.
  • 캘리브레이션된 범위에서 SS-ADR는 UDR보다 더 효과적인 커리큘럼을 학습했으며, 더 어려운 작업 영역에 더 집중적으로 샘플링하는 것으로 나타나, 더 나은 커리큘럼 진행을 보였다.
  • 자기연합 결과에서 유도된 자기지도 보상은 외부 보상 형상 조정 없이도 효과적인 커리큘럼 진화를 가능하게 하여, 복잡한 작업 공간에서 내재적이고 자가 주도적인 학습의 가능성을 입증했다.
  • 이중 최적화 프레임워크는 목표 및 환경 커리큘럼을 성공적으로 함께 진화시켜, 최소한의 피팅 튜닝으로도 다양한 실제 환경에서 일반화된 정책을 도출했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.