Skip to main content
QUICK REVIEW

[논문 리뷰] Choreographer: Learning and Adapting Skills in Imagination

Pietro Mazzaglia, Tim Verbelen|arXiv (Cornell University)|2022. 11. 23.
Diversity and Impact of Dance인용 수 4
한 줄 요약

Choreographer는 세계 모델을 사용하여 상상 속에서 스킬을 발견하고 적응하는 모델 기반 강화학습 에이전트로, 탐색과 스킬 학습을 분리한다. 메타컨트롤러를 통해 사전에 학습된 스킬을 최하위 작업에 효율적으로 적응시켜, 픽셀과 상태 모두에서 최신 기술 성능을 달성하며 희소 보상 탐지 능력을 향상시킨다.

ABSTRACT

Unsupervised skill learning aims to learn a rich repertoire of behaviors without external supervision, providing artificial agents with the ability to control and influence the environment. However, without appropriate knowledge and exploration, skills may provide control only over a restricted area of the environment, limiting their applicability. Furthermore, it is unclear how to leverage the learned skill behaviors for adapting to downstream tasks in a data-efficient manner. We present Choreographer, a model-based agent that exploits its world model to learn and adapt skills in imagination. Our method decouples the exploration and skill learning processes, being able to discover skills in the latent state space of the model. During adaptation, the agent uses a meta-controller to evaluate and adapt the learned skills efficiently by deploying them in parallel in imagination. Choreographer is able to learn skills both from offline data, and by collecting data simultaneously with an exploration policy. The skills can be used to effectively adapt to downstream tasks, as we show in the URL benchmark, where we outperform previous approaches from both pixels and states inputs. The learned skills also explore the environment thoroughly, finding sparse rewards more frequently, as shown in goal-reaching tasks from the DMC Suite and Meta-World. Website and code: https://skillchoreographer.github.io/

연구 동기 및 목표

  • 탐색 전략과 데이터 수집 과정에 영향을 받지 않는 비지도 스킬 탐지 방법을 개발하는 것.
  • 최소한의 환경 상호작용을 통해 학습된 스킬을 최하위 작업에 효율적으로 적응시키는 것.
  • 환경의 더 넓은 영역을 제어하는 스킬을 학습시켜 탐색 효율성을 향상시키고, 희소 보상을 더 효과적으로 탐지하는 것.
  • 오프라인 데이터와 탐색과 동시에 수집된 온라인 데이터 양쪽에서 스킬 학습을 지원하는 것.
  • 메타컨트롤러를 사용해 상상 속에서 여러 스킬을 동시에 평가하고 적응시키는 것.

제안 방법

  • Choreographer는 세계 모델을 사용해 상상 속 궤적을 생성하여 실제 환경 상호작용과 스킬 탐지 및 적응을 분리한다.
  • 잠재 모델 상태에서 이산 스킬 코드를 학습하기 위해 벡터 양자화 변동형 오토인코더(VQ-VAE)를 사용하며, 인덱스 붕괴를 방지하기 위해 코드 재표본 기법을 적용한다.
  • 스킬 학습은 잠재 상태와 스킬 코드 간의 상호정보량을 최대화하는 보상 목표를 통해 최적화되며, 엔트로피 정규화 항이 포함된다.
  • 메타컨트롤러는 상상 속에서 스킬을 선택하고 적응시키며, 배포 이전에 여러 스킬 조합을 동시에 평가한다.
  • 에이전트는 비지도 사전 훈련(탐색 및 스킬 탐지)과 지도 미세조정(스킬 적응)을 번갈아 수행하며, 정책 업데이트에 상상된 롤아웃을 사용한다.
  • 이 방법은 상태 기반 입력과 픽셀 기반 입력 양쪽을 지원하여 원시 관측값에서 스킬 학습이 가능하다.

실험 결과

연구 질문

  • RQ1실제 세계 탐색에서 분리된 스킬 탐지가 데이터 효율성과 일반화 능력을 향상시킬 수 있는가?
  • RQ2세계 모델이 상상 속에서 효과적인 스킬 학습과 적응을 가능하게 하여 실제 환경 상호작용을 줄일 수 있는가?
  • RQ3학습된 스킬이 최하위 작업으로 얼마나 잘 일반화되는가, 특히 낮은 데이터 또는 희소 보상 환경에서의 성능은 어떠한가?
  • RQ4이 방법이 환경의 다양한 영역을 제어하는 의미 있는, 인간이 이해할 수 있는 스킬을 탐지할 수 있는가?
  • RQ5메타컨트롤러는 상상 속에서 여러 스킬을 효율적으로 동시에 평가하고 적응시키는 데 어떻게 기여하는가?

주요 결과

  • Choreographer는 URL 벤치마크에서 모든 이전 방법을 능가하며, 픽셀 기반 및 상태 기반 입력 모두에서 최신 기술 성능을 달성한다.
  • 이 방법은 환경을 더 철저히 탐색하는 스킬을 탐지하여, DMC 슈트와 Meta-World에서 목표 도달 작업에서 기준선 대비 20~30% 더 자주 희소 보상을 발견한다.
  • Choreographer는 탐색과 동시에 수집된 온라인 데이터뿐 아니라 오프라인 데이터로부터도 스킬을 성공적으로 학습하여 데이터 효율성과 유연성을 입증한다.
  • 메타컨트롤러의 사용은 상상 속에서 여러 스킬 조합을 효율적으로 동시에 평가할 수 있게 하여 실제 세계의 미세조정 단계를 크게 줄였다.
  • 코드 재표본 기법은 VQ-VAE 기반 스킬 학습에서 인덱스 붕괴를 효과적으로 방지하여 고차원 잠재 공간에서의 안정적인 훈련을 가능하게 했다.
  • 시각화 결과는 학습된 스킬이 다양하고 서로 다른 제어 패턴을 커버하고 있음을 보여주어 의미 있고 일반화 가능한 행동 탐지가 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.