Skip to main content
QUICK REVIEW

[논문 리뷰] MoCapAct: A Multi-Task Dataset for Simulated Humanoid Control

Nolan Wagener, Andrey Kolobov|arXiv (Cornell University)|2022. 08. 15.
Human Pose and Action Recognition인용 수 4
한 줄 요약

MoCapAct는 dm_control 히ュ먼로이드 환경에서 3.5시간에 달하는 모션 캡처 데이터를 추적하는 전문 정책을 포함하는 대규모 고품질 데이터셋을 제공하며, 복잡한 이동 및 동작 보완 학습을 효율적으로 가능하게 한다. 이 데이터셋을 통해 계층적 정책 및 자동회귀 GPT 모델을 학습시켜 클립 간 일반화가 가능하고, 동작 프롬프트로부터 자연스럽고 장기적인 운동을 생성할 수 있다.

ABSTRACT

Simulated humanoids are an appealing research domain due to their physical capabilities. Nonetheless, they are also challenging to control, as a policy must drive an unstable, discontinuous, and high-dimensional physical system. One widely studied approach is to utilize motion capture (MoCap) data to teach the humanoid agent low-level skills (e.g., standing, walking, and running) that can then be re-used to synthesize high-level behaviors. However, even with MoCap data, controlling simulated humanoids remains very hard, as MoCap data offers only kinematic information. Finding physical control inputs to realize the demonstrated motions requires computationally intensive methods like reinforcement learning. Thus, despite the publicly available MoCap data, its utility has been limited to institutions with large-scale compute. In this work, we dramatically lower the barrier for productive research on this topic by training and releasing high-quality agents that can track over three hours of MoCap data for a simulated humanoid in the dm_control physics-based environment. We release MoCapAct (Motion Capture with Actions), a dataset of these expert agents and their rollouts, which contain proprioceptive observations and actions. We demonstrate the utility of MoCapAct by using it to train a single hierarchical policy capable of tracking the entire MoCap dataset within dm_control and show the learned low-level component can be re-used to efficiently learn downstream high-level tasks. Finally, we use MoCapAct to train an autoregressive GPT model and show that it can control a simulated humanoid to perform natural motion completion given a motion prompt. Videos of the results and links to the code and dataset are available at https://microsoft.github.io/MoCapAct.

연구 동기 및 목표

  • 모션 캡처 데이터 추적을 위한 사전 학습된 전문 정책을 제공하여 시뮬레이션 히ュ먼로이드 제어 분야의 연구 접근 장벽을 낮추기 위해.
  • 모션 캡처 데이터에서 학습한 저수준 스킬을 재사용하여 고수준 행동을 효율적으로 학습시키기 위해.
  • MoCapAct 롤아웃을 기반으로 GPT 기반 정책을 훈련시켜 생성적 동작 보완을 지원하기 위해.
  • 고품질의 모션 캡처 추적 정책과 롤아웃을 공개하여 더 넓은 연구 목적에 기여하기 위해.
  • 강화학습을 통해 다중 클립 정책 및 후행 작업에 대한 데이터셋의 유용성을 입증하기 위해.

제안 방법

  • dm_control 환경에서 개별 모션 캡처 클립을 추적하도록 딥 강화학습 에이전트를 훈련시켜 각 클립에 대한 전문 정책을 생성하기.
  • 각 전문 정책에서 노이즈가 첨가된 롤아웃(관측치 및 행동)을 수집하여 MoCapAct 데이터셋을 구성하기.
  • 공통된 저수준 구성 요소를 가진 계층적 정책을 MoCapAct 롤아웃을 기반으로 훈련시켜 동시에 모든 클립을 추적하기.
  • 강화학습을 통해 후행 작업에 대한 계층적 정책의 저수준 구성 요소를 미세조정하여 빠른 적응을 가능하게 하기.
  • 관측치와 전문 행동의 32단계 시퀀스를 기반으로 자동회귀 GPT 모델을 훈련시어 동작 프롬프트로부터 동작 보완을 수행하기.
  • 롤아웃 생성을 통한 GPT 정책 평가를 수행하고, 주성분 분석(PCA) 투영을 사용해 에피소드 길이와 운동 유사도를 측정하기.

실험 결과

연구 질문

  • RQ1공통된 저수준 정책 구성 요소를 사용하여 단일 계층적 정책이 동시에 여러 모션 캡처 클립을 추적할 수 있는가?
  • RQ2MoCapAct에서 학습한 저수준 정책이 강화학습을 통해 새로운 후행 작업에 효과적으로 미세조정될 수 있는가?
  • RQ3GPT 기반 모델이 MoCapAct 데이터를 기반으로 짧은 동작 프롬프트로부터 장기적인 자연스러운 히ュ먼로이드 운동을 생성할 수 있는가?
  • RQ4GPT 정책은 미리 보지 않은 클립에 얼마나 잘 일반화되는가? 생성된 운동의 길이 분포는 어떠한가?
  • RQ5생성된 운동이 원본 모션 캡처 클립의 운동학적 패턴과 얼마나 유사한가?

주요 결과

  • MoCapAct 데이터셋은 dm_control 환경에서 여러 클립에 걸쳐 3.5시간의 모션 캡처 데이터를 성공적으로 추적하는 전문 정책를 포함한다.
  • MoCapAct 롤아웃을 기반으로 훈련된 단일 계층적 정책는 고려된 모든 모션 캡처 클립을 추적할 수 있으며, 다중 클립 일반화가 효과적으로 이루어졌음을 보여준다.
  • 계층적 정책의 저수준 구성 요소는 강화학습을 통해 새로운 후행 작업을 효율적으로 학습할 수 있다.
  • GPT 기반 정책는 평균 에피소드 길이가 5.47초(프롬프트 길이의 1.15배)인 장기적인 운동 생성을 잘 수행하며 뛰어난 성능을 보인다.
  • PCA 투영 분석 결과, GPT로 생성된 행동은 종종 원본에서 재현된 운동 패턴을 반복하지만, 프롬프트의 모호성으로 인해 가끔 편차가 발생한다.
  • GPT 모델은 이동 동작과 비이동 동작을 포함한 다양한 클립에 걸쳐 일반화 성능이 우수하며, 훈련 세트와 검증 세트 모두에서 일관된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.