Skip to main content
QUICK REVIEW

[논문 리뷰] MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations

Ajay Mandlekar, Soroush Nasiriany|arXiv (Cornell University)|2023. 10. 26.
Robot Manipulation and Learning인용 수 5
한 줄 요약

MimicGen은 물체 중심의 궤적 분할, 공간적 변환 및 스티칭을 통해 소수의 인간 시범을 새로운 환경에 적응시켜 대규모이고 다양한 로봇 시범 데이터셋을 합성하는 데이터 생성 시스템이다. 이는 오직 약 200개의 원천 시범만으로 18개의 작업에서 다양한 물체, 환경 및 로봇 암을 포함해 50,000개 이상의 합성 궤적을 생성함으로써 장기적이고 고정밀 작업에 대한 효과적인 모방 학습을 가능하게 하며, 인간이 애너테이션한 데이터 수준의 성능을 달성한다.

ABSTRACT

Imitation learning from a large set of human demonstrations has proved to be an effective paradigm for building capable robot agents. However, the demonstrations can be extremely costly and time-consuming to collect. We introduce MimicGen, a system for automatically synthesizing large-scale, rich datasets from only a small number of human demonstrations by adapting them to new contexts. We use MimicGen to generate over 50K demonstrations across 18 tasks with diverse scene configurations, object instances, and robot arms from just ~200 human demonstrations. We show that robot agents can be effectively trained on this generated dataset by imitation learning to achieve strong performance in long-horizon and high-precision tasks, such as multi-part assembly and coffee preparation, across broad initial state distributions. We further demonstrate that the effectiveness and utility of MimicGen data compare favorably to collecting additional human demonstrations, making it a powerful and economical approach towards scaling up robot learning. Datasets, simulation environments, videos, and more at https://mimicgen.github.io .

연구 동기 및 목표

  • 로봇 학습을 위한 대규모 인간 시범을 수집하는 데 소요되는 높은 비용과 시간을 해결하기 위해.
  • 제한된 인간 시범을 재사용하여 새로운 환경, 물체 및 로봇 하드웨어에서 다양하고 고품질의 데이터를 생성할 수 있는 일반 목적의 시스템을 개발하기 위해.
  • MimicGen에서 생성한 합성 데이터가 추가로 인간이 애너테이션한 시범과 동일하거나 이를 초월하는 성능을 내는지 평가하기 위해.
  • 실제 환경 조건, 즉 자세 추정 오차와 하드웨어 변동성에 대한 생성된 데이터의 견고성(로버스트니)을 입증하기 위해.

제안 방법

  • 시스템은 물체 간 상호작용과 공간적 관계를 기반으로 인간 시범을 물체 중심의 궤적들로 분할한다.
  • 각 새로운 환경 구성에 대해, 원천 시범을 선택하고 물체 중심 세그먼트를 새로운 물체 자세에 맞추기 위해 공간적 변환(이동, 회전)을 적용한다.
  • 변환된 세그먼트를 연결하여 로봇이 따라가고 기록할 수 있는 완전한 실행 가능한 궤적을 생성한다.
  • 특수 마커나 정밀한 자세 추적 장치가 필요 없이, 일반적인 자세 추정 기술을 사용하여 실세계 구현에 적합한 최소한의 가정으로 작동한다.
  • 랜덤성은 물체 초기화, 세그먼트 선택 및 동작 노이즈에 적용되어 다양성을 증가시키며, 이는 여러 시뮬레이션 환경과 물리적 로봇 암에 적용된다.
  • 생성된 데이터셋은 시각-운동 정책 학습을 위해 모방 학습을 통해 사용되며, 장기적이고 고정밀 작업에서 성능이 평가된다.

실험 결과

연구 질문

  • RQ1소수의 인간 시범이 새로운 환경에서 다양하고 고품질의 로봇 궤적을 효과적으로 재사용하여 생성할 수 있는가?
  • RQ2MimicGen에서 생성한 합성 데이터를 기반으로 한 모방 학습이 추가로 인간이 애너테이션한 시범을 기반으로 한 성능과 동일한가?
  • RQ3실세계 설정에서 자세 추정 오차에 대해 데이터 생성 과정이 얼마나 견고한가?
  • RQ4MimicGen은 다중 부품 조립 및 커피 제조와 같은 장기적이고 고정밀 조작 작업으로 일반화될 수 있는가?
  • RQ5합성 데이터 기반으로 학습된 정책의 성능은 다양한 데이터 생성 시드와 환경 변동성에 대해 안정적인가?

주요 결과

  • MimicGen은 약 200개의 인간 시범만을 사용하여 다양한 환경, 물체 및 로봇 암을 포함한 18개 작업에서 50,000개 이상의 고품질 시범을 생성했다.
  • MimicGen에서 생성한 데이터 기반으로 학습된 정책는 인간 애너테이션 데이터 기반으로 학습된 정책와 유사한 성공률를 달성했다—예를 들어, Square 작업(DGR)에서 96.7%의 성공률, Coffee(SR)에서 90.7%의 성공률를 기록하여 인간 데이터 기반 베이스라인을 충족하거나 초월했다.
  • 시스템은 자세 추정 오차에 대해 뛰어난 견고성을 보였다: 10 mm/10도의 노이즈가 존재하더라도 성공률가 높게 유지되었다—예를 들어, Square D0에서 84.7%, Square D2에서 39.3%의 성공률를 기록하여 실세계 적용 가능성을 입증했다.
  • 다양한 시드에 따른 데이터 생성 성공률 차이는 1% 미만이었으며(예: Stack Three에서 71.7±0.3%에서 69.3±0.4%로 변동), 정책 성공률는 보고된 결과와 2% 이내로 변동하여 낮은 분산과 재현 가능성을 보였다.
  • 실세계 구현에서 MimicGen은 특수 태그나 정밀한 자세 추적 장치 없이도 기능적인 궤적을 성공적으로 생성했으며, 일반적인 물체 자세 추정 기술에 의존했다.
  • 이 방법은 고비용의 인간 데이터 수집의 필요성을 크게 줄였으며, 최종 작업 성능에서 MimicGen의 합성 데이터는 추가로 수집된 인간 시범의 성능을 충족하거나 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.