Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations

Ajay Mandlekar, Danfei Xu|arXiv (Cornell University)|2020. 03. 13.
Reinforcement Learning in Robotics참고 문헌 36인용 수 17
한 줄 요약

이 논문은 인간의 시연에서 교차하는 상태를 활용하여 미지의 장기 환경에서의 조작 작업으로 일반화할 수 있도록 돕는 두 단계의 오프라인 시뮬레이션 학습 프레임워크인 일반화를 통한 모방(GTI)을 제안한다. 먼저 궤적의 교차점을 통해 다양한 행동을 생성하는 확률적 정책을 훈련한 후, 이러한 롤아웃을 기반으로 목표 조건부 정책을 미세 조정함으로써 GTI는 실제 로봇 조작 작업에서 새로운 시작-목표 조합에서 50% 이상의 성공률을 달성한다.

ABSTRACT

Imitation learning is an effective and safe technique to train robot policies in the real world because it does not depend on an expensive random exploration process. However, due to the lack of exploration, learning policies that generalize beyond the demonstrated behaviors is still an open challenge. We present a novel imitation learning framework to enable robots to 1) learn complex real world manipulation tasks efficiently from a small number of human demonstrations, and 2) synthesize new behaviors not contained in the collected demonstrations. Our key insight is that multi-task domains often present a latent structure, where demonstrated trajectories for different tasks intersect at common regions of the state space. We present Generalization Through Imitation (GTI), a two-stage offline imitation learning algorithm that exploits this intersecting structure to train goal-directed policies that generalize to unseen start and goal state combinations. In the first stage of GTI, we train a stochastic policy that leverages trajectory intersections to have the capacity to compose behaviors from different demonstration trajectories together. In the second stage of GTI, we collect a small set of rollouts from the unconditioned stochastic policy of the first stage, and train a goal-directed agent to generalize to novel start and goal configurations. We validate GTI in both simulated domains and a challenging long-horizon robotic manipulation domain in the real world. Additional results and videos are available at https://sites.google.com/view/gti2020/ .

연구 동기 및 목표

  • 제한된 전문가 시범으로 인해 일반화가 어려운 장기 환경에서의 로봇 조작 작업에 대한 시뮬레이션 학습의 도전 과제를 해결한다.
  • 탐색 부족으로 인해 표준 시뮬레이션 학습 방법이 시범으로 제공된 행동 외로 일반화하지 못하는 한계를 극복한다.
  • 특히 공통 상태에서 교차하는 궤적을 통해 실제 작업의 잠재적 구조적 패턴을 활용하여 구성적 행동 일반화를 가능하게 한다.
  • 다시 훈련이나 인간에 의한 작업 사양 주석이 필요 없이 실제 물리적 로봇에 적용 가능한 확장성 있고 데이터 효율적인 프레임워크를 개발한다.
  • 확률적 정책으로부터 자가 생성된 롤아웃이 원본 시범만으로 직접 모방하는 것보다 목표 지향적 정책 학습에 더 강력한 지도를 제공할 수 있음을 입증한다.

제안 방법

  • 장기 환경 작업에 특화된 교차적 구조를 지닌 작업을 위해 RoboTurk 인터페이스를 사용해 원격 제어를 통해 인간 시범을 수집한다.
  • 첫 번째 단계에서 현재 상태를 조건으로 향후 관측의 분포를 모델링하기 위해 조건부 변동형 자동차오더(기본형 cVAE)를 훈련하며, 다중 모달성과 다양성을 유도하기 위해 가우시안 믹스처 모델(GMM) 사전을 사용한다.
  • 첫 번째 단계에서 cVAE의 잠재변수를 사용해 임의의 상태에서 다각도의 닫힘 루프 시각-운동 행동을 생성하는 목표 조건부 저수준 정책을 훈련한다.
  • 첫 번째 단계의 조건 없음 확률적 정책으로부터 롤아웃을 수집하여 자가 생성된 다양한 궤적 데이터셋을 구성한다.
  • 두 번째 단계에서 자가 생성된 롤아웃을 기반으로 목표 조건부 행동 복제(GCBC)를 사용해 목표 지향적 정책을 미세 조정함으로써 새로운 시작 및 목표 설정으로의 일반화를 가능하게 한다.
  • 롤아웃 중에 cVAE 사전을 사용해 다양한 잠재변수를 샘플링하여 궤적의 교차점을 활용함으로써 새로운 목표 상태 탐색을 장려한다.

실험 결과

연구 질문

  • RQ1소수의 인간 시범으로 훈련된 정책이 장기 환경 조작 작업에서 새로운 시작 및 목표 상태 조합으로 일반화할 수 있는가?
  • RQ2상태 공간 내 궤적의 교차점을 활용함으로써 추가 시범이나 주석 없이 효과적인 구성적 행동 일반화를 달성할 수 있는가?
  • RQ3확률적 정책로부터 자가 생성된 롤아웃이 원본 시범을 직접 모방하는 것보다 목표 지향적 시뮬레이션 학습에 더 강력한 지도를 제공하는가?
  • RQ4두 단계의 GTI 프레임워크가 복잡한 다단계 작업을 포함한 실제 로봇 조작 영역에서 얼마나 효과적인가?
  • RQ5실제 작업의 교차적 구조—다른 작업 궤적이 공통 상태에서 수렴하는 방식—가 시뮬레이션 학습에서 일반화를 지원하는 데 얼마나 기여하는가?

주요 결과

  • Stage 1 GTI 정책은 $A_0$ 작업 인스턴스(빵이 테이블 위에 놓여 있는 경우)에서 71.4%의 성공률을 기록했으며, 성공적인 롤아웃은 $A_G$와 $B_G$ 목표 모두에 도달했다.
  • 다른 $B_0$ 작업 인스턴스(빵이 닫힌 용기에 들어 있는 경우)에서는 Stage 1 정책이 46.7%의 성공률을 기록했으며, 성공한 롤아웃 중 42%가 새로운 목표 설정에 도달했다.
  • Stage 2 목표 지향적 GTI 정책은 모든 네 가지 시작-목표 조합에서 50% 이상의 성공률을 기록했으며, $A_0$에서 $B_G$ 및 $B_0$에서 $A_G$와 같은 새로운 조합도 포함되었다.
  • 원본 시범으로 훈련된 GCBC보다 GTI 정책가 더 뛰어난 성능을 보였으며, 이는 자가 생성된 다양한 롤아웃이 목표 지향적 정책 학습에 더 강력한 지도를 제공한다는 것을 입증한다.
  • 이 방법은 시뮬레이션 환경과 실제 주방 조작 환경 모두에서 새로운 작업 설정으로의 일반화에 성공하여, 그 탄탄함과 확장성을 입증했다.
  • 실제 작업의 교차적 구조—다른 작업 궤적이 공통 상태에서 수렴하는 방식—가 구성적 일반화를 가능하게 하는 데 핵심적인 역할을 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.