Skip to main content
QUICK REVIEW

[논문 리뷰] From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data

Zichen Jeff Cui, Y. N. Wang|arXiv (Cornell University)|2022. 10. 18.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 보상 또는 온라인 상호작용 없이, 캘리브레이션되지 않은 비전문가 인간의 플레이 데이터에서 작업별로 특화된 로봇 행동을 학습하는 트랜스포머 기반 방법인 조건부 행동 트랜스포머(C-BeT)를 소개한다. 행동 이산화와 미래 목표 조건부 처리를 조합함으로써 C-BeT는 이전 연구 대비 평균 45.7% 향상된 성능을 달성했으며, 순수하게 오프라인 시각 및 프로피어셉티브 데이터에서 실제 세계 정책을 성공적으로 학습시켰다.

ABSTRACT

While large-scale sequence modeling from offline data has led to impressive performance gains in natural language and image generation, directly translating such ideas to robotics has been challenging. One critical reason for this is that uncurated robot demonstration data, i.e. play data, collected from non-expert human demonstrators are often noisy, diverse, and distributionally multi-modal. This makes extracting useful, task-centric behaviors from such data a difficult generative modeling problem. In this work, we present Conditional Behavior Transformers (C-BeT), a method that combines the multi-modal generation ability of Behavior Transformer with future-conditioned goal specification. On a suite of simulated benchmark tasks, we find that C-BeT improves upon prior state-of-the-art work in learning from play data by an average of 45.7%. Further, we demonstrate for the first time that useful task-centric behaviors can be learned on a real-world robot purely from play data without any task labels or reward information. Robot videos are best viewed on our project website: https://play-to-policy.github.io

연구 동기 및 목표

  • 비전문가가 수집한 캘리브레이션되지 않은 다중 모odal 및 노이지 로봇 플레이 데이터에서 작업별로 특화된 행동을 학습하는 데 도전하는 것.
  • 작업별 보상, 레이블, 또는 온라인 환경 상호작용 없이도 로봇에서 조건부 행동 생성을 가능하게 하는 것.
  • 자연어 처리 및 비전 분야에서 널리 사용되는 대규모 생성 모델의 성공을 오프라인 비정형 데이터를 사용한 로봇 정책 학습으로 확장하는 것.
  • 모의 환경과 실제 로봇에서 원시 인간 시범 데이터로부터 고성능의 목표 조건부 정책을 직접 학습할 수 있음을 보여주는 것.

제안 방법

  • C-BeT는 행동 트랜스포머(BeT)에서 유도된 트랜스포머 아키텍처를 사용하여 행동 이산화를 통해 연속적인 동작을 모델링함으로써 고차원 제어 출력에 대한 시퀀스 모델링을 가능하게 한다.
  • 미래 목표 상태에 따라 정책 생성을 조건화함으로써, 원하는 결과로 이어지는 동작을 예측할 수 있도록 한다. 이는 Play-GCBC와 유사한 방식이다.
  • 모델은 보상 형상 조정이나 보상 함수가 필요 없는 오프라인 인간 상호작용 롤아웃 데이터를 끝에서 끝까지 훈련한다.
  • 시각적 관측치와 프로피어셉티브 피드백을 입력으로 사용함으로써, 인간이 레이블링한 목표 없이도 시각 기반 정책 학습이 가능하다.
  • 동일한 목표에 도달하는 다양한 궤적을 모델링함으로써 다중 모달 행동 생성을 지원하며, 분포 이질성에 대한 강건성을 향상시킨다.
  • 대규모 캘리브레이션되지 않은 플레이 데이터에서 자기지도 학습 방식으로 훈련되며, 실제 세계 구현에 스케일이 가능하다.

실험 결과

연구 질문

  • RQ1조건부 생성 모델은 보상 신호 없이 순수하게 오프라인 캘리브레이션되지 않은 인간 플레이 데이터에서 능력 있는 작업별 행동을 학습할 수 있는가?
  • RQ2보상 조건부 또는 행동 복제 기반 기준 대비, 미래 조건부 행동 생성 방식은 미리 보지 않은 목표에서 일반화 및 성능 측면에서 어떻게 비교되는가?
  • RQ3행동 이산화를 갖춘 트랜스포머 기반 모델은 로봇 조작 작업에서 다양한 다중 모달 궤적에 대해 얼마나 잘 일반화되는가?
  • RQ4이러한 모델은 오직 시각적 및 프로피어셉티브 관측치만을 사용해 캘리브레이션되지 않은 인간 시범 데이터에서 실제 세계 로봇 작업에서 고성능을 달성할 수 있는가?

주요 결과

  • C-BeT는 캘리브레이션되지 않은 플레이 데이터에서 학습할 때 시뮬레이션 벤치마크에서 이전 최고 성능 기법 대비 평균 45.7% 향상된 성능을 달성했다.
  • 모델은 인간의 플레이 데이터 4.5시간 분량만으로도 프랑카 로봇에서 시각 정책을 성공적으로 학습했으며, 인간 레이블링이나 보상 신호 없이도 가능했다.
  • 블록 밀기 및 주방 작업과 같은 다중 모달 작업에서, C-BeT는 새로운 방해 물체와 목표 구성에 대해 일반화하여 분포 이질성에 대한 강건성을 입증했다.
  • 특히 고차원 시각 환경에서, 표준 행동 복제 및 보상 조건부 트랜스포머보다 제로샷 목표 일반화에서 성능이 뛰어나다.
  • C-BeT는 노이지이고 비전문가가 기록한 데이터일지라도 오프라인 데이터만으로도 대규모 다중 모달 행동 생성이 로봇 분야에서 가능하다는 것을 입증했다.
  • 이 방법은 온라인 미세조정 없이도 작업별 정책의 실제 세계 구현을 가능하게 하여 데이터 및 엔지니어링 오버헤드를 크게 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.