[논문 리뷰] Error-Aware Imitation Learning from Teleoperation Data for Mobile Manipulation
이 논문은 모바일 조작에서 고품질 인간 시범을 수집하기 위한 신규 텔레옵에이션 시스템인 MoMaRT를 제안하고, 분포 외 상태를 탐지하기 위해 시각-운동 정책와 학습된 오류 검출기를 조합한 오류 인식형 임itation 러닝 프레임워크를 도입한다. 시뮬레이션된 주방 환경에서 새로운 1200개의 시범 데이터셋을 기반으로 훈련된 방법은 다단계 작업 전반에서 45% 이상의 작업 성공률과 85% 이상의 오류 탐지 정확도를 달성한다.
In mobile manipulation (MM), robots can both navigate within and interact with their environment and are thus able to complete many more tasks than robots only capable of navigation or manipulation. In this work, we explore how to apply imitation learning (IL) to learn continuous visuo-motor policies for MM tasks. Much prior work has shown that IL can train visuo-motor policies for either manipulation or navigation domains, but few works have applied IL to the MM domain. Doing this is challenging for two reasons: on the data side, current interfaces make collecting high-quality human demonstrations difficult, and on the learning side, policies trained on limited data can suffer from covariate shift when deployed. To address these problems, we first propose Mobile Manipulation RoboTurk (MoMaRT), a novel teleoperation framework allowing simultaneous navigation and manipulation of mobile manipulators, and collect a first-of-its-kind large scale dataset in a realistic simulated kitchen setting. We then propose a learned error detection system to address the covariate shift by detecting when an agent is in a potential failure state. We train performant IL policies and error detectors from this data, and achieve over 45% task success rate and 85% error detection success rate across multiple multi-stage tasks when trained on expert data. Codebase, datasets, visualization, and more available at https://sites.google.com/view/il-for-mm/home.
연구 동기 및 목표
- 이동 및 조작을 병합하는 복잡성으로 인해 모바일 조작을 위한 고품질 인간 시범을 수집하는 데 도전 과제가 존재함을 해결하기 위해.
- 정책 실패를 유도하는 분포 외 상태를 탐지함으로써 임itation 러닝에서 공변수 이동 문제를 극복하기 위해.
- 운영자가 로봇가 감지한 시각 입력 자료에만 제한되는, 확장 가능하고 현실적인 텔레옵에이션 시스템을 개발하여 자연스럽고 일반화 가능한 시범을 확보하기 위해.
- 시각-운동 정책와 학습된 오류 검출기를 통합하여 배포 시의 내구성을 향상시키기 위한 통합 프레임워크를 훈련하기 위해.
- 실세계 배포를 위한 소수의 시범 데이터를 활용한 파라미터 조정 및 시뮬레이션에서 실제 세계로의 전이 잠재력을 입증하기 위해.
제안 방법
- 로봇의 내장 카메라만을 사용하여 실시간으로 이동 및 조작을 동시에 제어할 수 있는 스마트폰 기반 텔레옵에이션 인터페이스인 MoMaRT를 도입한다.
- 고정밀 렌더링과 센서 정밀도를 갖춘 iGibson를 사용하여 현실감 있는 시뮬레이션 주방 환경에서 다섯 개의 장기 작업에 걸쳐 1200개 이상의 시범 데이터셋을 수집한다.
- 전문가 시범 데이터를 기반으로 시각 기반의 임itation 러닝 정책을 훈련하며, 입력은 RGB-D 이미지와 레이저 스캔 포인트 클라우드로 구성된다.
- 변동형 오토인코더에서의 복원 오차를 사용하여 추론 중에 분포 외 상태를 식별하는 학습된 오류 검출기를 설계한다.
- 실행 중에 오류 검출기를 통합하여 실패 상태가 탐지되면 실행을 중단함으로써 불안정한 행동을 방지한다.
- 도메인 랜덤라이제이션과 분석 실험을 통해 내구성과 일반화 능력을 평가하며, 이동된 도메인에서 소수의 시범 데이터를 활용한 파라미터 조정도 수행한다.
실험 결과
연구 질문
- RQ1로봇의 시각적 시점에만 제한된 인간 운영자를 갖는 텔레옵에이션 시스템이 모바일 조작을 위한 더 현실적이고 일반화 가능한 시범을 생성할 수 있는가?
- RQ2복원 기반 오류 탐지 기법이 복잡한 모바일 조작 작업의 정책 배포 중에 분포 외 상태를 얼마나 효과적으로 탐지할 수 있는가?
- RQ3전문가 데이터에서 파생된 임itation 러닝 정책이 이동된 도메인에서 새로운 소수의 시범 시나리오에 얼마나 잘 일반화되는가?
- RQ4시뮬레이션과 실제 세계 배포 사이의 성능 격차는 얼마이며, 이 방법이 실제 로봇으로 효과적으로 전이 가능한가?
- RQ5임itation 러닝과 오류 탐지 기반의 통합 프레임워크가 장기적인 이동 조작 작업에서 정책의 내구성과 성공률을 크게 향상시킬 수 있는가?
주요 결과
- 제안된 MoMaRT 텔레옵에이션 시스템은 현실감 있는 시뮬레이션 주방 환경에서 1200개 이상의 고품질 연속 제어 시범을 성공적으로 수집하였다.
- 전문가 데이터셋 기반으로 훈련된 임itation 러닝 정책는 다섯 개의 다단계 작업 전반에서 45%를 초과하는 작업 성공률를 달성하였다.
- 학습된 오류 검출기는 실패 상태 탐지에서 정밀도와 재현율이 85% 이상을 기록하여 KL 발산 및 로그 확률 기반 메트릭과 같은 기준 방법보다 뚜렷이 뛰어났다.
- 이동된 도메인에서 소수의 시범 데이터를 활용한 파라미터 조정은 초기 학습보다 항상 뛰어나며, 성공률가 최대 10.7个百分点 향상되었다 (예: 'dishwasher에서 테이블 세팅' 작업에서 26.3% 대비 15.6%).
- 오류 검출기의 복원 기반 접근법은 잡음이 많은 잠재 공간 또는 로그 확률 방법과는 달리 다양한 작업에서 강력하고 조정 가능한 성능을 보였다.
- 내장 센서만을 사용하고 특별한 정보를 제공하지 않아 시뮬레이션에서 실제 세계로의 전이 잠재력이 매우 높지만, 실제 세계 검증은 아직 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.