[논문 리뷰] Human-in-the-Loop Imitation Learning using Remote Teleoperation
이 논문은 정책 실행 중 인간의 간섭을 수집함으로써 원격 원격 조작를 이용한 인간-중심의 반복 학습 프레임워크를 제안한다. 이는 로봇 조작 정책을 향상시키기 위한 것이다. Intervention Weighted Regression (IWR)를 도입하여 간섭 시점을 활용해 고위험한 병목 영역에서 학습을 우선시함으로써, 6-자유도 작업인 로봇 스레딩 및 커피 제조와 같은 도전적인 작업에서 전체 시연 기반 베이스라인과 다른 간섭 기반 방법들보다 뚜렷이 뛰어난 성능을 보였다.
Imitation Learning is a promising paradigm for learning complex robot manipulation skills by reproducing behavior from human demonstrations. However, manipulation tasks often contain bottleneck regions that require a sequence of precise actions to make meaningful progress, such as a robot inserting a pod into a coffee machine to make coffee. Trained policies can fail in these regions because small deviations in actions can lead the policy into states not covered by the demonstrations. Intervention-based policy learning is an alternative that can address this issue -- it allows human operators to monitor trained policies and take over control when they encounter failures. In this paper, we build a data collection system tailored to 6-DoF manipulation settings, that enables remote human operators to monitor and intervene on trained policies. We develop a simple and effective algorithm to train the policy iteratively on new data collected by the system that encourages the policy to learn how to traverse bottlenecks through the interventions. We demonstrate that agents trained on data collected by our intervention-based system and algorithm outperform agents trained on an equivalent number of samples collected by non-interventional demonstrators, and further show that our method outperforms multiple state-of-the-art baselines for learning from the human interventions on a challenging robot threading task and a coffee making task. Additional results and videos at https://sites.google.com/stanford.edu/iwr .
연구 동기 및 목표
- 작은 동작 오류가 고정밀 조작 작업에서 실패를 유도하는 공변수 이동 문제를 해결하기 위해.
- 정책 실행 중 실패가 예상될 경우 인간 운영자가 실시간으로 모니터링하고 간섭할 수 있도록 하기 위해.
- 인간 간섭 데이터를 효과적으로 활용하여 병목 영역에서의 정책 일반화 능력을 향상시키는 알고리즘을 개발하기 위해.
- 반복적 재학습을 통한 간섭 기반 데이터 수집이 전체 인간 시연를 수집하는 것보다 더 뛰어난 성능을 내는지 입증하기 위해.
- 다양한 인간 운영자와 물리적으로 도전적인 접촉 중심 조작 작업에서 메서드의 유효성을 검증하기 위해.
제안 방법
- 원격 원격 조작 시스템을 통해 인간 운영자가 정책 실행을 모니터링하고 실패가 예상될 경우 전체 제어를 임명할 수 있도록 한다.
- 인간 간섭은 운영자가 실패 상태 근처에서 제어를 장악하고 성공적으로 통과한 후 제어를 복원한 상태-행동 쌍으로 기록된다.
- 제안된 Intervention Weighted Regression (IWR) 알고리즘은 간섭 시점을 기반으로 학습 데이터를 재가중하여 병목 영역 입구 근처의 행동에 더 높은 중요도를 할당한다.
- IWR는 간섭 신호를 암시적 보상 신호로 간주하여 고위험 영역를 안전하고 성공적인 경로로 통과할 수 있도록 정책 학습을 장려한다.
- 정책은 누적된 간섭 데이터를 기반으로 반복적으로 재학습되어 병목 영역에서의 성능이 점차 향상된다.
- 다양한 인간 운영자로부터의 확장 가능한 데이터 수집을 지원하여 커스터마이징된 학습에 적합하다.
실험 결과
연구 질문
- RQ1정책 실행 중 원격 인간 간섭이 고정밀 병목 영역이 있는 6-자유도 조작 작업의 성능을 향상시킬 수 있는가?
- RQ2간섭 데이터를 가중 회귀 접근법(IWR)을 통해 활용할 경우, 전체 시연를 사용하는 표준 반복 학습보다 정책 성능이 향상되는가?
- RQ3반복적 데이터 수집(여러 라운드 간섭)이 단일 라운드 데이터 수집과 비교해 최종 정책 성공률에서 어떤 차이를 보이는가?
- RQ4제안된 방법이 다양한 인간 운영자와 기본 정책 간에서 일반화 가능한가?
- RQ5동일한 데이터셋에서 학습했을 때 IWR가 다른 간섭 기반 학습 기반선보다 뛰어난 성능을 보이는가?
주요 결과
- 로봇 스레딩 작업에서 제안된 방법은 87.3%의 성공률을 기록했으며, Full Demos 기반선(76.7%)과 HG-DAgger, IWR-NB와 같은 다른 간섭 기반 기반선보다 뚜렷이 뛰어난 성능을 보였다.
- 커피 메이킹 작업에서, 세 명의 운영자 평균 성공률은 87.5%였으며, Full Demos 기반선(64.9%)과 HG-DAgger 기반선(69.6%)을 모두 초월했다.
- 다양한 운영자들 사이에서 일관된 향상이 관찰되어 다양한 시연자에 대한 강건성과 일반화 능력을 입증했다.
- 다른 방법으로 수집된 데이터셋으로 학습한 경우에도 IWR 방법은 자체 데이터셋으로 학습한 성능에 매우 가까운 결과를 기록했으며, 이는 뛰어난 데이터 활용 능력을 시사한다.
- 반복적 데이터 수집(여러 라운드 간섭)은 단일 라운드 데이터 수집보다 성능이 뛰어났으며, 특히 커피 메이킹 작업에서 단일 라운드 설정에서는 최종 성공률이 7% 낮았다.
- 결과적으로 간섭 데이터는 간섭 시점에 지능적으로 가중될 경우, 특히 복잡하고 접촉 중심의 조작 작업에서 전체 시연 데이터보다 더 효과적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.