Skip to main content
QUICK REVIEW

[논문 리뷰] Learning and Retrieval from Prior Data for Skill-based Imitation Learning

Soroush Nasiriany, Tian Gao|arXiv (Cornell University)|2022. 10. 20.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

SAILOR는 새로운 조작 작업 학습에서 데이터 효율성과 강건성을 향상시키기 위해 이전의 시연 데이터를 활용하는 스킬 기반의 암시 학습 프레임워크를 제안한다. 구조화된 스킬 표현을 위한 시간 예측 가능성 목표와 정책 감독을 확장하기 위한 검색 기반 데이터 증강을 결합함으로써, SAILOR는 시뮬레이션 및 실제 환경 모두에서 최신의 암시 학습 및 오프라인 강화 학습 방법보다 뚜렷하게 뛰어난 성능을 보인다.

ABSTRACT

Imitation learning offers a promising path for robots to learn general-purpose behaviors, but traditionally has exhibited limited scalability due to high data supervision requirements and brittle generalization. Inspired by recent advances in multi-task imitation learning, we investigate the use of prior data from previous tasks to facilitate learning novel tasks in a robust, data-efficient manner. To make effective use of the prior data, the robot must internalize knowledge from past experiences and contextualize this knowledge in novel tasks. To that end, we develop a skill-based imitation learning framework that extracts temporally extended sensorimotor skills from prior data and subsequently learns a policy for the target task that invokes these learned skills. We identify several key design choices that significantly improve performance on novel tasks, namely representation learning objectives to enable more predictable skill representations and a retrieval-based data augmentation mechanism to increase the scope of supervision for policy training. On a collection of simulated and real-world manipulation domains, we demonstrate that our method significantly outperforms existing imitation learning and offline reinforcement learning approaches. Videos and code are available at https://ut-austin-rpl.github.io/sailor

연구 동기 및 목표

  • 복잡하고 장기적인 작업에서 전통적인 암시 학습의 높은 데이터 요구량과 취약한 일반화 문제를 해결하기 위해.
  • 이전 작업의 상호작용 데이터를 활용하여 데이터 효율성과 정책 강건성을 향상시키기 위해.
  • 이전 경험에서의 지식을 내재화하고 새로운 작업에 맞게 맥락화하는 스킬 기반 프레임워크를 개발하기 위해.
  • 기존의 스킬 기반 암시 학습의 한계, 예를 들어 예측 불가능한 스킬 표현과 정책 학습에 대한 부족한 감독을 극복하기 위해.
  • 구조화된 스킬 학습과 검색 기반 정책 훈련을 결합함으로써 새로운 조작 작업에 대해 강력한 일반화 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 시간 예측 가능성 목표를 사용하여 이전 데이터에서 시간적으로 연속된 감각운동 스킬을 추출하는 스킬 기반 암시 학습 프레임워크.
  • 시간 예측 가능성 목표는 부분 궤적 간 시간 거리를 추정함으로써 더 예측 가능하고 분리된 잠재 스킬 공간을 촉진한다.
  • 검색 기반 데이터 증강 메커니즘이 목표 작업 시연와 높은 잠재 스킬 유사도를 가진 이전 부분 궤적을 선택하여 정책 감독 범위를 확장한다.
  • 정책이 잠재 스킬을 출력하도록 훈련되어 고수준의 작업 추론과 저수준의 동작 실행을 분리하는 계층적 의사결정을 가능하게 한다.
  • 다단계 훈련 파이프라인을 사용한다: 먼저 이전 데이터에서 스킬 모델을 사전 훈련하고, 그 다음에 검색된 이전 데이터로 증강된 목표 작업 시연 데이터에서 정책을 미세 조정한다.
  • 최적의 성능를 위해 초모수를 조정한다: 부분 궤적 길이 H=10, 스킬 잠재 차원 64, 이전 샘플 최대 300,000개에서 검색 샘플링.

실험 결과

연구 질문

  • RQ1어떻게 이전 데이터를 효과적으로 활용하여 새로운 조작 작업에 대한 암시 학습의 데이터 효율성을 향상시킬 수 있는가?
  • RQ2스킬 표현 학습에서 어떤 설계 선택이 더 예측 가능하고 일반화 가능한 스킬을 이끌어내는가?
  • RQ3검색 기반 데이터 증강이 제한된 목표 작업 시연 데이터 세트에서 정책 일반화와 과적합을 얼마나 개선하는가?
  • RQ4시간 예측 가능성 통합이 표준 VAE 기반 접근 방식과 비교하여 하류 정책 성능에 어떤 영향을 미치는가?
  • RQ5스킬 학습과 정책 학습 모두에 이전 데이터를 동시에 사용하는 스킬 기반 프레임워크가 스킬 학습에만 이전 데이터를 사용하는 방법보다 우수한 성능을 내는가?

주요 결과

  • SAILOR는 다양한 시뮬레이션 및 실제 환경의 조작 작업에서 최신의 암시 학습 및 오프라인 강화 학습 방법보다 뚜렷하게 뛰어난 성능을 보인다.
  • 시간 예측 가능성 목표의 포함으로 더 구조적이고 예측 가능한 스킬 표현이 도출되어 정책이 관련 없는 스킬을 실행하는 경향이 감소한다.
  • 검색 기반 데이터 증강은 정책 훈련에 대한 효과적인 감독 범위를 증가시켜 소규모 목표 작업 시연 데이터 세트에서 과적합과 공변수 이동을 완화한다.
  • Franka Kitchen 및 CALVIN 환경에서 SAILOR는 BC-RNN, IQL, FIST보다 높은 성공률를 기록하였으며, 특히 장기적인 작업에서 두드러진 성능을 보였다.
  • 실제 작업 환경인 Breakfast 및 Cook 환경에 대해 제로샷 일반화 성능이 뛰어나 평균 성공률가 80%를 초과하였다.
  • 제거 실험 결과, 시간 예측 가능성 목표와 검색 기반 증강이 성능 향상에 필수적임을 확인하였으며, 각 구성 요소가 데이터 효율성과 강건성 향상에 기여하는 데 중요한 역할을 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.