Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Start From Scratch: Leveraging Prior Data to Automate Robotic Reinforcement Learning

Homer Walke, Jonathan T. Yang|arXiv (Cornell University)|2022. 07. 11.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 새로운 조작 작업을 위한 자율적이고 샘플 효율적이며 일반화 가능한 강화학습을 가능하게 하는 ARIEL이라는 프레임워크를 제안한다. 과거의 다양한 오프라인 로봇 데이터를 활용하여 다중 작업 정책을 사전 훈련하고, 자기지도 리셋 및 작업 정책을 통해 온라인에서 미세조정함으로써, 인간의 리셋이나 광범위한 온라인 데이터 수집 없이도 오라클 시연 성능에 근접한 성능을 달성한다.

ABSTRACT

Reinforcement learning (RL) algorithms hold the promise of enabling autonomous skill acquisition for robotic systems. However, in practice, real-world robotic RL typically requires time consuming data collection and frequent human intervention to reset the environment. Moreover, robotic policies learned with RL often fail when deployed beyond the carefully controlled setting in which they were learned. In this work, we study how these challenges can all be tackled by effective utilization of diverse offline datasets collected from previously seen tasks. When faced with a new task, our system adapts previously learned skills to quickly learn to both perform the new task and return the environment to an initial state, effectively performing its own environment reset. Our empirical results demonstrate that incorporating prior data into robotic reinforcement learning enables autonomous learning, substantially improves sample-efficiency of learning, and enables better generalization. Project website: https://sites.google.com/view/ariel-berkeley/

연구 동기 및 목표

  • 실세계 로봇 강화학습에서 샘플 비효율성, 자율성 부족, 일반화 능력 부족 등의 문제를 해결하기 위해.
  • 인간이 제공하는 리셋 없이 최소한의 온라인 상호작용으로 새로운 조작 작업을 학습할 수 있도록 하기 위해.
  • 작업 전용 데이터나 시연에 의존하는 대신 다양한 과거 데이터를 활용하여 일반화 능력을 향상시키기 위해.
  • 오프라인 사전 훈련과 온라인 미세조정을 통합한 통합 프레임워크를 개발하기 위해.
  • 과거 데이터가 실세계 강화학습에서 자율성, 효율성, 강건성 향상의 주요 메커니즘으로 기능할 수 있음을 보여주기 위해.

제안 방법

  • 이전에 수행된 작업의 다양한 오프라인 데이터셋을 사용하여 오프라인 강화학습을 통해 다중 작업 정책을 사전 훈련한다.
  • 작업 임bedding을 사용하여 정책이 정방향(작업 실행) 및 역방향(리셋) 행동 모두에 조건을 부여한다.
  • 작업 실행과 환경 리셋을 번갈아가며 수행하는 자기지도 커리큘럼을 사용하여 사전 훈련된 정책을 온라인에서 미세조정한다.
  • 희소 보상과 희소한 리셋만을 사용하여 다중 작업 정책을 적응시켜 작업 전용 정방향 및 역방향 정책을 학습한다.
  • 온라인 미세조정 중에 작업 임bedding을 최적화하여 정책이 새로운 작업 분포에 적응하도록 한다.
  • 정방향 및 역방향 정책을 하나의 에이전트에 통합하여 인간 간섭 없이 작업을 수행하고 환경을 자동으로 리셋한다.

실험 결과

연구 질문

  • RQ1과거의 오프라인 데이터를 사용하여 정책을 초기화함으로써 새로운 로봇 조작 작업에 대해 빠르고 자율적으로 학습할 수 있는가?
  • RQ2다양한 과거 데이터를 활용할 경우, 희소 보상 환경에서 샘플 효율성과 일반화 능력이 어떻게 향상되는가?
  • RQ3하나의 사전 훈련된 정책이 인간이 제공하는 리셋 없이도 작업 실행과 환경 리셋을 모두 온라인에서 적응할 수 있는가?
  • RQ4학습을 처음부터 시작하거나 오라클 시범을 사용하는 것과 비교할 때 과거 데이터가 성능에 얼마나 기여하는가?
  • RQ5사전 훈련 기간에 볼 수 없었던 새로운 물체나 환경에 대해 시스템은 얼마나 잘 일반화되는가?

주요 결과

  • ARIEL는 대상 작업의 오프라인 시범 데이터에 접근할 수 있는 오라클 기반 성능과 유사한 최종 성능을 달성하여 뛰어난 샘플 효율성을 입증한다.
  • 희소 보상, 이미지 기반의 로봇 조작 작업에서 표준 강화학습이 진전이 없을 때, ARIEL은 학습을 처음부터 시작하는 것보다 뛰어난 성능을 보인다.
  • ARIEL은 리셋이 없는 환경에서도 일관된 학습 진전을 보이며, R3L와 같은 이전의 자율 학습 방법보다 뛰어난 성능을 보인다.
  • 다양한 과거 데이터로 사전 훈련된 정책는 단일 작업 데이터로만 훈련된 정책보다 더 나은 일반화 능력을 보인다.
  • ARIEL은 최소한의 온라인 데이터와 인간의 리셋 없이도 새로운 조작 스킬을 성공적으로 학습하여 자율적이고 비에피소드 기반의 학습을 실현한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.