Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation

Charles Sun, Jędrzej Orbik|arXiv (Cornell University)|2021. 07. 28.
Reinforcement Learning in Robotics인용 수 15
한 줄 요약

ReLMM는 인간 간섭, 환경 장비 또는 특권 정보 없이도 이동형 조작을 위한 완전 자율적 실세계 강화학습을 가능하게 한다. 탐색 및 집게 정책을 분리하고, 집게 불확실성을 탐색 유도에 활용함으로써 ReLMM는 40시간의 연속된 실세계 훈련 동안 종단간 스킬 학습을 달성하며, 비구조적 환경에서 효과적인 평생 학습을 보여준다.

ABSTRACT

We study how robots can autonomously learn skills that require a combination of navigation and grasping. While reinforcement learning in principle provides for automated robotic skill learning, in practice reinforcement learning in the real world is challenging and often requires extensive instrumentation and supervision. Our aim is to devise a robotic reinforcement learning system for learning navigation and manipulation together, in an autonomous way without human intervention, enabling continual learning under realistic assumptions. Our proposed system, ReLMM, can learn continuously on a real-world platform without any environment instrumentation, without human intervention, and without access to privileged information, such as maps, objects positions, or a global view of the environment. Our method employs a modularized policy with components for manipulation and navigation, where manipulation policy uncertainty drives exploration for the navigation controller, and the manipulation module provides rewards for navigation. We evaluate our method on a room cleanup task, where the robot must navigate to and pick up items scattered on the floor. After a grasp curriculum training phase, ReLMM can learn navigation and grasping together fully automatically, in around 40 hours of autonomous real-world training.

연구 동기 및 목표

  • 인간 감시나 환경 장비 없이도 완전 자율적인 강화학습 시스템을 개발하여 이동형 조작에 적용하는 것.
  • 내장된 센서와 자기지도 보상만을 사용하여 실세계 환경에서 지속적이고 평생 학습이 가능한 시스템을 구현하는 것.
  • 지도, 물체 위치, 전역 상태 관측과 같은 특권 정보에 의존하지 않도록 하는 것.
  • 탐색 및 집게 학습의 효율적 탐색과 통합 학습을 가능하게 하는 모듈러 정책 아키텍처를 설계하는 것.
  • 인간 간섭을 최소화하면서도 성능을 유지하는 샘플 효율적인 자율적 커리큘럼 학습을 구현하는 것.

제안 방법

  • ReLMM는 별도의 탐색 및 집게 구성 요소를 가진 모듈러 정책을 사용하며, 딥 강화학습을 통해 공동으로 훈련한다.
  • 집게 정책의 불확실성은 탐색 정책이 탐색되지 않은 영역 또는 불확실한 영역으로 향하도록 유도하는 탐색 보너스로 사용된다.
  • 탐색 정책은 성공적인 집게를 기반으로 보상받으며, 샘플 효율성을 향상시키기 위해 보상 재표기 메커니즘을 사용한다.
  • 동적 집게 빈도 스케줄과 불확실성 기반 보너스를 통한 자율적 커리큘럼을 구현하여 수동 간섭을 감소시킨다.
  • 모든 훈련은 외부 장비나 인간 제공 리셋 없이 내장 센서만을 사용하여 수행된다.
  • 계층적이고 두 단계의 훈련 과정을 적용한다: 초기 집게 사전훈련 이후 통합 탐색-집게 훈련.

실험 결과

연구 질문

  • RQ1이동형 조작 기계가 인간 감시나 환경 장비 없이도 실세계 환경에서 복잡한 탐색 및 집게 작업을 자율적으로 학습할 수 있는가?
  • RQ2특권 상태 정보 없이 통합 탐색-집게 정책에서 탐색을 효과적으로 이끌 수 있는 방법은 무엇인가?
  • RQ3정책 분해와 커리큘럼 설계가 이동형 조작의 실세계 강화학습에서 샘플 효율성에 미치는 영향은 무엇인가?
  • RQ4자율적 커리큘럼 학습이 최소한의 인간 입력으로 수동으로 설계된 커리큘럼과 비슷한 성능을 달성할 수 있는가?
  • RQ5시스템은 지속적이고 끊김 없는 실세계 훈련을 통해 얼마나 평생 학습을 실현할 수 있는가?

주요 결과

  • ReLMM는 약 40시간의 연속된 실세계 훈련 동안 인간 간섭을 최소로 하며 방 청소 작업을 성공적으로 수행했다.
  • 시간이 지남에 따라 지속적인 향상이 관찰되어 비구조적 환경에서 효과적인 평생 학습이 가능하다는 것을 입증했다.
  • 절단 실험 결과, 불확실성 보너스를 포함한 통합 훈련이 고립된 훈련이나 고정 커리큘럼 접근보다 유의미하게 뛰어난 성능을 보였다.
  • 사전훈련 기간 동안 단 1,000회의 정지된 집게만으로도 합리적인 방 청소 성능을 달성하여 샘플 효율성이 뛰어나다는 것을 입증했다.
  • 보상 재표기 기반 자율적 커리큘럼은 정지 커리큘럼과 비슷한 성능를 달성했지만, 인간의 노력은 줄였다.
  • 별도의 탐색 및 집게 모듈로 정책 분해를 통해 통합 행동 공간 정책보다 훈련 안정성과 성능이 향상됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.