Skip to main content
QUICK REVIEW

[논문 리뷰] Residual Reinforcement Learning from Demonstrations

Minttu Alakuijala, Gabriel Dulac-Arnold|arXiv (Cornell University)|2021. 06. 15.
Robot Manipulation and Learning참고 문헌 27인용 수 11
한 줄 요약

이 논문은 시각적 입력, 프로피아셉션, 희박한 보상에서 이미지 기반 제어 정책을 효율적으로 학습하기 위해 행동 복제와 잔차 강화 학습을 결합한 데이터 효율적인 방법인 잔차 강화 학습에서의 시뮬레이션 학습(RRLfD)을 제안한다. 수동으로 설계된 기본 제어기를 시뮬레이션 데이터로부터 학습된 정책으로 대체함으로써 RRLfD는 고차원적 로봇 조작 작업에서 더 뛰어난 일반화 능력과 샘플 효율성을 달성하며, 기존의 강화 학습으로는 도달하지 못한 작업을 해결한다.

ABSTRACT

Residual reinforcement learning (RL) has been proposed as a way to solve challenging robotic tasks by adapting control actions from a conventional feedback controller to maximize a reward signal. We extend the residual formulation to learn from visual inputs and sparse rewards using demonstrations. Learning from images, proprioceptive inputs and a sparse task-completion reward relaxes the requirement of accessing full state features, such as object and target positions. In addition, replacing the base controller with a policy learned from demonstrations removes the dependency on a hand-engineered controller in favour of a dataset of demonstrations, which can be provided by non-experts. Our experimental evaluation on simulated manipulation tasks on a 6-DoF UR5 arm and a 28-DoF dexterous hand demonstrates that residual RL from demonstrations is able to generalize to unseen environment conditions more flexibly than either behavioral cloning or RL fine-tuning, and is capable of solving high-dimensional, sparse-reward tasks out of reach for RL from scratch.

연구 동기 및 목표

  • 희박한 보상과 시각적 입력을 가진 고차원 제어 작업에서 강화 학습의 샘플 비효율성 문제를 해결하기 위해.
  • 수동으로 설계된 기본 제어기를 시뮬레이션 데이터로부터 학습된 정책으로 대체함으로써 그 의존도를 제거하기 위해.
  • 이미지 공간에서 행동 복제와 잔차 강화 학습을 결합하여 로봇 조작 작업에서의 일반화 능력과 샘플 효율성을 향상시키기 위해.
  • 완전한 상태 추정이나 밀도 높은 보상 형상 조정이 필요 없이 원시 시각적 및 프로피아셉션 입력에서 학습을 가능하게 하기 위해.
  • 잔차 강화 학습에 시뮬레이션 기반 기본 정책을 적용할 경우, 새로운 환경 조건에서의 일반화 능력이 행동 복제나 강화 학습 미세조정보다 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 시뮬레이션 트레이제이션의 이미지 및 프로피아셉션 관측값에서 행동 복제를 통해 기본 정책을 훈련하여, 작업에 관련된 시각적 특징을 종단 간(end-to-end)으로 학습한다.
  • 기본 정책의 출력에 작용하는 잔차 정책을 사용하여, 희박한 보상과 함께 강화 학습을 통해 그 행동을 수정하도록 학습한다.
  • 행동 복제 정책과 잔차 강화 학습 정책 간에 공유된 시각적 특징 인코더를 사용하여 특징 전이와 데이터 효율성을 가능하게 한다.
  • 표준 딥 강화 학습 알고리즘(SAC, DMPO 등)을 사용하여 희박한 보상에서 잔차 정책을 훈련하며, 잔차 훈련 기간 동안 기본 정책은 고정한다.
  • 최종 행동이 기본 정책의 행동과 잔차 정책의 보정 행동의 합으로 구성되는 잔차 제어 공식을 적용한다.
  • 시뮬레이션 데이터를 모방 학습 외에도 시각적 표현을 사전 훈련하는 데에도 활용하여, 강화 학습에서의 탐색 필요성을 줄인다.

실험 결과

연구 질문

  • RQ1행동 복제나 강화 학습 미세조정보다 시뮬레이션 데이터로부터 학습된 잔차 강화 학습 정책이 새로운 환경 조건에 더 잘 일반화되는가?
  • RQ2수동으로 설계된 기본 제어기를 행동 복제로 학습된 정책으로 대체할 경우, 이미지 기반 희박한 보상 로봇 제어에서 샘플 효율성이 향상되는가?
  • RQ3시뮬레이션 데이터에서 행동 복제를 통해 학습된 시각적 특징이 잔차 강화 학습 정책과 효과적으로 공유되어 학습 속도를 높일 수 있는가?
  • RQ4잔차 강화 학습에서 시뮬레이션 데이터를 활용할 경우, 기존의 강화 학습으로는 도달하지 못하는 고차원적, 희박한 보상의 조작 작업을 얼마나 잘 해결할 수 있는가?
  • RQ5잔차 공식이 직접 행동 복제 정책을 강화 학습으로 미세조정하는 것과 비교해 치명적인 기억 상실(catastrophic forgetting)을 어느 정도 완화하는가?

주요 결과

  • RRLfD는 표준 강화 학습으로는 학습 예산 내에서 성공하지 못하는 고차원적, 희박한 보상의 조작 작업(예: 6-DoF UR5 암에서의 Pick, Bowl, Push, 28-DoF 민감한 손의 작업 등)을 성공적으로 해결한다.
  • 행동 복제나 강화 학습 미세조정보다 더 민첩하게 새로운 환경 조건에 일반화되며, 더 뛰어난 내성적 안정성을 보여준다.
  • 시뮬레이션 데이터나 밀도 높은 보상 없이 이미지만으로 학습할 경우 성공적인 정책이 도출되지 않으며, 샘플 효율성을 확보하기 위해 시뮬레이션 데이터의 필요성을 입증한다.
  • 완전한 상태 입력을 사용할 경우 일부 작업(Push, Pen 등)에서 성공률가 향상되지만, RRLfD는 시각적 및 프로피아셉션 입력만으로도 뛰어난 성능을 달성한다.
  • 잔차 공식은 강화 학습을 처음부터 훈련하는 것에 비해 샘플 복잡도를 크게 감소시켜, 희박한 보상의 장기적 목표 작업 학습이 가능하게 한다.
  • 희박한 보상 설정과 조밀한 보상 설정 모두에서 베이스라인 성능을 능가하며, 희박한 작업 완료 보상이 조밀한 보상에 추가될수록 성공률이 증가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.