Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-Efficient Learning of Nonprehensile Manipulation Policies via Physics-Based Informed State Distributions

Lerrel Pinto, Aditya Mandalika|arXiv (Cornell University)|2018. 10. 24.
Reinforcement Learning in Robotics참고 문헌 9인용 수 10
한 줄 요약

이 논문은 재배치 계획에서 유도된 물리 기반 상태 분포를 사용해 훈련 중 환경을 리셋하는 샘플 효율적인 강화학습 방법인 LeaPER를 제안한다. 계획된 궤적을 사전 지식으로 활용함으로써 LeaPER는 학습 속도를 최대 5배로 높이고, 단순한 피드백 정책이나 오픈 루프 제어보다 훨씬 높은 작업 성공률을 달성한다. 이는 단순한 물리 모델을 사용하는 상황에서도 성립한다.

ABSTRACT

This paper proposes a sample-efficient yet simple approach to learning closed-loop policies for nonprehensile manipulation. Although reinforcement learning (RL) can learn closed-loop policies without requiring access to underlying physics models, it suffers from poor sample complexity on challenging tasks. To overcome this problem, we leverage rearrangement planning to provide an informative physics-based prior on the environment's optimal state-visitation distribution. Specifically, we present a new technique, Learning with Planned Episodic Resets (LeaPER), that resets the environment's state to one informed by the prior during the learning phase. We experimentally show that LeaPER significantly outperforms traditional RL approaches by a factor of up to 5X on simulated rearrangement. Further, we relax dynamics from quasi-static to welded contacts to illustrate that LeaPER is robust to the use of simpler physics models. Finally, LeaPER's closed-loop policies significantly improve task success rates relative to both open-loop controls with a planned path or simple feedback controllers that track open-loop trajectories. We demonstrate the performance and behavior of LeaPER on a physical 7-DOF manipulator in https://youtu.be/feS-zFq6J1c.

연구 동기 및 목표

  • 장기적이고 다중 물체 재배치 작업에서 강화학습의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 전문가 지시나 밀도 높은 보상 형태에 의존하지 않고 샘플 효율성을 향상시키기 위해.
  • 확률적 역학과 완벽하지 않은 물리 모델 조건에서도 견고한 정책 학습을 가능하게 하기 위해.
  • 시뮬레이션에서 훈련된 정책을 실제 로봇 시스템으로 전이하기 위해.
  • 단순화된 물리 모델이 여전히 샘플 효율적인 강화학습을 위한 효과적인 사전 지식이 될 수 있음을 보여주기 위해.

제안 방법

  • LeaPER는 휘어지지 않는 또는 단순화된 물리 모델을 사용해 오픈 루프 궤적을 생성하는 재배치 계획기(PC-RRT)를 사용한다.
  • 이 궤적을 따라 방문한 상태들이 RL 훈련 중 에피소드 리셋에 대한 사전 지식으로 사용된다.
  • 훈련 중 환경는 계획된 궤적에서 샘플링된 상태로 리셋되며, 이는 탐색 효율성을 향상시킨다.
  • 이 방법은 어떤 에피소드 기반 강화학습 알고리즘과도 호환되며, 실험에서는 HER를 기본 알고리즘으로 사용한다.
  • 계획을 가속화하기 위해 간단한 접촉 모델(예: 용접된 접촉)을 사용하지만 여전히 유용한 사전 지식을 제공한다.
  • 상태 추정(OptiTrack)과 역학 도메인 랜덤라이제이션을 통해 시뮬레이션에서 실제 세계로의 전이가 가능해진다.

실험 결과

연구 질문

  • RQ1계획에서 유도된 물리 기반 상태 분포가 비손재배치 조작에서 샘플 복잡도를 크게 감소시키는가?
  • RQ2계획에서 단순화된 물리 모델을 사용해도 여전히 강화학습에 효과적인 사전 지식을 제공하는가?
  • RQ3LeaPER는 확률적 역학 조건 하에서 오픈 루프 제어보다 뛰어난 견고한 닫힌 루프 정책을 학습할 수 있는가?
  • RQ4LeaPER는 시뮬레이션에서 훈련된 정책을 실제 로봇 시스템으로 전이했을 때 어떻게 성능을 발휘하는가?
  • RQ5계획기의 물리 모델이 실제 세계의 역학과 다를 경우에도 이 방법은 여전히 효과적인가?

주요 결과

  • LeaPER는 시뮬레이션된 재배치 작업에서 표준 RL 기준선 대비 샘플 복잡도를 최대 5배까지 감소시킨다.
  • 오픈 루프 제어나 계획된 경로를 따라가는 피드백 제어기보다 훨씬 높은 작업 성공률을 달성한다.
  • 용접된 접촉 모델(매우 단순화된 물리 근사치)을 사용하는 상황에서도 LeaPER는 사전 지식이 없는 경우나 표준 RL보다 뛰어난 성능을 보인다.
  • LeaPER를 통해 학습된 닫힌 루프 정책는 확률적 역학 조건 하에서도 노미널 궤적에서의 이탈을 수정할 수 있어 견고하다.
  • OptiTrack 상태 추정과 도메인 랜덤라이제이션을 활용해 실제 7-DOF 조작 장치로 정책이 성공적으로 전이되었다.
  • 계획기의 물리 모델이 근사치일 경우에도 LeaPER는 효과적이며, 계획된 궤적이 사전 지식으로서의 가치를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.