Skip to main content
QUICK REVIEW

[논문 리뷰] One-Shot Learning of Manipulation Skills with Online Dynamics Adaptation and Neural Network Priors

Justin Fu, Sergey Levine|arXiv (Cornell University)|2015. 09. 23.
Reinforcement Learning in Robotics참고 문헌 23인용 수 11
한 줄 요약

이 논문은 복잡한 로봇 조작 기술의 일회성 학습을 가능하게 하기 위해 이전 작업에서의 신경망 동역학 사전 지식과 온라인으로 적응하는 국소 선형 동역학 모델을 결합한 모델 기반 강화 학습 방법을 제안한다. 작업 실행 중에 동역학 모델을 반복적으로 개선하고 모델 예측 제어를 사용함으로써 높은 샘플 효율성을 달성하며, 한 번의 尝시도로 접촉이 많은 어려운 작업을 성공적으로 학습한다.

ABSTRACT

One of the key challenges in applying reinforcement learning to complex robotic control tasks is the need to gather large amounts of experience in order to find an effective policy for the task at hand. Model-based reinforcement learning can achieve good sample efficiency, but requires the ability to learn a model of the dynamics that is good enough to learn an effective policy. In this work, we develop a model-based reinforcement learning algorithm that combines prior knowledge from previous tasks with online adaptation of the dynamics model. These two ingredients enable highly sample-efficient learning even in regimes where estimating the true dynamics is very difficult, since the online model adaptation allows the method to locally compensate for unmodeled variation in the dynamics. We encode the prior experience into a neural network dynamics model, adapt it online by progressively refitting a local linear model of the dynamics, and use model predictive control to plan under these dynamics. Our experimental results show that this approach can be used to solve a variety of complex robotic manipulation tasks in just a single attempt, using prior data from other manipulation behaviors.

연구 동기 및 목표

  • 기존 방법이 새로운 기술을 학습하기 위해 광범위한 상호작용이 필요로 하는 강화 학습에서의 샘플 비효율성 문제를 해결한다.
  • 비선형적이고 접촉이 많은 환경에서 제한된 데이터로 정확한 동역학 모델을 학습하는 데 어려움을 극복한다.
  • 시연나 명시적 도메인 지식이 필요 없이 관련 작업에서의 이전 경험을 활용해 새로운 조작 작업의 일회성 학습을 가능하게 한다.
  • 거시적 사전 지식과 온라인 모델 적응을 결합한 방법을 개발하여 실제 로봇 제어에서의 강인성과 샘플 효율성을 향상시킨다.

제안 방법

  • 다양한 조작 작업에서의 이전 경험을 기반으로 신경망 동역학 모델을 훈련하여 시스템 동역학의 글로벌 사전 지식으로 활용한다.
  • 온라인 작업 실행 중에 최근 상호작용 데이터에 기반해 국소 선형 근사를 적합하여 동역학 모델을 적응시킨다.
  • 적응된 동역학 모델을 기반으로 제어 동작을 생성하기 위해 모델 예측 제어(MPC) 프레임워크 내에서 반복적 선형 제어이론(iLQR)을 사용한다.
  • 최근 상태-행동 전이 데이터를 사용해 실시간으로 동역학 모델을 점진적으로 개선함으로써 모델링되지 않은 동역학 변화에 대한 국소 보정을 가능하게 한다.
  • 신경망 사전 지식을 사용해 동역학 모델을 초기화함으로써 정확한 글로벌 모델링의 필요성을 줄이고 새로운 작업에서의 수렴 성능을 향상시킨다.
  • 관절 각도, 속도, 종단기구 자세와 같은 고차원 상태 관측치를 MPC 기반 계획 과정에 통합하여 토크 수준 제어를 구현한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화 학습 접근법이 오직 이전 경험과 온라인 적응만을 사용하여 복잡한 조작 작업의 일회성 학습을 달성할 수 있는가?
  • RQ2샘플 효율적인 비선형 동역학 학습을 위해 단순한 선형 사전 지식 대비 신경망 사전 지식이 얼마나 효과적인가?
  • RQ3높은 불확실성 또는 모델링되지 않은 동역학이 있는 작업에서 온라인 동역학 적응이 성능 향상에 얼마나 기여하는가?
  • RQ4정확하지 않은 거시적 사전 모델이라도 실시간 적응과 결합하면 성공적인 작업 실행을 가능하게 할 수 있는가?

주요 결과

  • 제안된 방법은 PR2 로봇에서 펜-인-홀, 링 스택킹, 블록 정렬과 같은 다양한 어려운 접촉이 많은 조작 작업을 단 한 번의 尝시도로 성공적으로 학습하고 실행하였다.
  • 짧은 시간적 맥락을 가진 신경망 사전 지식을 사용한 결과, 단순한 선형 사전 지식과 적응하지 않는 신경망 기반 베이스라인보다 뚜렷이 뛰어난 성능을 보였다.
  • 블록 정렬과 같이 더 어려운 작업에서는 온라인 적응이 동역학적 불확실성에 대한 국소 보정을 가능하게 하여 성공률을 향상시켰다.
  • 정확하지 않은 글로벌 사전 모델이라도 실시간 모델 개선 덕분에 강인한 성능을 달성하였다.
  • 간단한 외부 흐트러짐 실험에서 적응 기반 접근이 특히 복잡한 작업에서 성공률을 크게 향상시켰다.
  • 작업 실행 중에 예기치 않은 접촉 후 물체를 탐색하는 등 자연스럽고 탐색적인 행동을 보였으며, 이는 실시간으로 적응하는 학습을 반영하고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.