Skip to main content
QUICK REVIEW

[논문 리뷰] Curious iLQR: Resolving Uncertainty in Model-based RL

Sarah Bechtle, Yixin Lin|arXiv (Cornell University)|2019. 04. 15.
Reinforcement Learning in Robotics참고 문헌 29인용 수 16
한 줄 요약

이 논문은 궁금증 기반의 모델 기반 강화 학습 프레임워크인 Curious iLQR를 제안한다. 이는 모델 불확실성을 궤적 최적화에 통합하여 탐색을 향상시킨다. 위험 감수성 있는 iLQR 설정을 사용해 작업 비용과 예측 분산을 동시에 최소화함으로써, 시뮬레이션과 실제 로봇에서 7-DoF 매니퓰레이터의 학습을 가속화하며, 표준 iLQR에 비해 더 빠른 수렴 속도와 더 나은 새로운 작업으로의 일반화 성능을 달성한다.

ABSTRACT

Curiosity as a means to explore during reinforcement learning problems has recently become very popular. However, very little progress has been made in utilizing curiosity for learning control. In this work, we propose a model-based reinforcement learning (MBRL) framework that combines Bayesian modeling of the system dynamics with curious iLQR, an iterative LQR approach that considers model uncertainty. During trajectory optimization the curious iLQR attempts to minimize both the task-dependent cost and the uncertainty in the dynamics model. We demonstrate the approach on reaching tasks with 7-DoF manipulators in simulation and on a real robot. Our experiments show that MBRL with curious iLQR reaches desired end-effector targets more reliably and with less system rollouts when learning a new task from scratch, and that the learned model generalizes better to new reaching tasks.

연구 동기 및 목표

  • 정책 최적화 중에 역학 모델의 불확실성을 적극적으로 줄임으로써 모델 편향 문제를 해결한다.
  • 지도 없이도 샘플 효율적이고 일반화 가능한 정책 학습을 실제 로봇 플랫폼에서 가능하게 한다.
  • 궤적 최적화에 궁금증 기반 탐색을 통합함으로써 작업 성능 향상과 모델 일반화를 향상시킨다.
  • 고차원 로봇 시스템(7-DoF 매니퓰레이터)에서의 방법의 확장성과 강건성을 입증한다.

제안 방법

  • 로봇 역학을 불확실성 추정을 포함한 확률적 가우시안 프로세스 모델로 표현한다.
  • 예측 분산의 지수를 포함한 위험 감수성 비용 함수를 사용해 반복적 LQR(iLQR)를 확장함으로써, 불확실성을 줄이는 행동을 선호한다.
  • 비용 함수는 작업에 특화된 비용과 모델 예측 분산을 조합하여, 불확실한 상태-행동 영역을 탐색하도록 유도한다.
  • 수집된 롤아웃에서 역학 모델을 학습하고, Curious iLQR를 통해 제어 정책을 최적화하는 것을 번갈아 수행한다.
  • 위험 감수성 제어를 통해 불확실성이 직접 비용에 통합되어 모델 분산에 대한 직접 최적화가 가능해진다.
  • 반복적으로 적용되는 프레임워크로, 각 롤아웃이 모델을 향상시키고 정책을 정교화함으로써 학습 루프를 닫는다.

실험 결과

연구 질문

  • RQ1궤적 최적화에 모델 불확실성을 통합하면 모델 기반 RL의 샘플 효율성이 향상되는가?
  • RQ2불확실성 감소를 통한 궁금증 기반 탐색은 새로운 작업에서 수렴 속도를 빠르게 하는가?
  • RQ3Curious iLQR로 학습된 모델은 표준 iLQR로 학습된 모델보다 더 새로운 도달 목표로 일반화가 잘 되는가?
  • RQ4제안된 방법은 사전 지도 없이 실제 7-DoF 로봇 플랫폼에서 어떻게 성능을 발휘하는가?

주요 결과

  • Sawyer 로봇에서 Curious iLQR는 평균 3.5개의 학습 반복 안에 목표에 도달했으며, 정밀도는 7cm였고, 표준 iLQR는 5.9회 반복과 14cm의 정밀도를 기록했다.
  • 시뮬레이션 환경에서 Curious iLQR는 평균 도달 정밀도 0.26m를 달성하여, 표준 iLQR의 0.7m에 비해 유의미하게 뛰어났다.
  • 궁금증을 통합한 모델은 새로운 미리 보지 않은 목표로의 일반화 성능이 더 뛰어났으며, 궁금증 없이 학습된 모델보다 더 높은 정밀도를 달성했다.
  • 시뮬레이션과 하드웨어 실험 모두에서 표준 iLQR에 비해 시스템 롤아웃 수를 40% 이상 감소시켰다.
  • 탐색 신호가 시간이 지남에 따라 감소하여, 모델 불확실성이 해결된 후 로봇이 탐색에서 이용으로 전환하는 것을 나타냈다.
  • 측정 노이즈와 낮은 제어 주기(100 Hz)에도 불구하고, 실제 하드웨어에서 세 번의 반복 실험에서 강건성과 재현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.