Skip to main content
QUICK REVIEW

[논문 리뷰] Information Theoretic Model Predictive Q-Learning

Mohak Bhardwaj, Ankur Handa|arXiv (Cornell University)|2019. 12. 31.
Advanced Control Systems Optimization참고 문헌 40인용 수 6
한 줄 요약

이 논문은 표본 효율성과 강건성을 향상시키기 위해 정보 이론적 모델 예측 제어(MPC)와 엔트로피 정규화된 Q-학습을 결합한 새로운 알고리즘인 모델 예측 Q-학습(MPQ)을 소개한다. 실제 세계의 롤아웃을 사용해 Q-함수를 훈련하면서도 MPC를 활용해 안정적이고 장기적인 계획을 수행함으로써, MPQ는 모델 편향과 희박한 보상 환경에서도 MPC와 소프트 Q-학습보다 더 빠른 수렴과 뛰어난 성능을 달성한다.

ABSTRACT

Model-free Reinforcement Learning (RL) works well when experience can be collected cheaply and model-based RL is effective when system dynamics can be modeled accurately. However, both assumptions can be violated in real world problems such as robotics, where querying the system can be expensive and real-world dynamics can be difficult to model. In contrast to RL, Model Predictive Control (MPC) algorithms use a simulator to optimize a simple policy class online, constructing a closed-loop controller that can effectively contend with real-world dynamics. MPC performance is usually limited by factors such as model bias and the limited horizon of optimization. In this work, we present a novel theoretical connection between information theoretic MPC and entropy regularized RL and develop a Q-learning algorithm that can leverage biased models. We validate the proposed algorithm on sim-to-sim control tasks to demonstrate the improvements over optimal control and reinforcement learning from scratch. Our approach paves the way for deploying reinforcement learning algorithms on real systems in a systematic manner.

연구 동기 및 목표

  • 실제 로봇 공학에서 모델 프리 강화 학습의 표본 비효율성과 모델 기반 강화 학습의 모델 편향 문제를 해결하기 위해.
  • 비용이 많이 들고 동역학 모델이 완벽하지 않은 실제 상호작용이 많은 제어 작업에서의 표본 효율성과 강건성을 향상시키기 위해.
  • 모델 편향을 보완하기 위해 실제 세계 데이터를 활용하면서도 MPC의 계획 기능을 유지하는 방법을 개발하기 위해.
  • 진짜 시스템 롤아웃에서 Q-함수를 학습하는 것이 도메인 랜덤화와 모델 기반 기준보다 우수한 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 정보 이론적 MPC와 엔트로피 정규화된 강화 학습 사이의 이론적 연결을 제안하여 정책 최적화를 위한 통합 프레임워크를 가능하게 한다.
  • 편향된 모델을 사용한 MPC를 활용해 Q-함수 타겟을 위한 롤아웃을 생성함으로써, 실제 세계 상호작용에서 안정적이고 효율적인 학습을 가능하게 한다.
  • 탐색을 장려하고 학습 중 조기 수렴을 방지하기 위해 엔트로피 정규화를 적용한다.
  • 실제 시스템 롤아웃을 사용해 Q-함수를 훈련함으로써, 진짜 동역학에 적응하고 모델 편향을 줄일 수 있도록 한다.
  • 학습된 Q-함수의 전역 정보를 활용해 MPC의 계획 수렴 시간을 단축시킴으로써 계산 효율성을 향상시킨다.
  • 타겟 네트워크를 사용하지 않고 MPC가 생성한 타겟을 활용함으로써 학습을 단순화하고 안정성을 높인다.

실험 결과

연구 질문

  • RQ1실제 세계 롤아웃에서 학습한 Q-함수는 MPC 기반 제어에서 모델 편향을 극복할 수 있는가?
  • RQ2MPC와 엔트로피 정규화된 Q-학습을 결합하면 모델 프리 강화 학습보다 표본 효율성이 향상되는가?
  • RQ3희박한 보상과 불완전한 모델이 존재하는 작업에서 MPQ는 MPC와 소프트 Q-학습보다 더 뛰어난 성능을 낼 수 있는가?
  • RQ4진짜 시스템 파라미터가 알려진 상황에서 도메인 랜덤화와 비교했을 때 MPQ는 시뮬레이션에서 시뮬레이션으로의 전이 성능이 어떻게 되는가?
  • RQ5성능을 희생시키지 않고 MPQ는 MPC 계획 수렴 시간을 효과적으로 단축시킬 수 있는가?

주요 결과

  • FetchPushBlock와 FrankaDrawerOpen에서 MPQ는 짧은 수렴 수렴(H=10)을 사용했을 때 더 긴 수렴 수렴(H=64)을 사용한 MPPI보다 뛰어난 성능을 보였으며, 후자의 경우 성공률이 5배 이상 높았다.
  • BallInCupSparse에서 MPQ는 H=4와 실제 세계 롤아웃을 사용해 85%의 성공률를 기록했고, DR 기반 훈련은 41%에 그쳤다.
  • FrankaDrawerOpen에서 MPQ는 실제 세계 롤아웃을 사용해 53%의 성공률를 달성했고, DR 기준은 단지 17%에 그쳤다.
  • MPQ는 실제 시스템 상호작용을 약 몇 분 간만으로도 안정된 정책으로 수렴했고, 소프트 Q-학습은 동일한 작업에서 일관된 수렴에 실패했다.
  • H=10인 MPQ는 진짜 동역학과 H=64를 사용한 MPPI보다 뛰어난 성능을 보였으며, 이는 Q-함수의 전역 정보가 유용함을 보여준다.
  • Q-함수가 장기 수렴 효과를 일반화할 수 있기 때문에, 계산 비용을 줄이기 위해 수렴 수렴 시간을 효과적으로 단축시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.