Skip to main content
QUICK REVIEW

[논문 리뷰] Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach

Wenjian Hao, Yiqiang Han|arXiv (Cornell University)|2020. 06. 16.
Model Reduction and Neural Networks참고 문헌 26인용 수 7
한 줄 요약

이 논문은 신경망을 사용하여 업그레이드된 공간에서 비선형 역학 모델을 선형화하는 방식으로 작동하는 모델 기반 데이터 기반 제어 방법인 Deep Koopman Representation for Control (DKRC)와 모델 없는 접근 방식인 Deep Deterministic Policy Gradient (DDPG)를 비교한다. DKRC는 훨씬 적은 학습 에포크(70 대비 50,000)와 샘플을 사용하면서도 DDPG와 유사한 제어 성능을 달성하며, 물리 기반의 모델 구조 덕분에 더 높은 해석 가능성과 강건성을 확보한다. 이는 분석적 오일러-라그랑주 선형화와의 높은 상관관계(0.8926)로 검증되었다.

ABSTRACT

This paper compares two different types of data-driven control methods, representing model-based and model-free approaches. One is a recently proposed method - Deep Koopman Representation for Control (DKRC), which utilizes a deep neural network to map an unknown nonlinear dynamical system to a high-dimensional linear system, which allows for employing state-of-the-art control strategy. The other one is a classic model-free control method based on an actor-critic architecture - Deep Deterministic Policy Gradient (DDPG), which has been proved to be effective in various dynamical systems. The comparison is carried out in OpenAI Gym, which provides multiple control environments for benchmark purposes. Two examples are provided for comparison, i.e., classic Inverted Pendulum and Lunar Lander Continuous Control. From the results of the experiments, we compare these two methods in terms of control strategies and the effectiveness under various initialization conditions. We also examine the learned dynamic model from DKRC with the analytical model derived from the Euler-Lagrange Linearization method, which demonstrates the accuracy in the learned model for unknown dynamics from a data-driven sample-efficient approach.

연구 동기 및 목표

  • 비선형 제어 작업에서 모델 기반 데이터 기반 제어(DKRC)와 모델 없는 강화 학습(DDPG)을 비교하는 것.
  • 다양한 초기 조건 하에서 DKRC와 DDPG의 샘플 효율성과 강건성 평가하기.
  • 오일러-라그랑주 선형화로부터 유도된 분석적 모델과 비교하여 DKRC에서 학습된 역학의 정확도 검증하기.
  • 특히 모델 불확실성 하에서 DKRC가 학습한 업그레이드된 선형 시스템에 대해 모델 예측 제어(MPC)의 성능 평가하기.
  • 데이터 기반 쿠르프만 표현이 시스템 방정식에 대한 사전 지식 없이도 고정밀도 시스템 모델링을 달성할 수 있음을 보여주는 것.

제안 방법

  • 비선형 시스템을 고차원 선형 공간으로 올리는 데 유한 차원의 쿠르프만 표현을 학습하기 위해 딥 네ural 네트워크를 사용한다. 이는 모델 예측 제어(MPC)를 통한 선형 제어를 가능하게 한다.
  • 쿠르프만 역학을 이산화하기 위해 제로 오더 홀딩(ZOH) 방법을 적용하여 업그레이드된 시스템 모델의 수치적 구현 가능하게 한다.
  • 업그레이드된 시스템의 선형 구조를 활용해 볼록 최적화 문제를 CVXPY를 통해 해결함으로써 실시간이고 강건한 제어를 구현한다.
  • Inverted Pendulum 환경에서 2,000개의 데이터 포인트만을 사용하여 쿠르프만 연산자 근사치를 학습하기 위해 DKRC 프레임워크를 훈련시킨다.
  • 연속된 액션 공간을 가진 동일한 환경에서 엔드 투 엔드로 훈련되는 모델 없는 기반선인 Deep Deterministic Policy Gradient(DDPG) 알고리즘을 사용한다.
  • 쿠르프만 역학의 학습된 결과와 오일러-라그랑주 방법으로 유도된 분석적 선형화 결과를 피어슨 상관계수(PCC)를 사용하여 비교하여 모델 유사도를 정량화한다.

실험 결과

연구 질문

  • RQ1DKRC는 비선형 동적 시스템에 대한 효과적인 제어 정책을 학습할 때 DDPG에 비해 얼마나 뛰어난 샘플 효율성을 보이는가?
  • RQ2DKRC에서 학습된 쿠르프만 표현은 오일러-라그랑주 방정식에서 유도된 분석적 선형화된 역학과 어느 정도 일치하는가?
  • RQ3모델 기반 DKRC 접근 방식은 모델 없는 DDPG에 비해 다양한 초기 조건에서 어떻게 성능을 발휘하는가?
  • RQ4DKRC가 학습한 업그레이드된 선형 시스템에 대해 적용된 MPC는 모델 정확도 부족에도 불구하고 강건한 제어 성능을 달성할 수 있는가?
  • RQ5물리 기반의 모델 기반 방법(DKRC)과 순수하게 데이터 기반의 정책 기반 방법(DDPG)을 사용할 때 해석 가능성과 성능 사이의 상충 관계는 어떠한가?

주요 결과

  • DKRC는 Inverted Pendulum 및 Lunar Lander 작업에서 DDPG와 동일한 제어 성능를 달성했지만, DDPG의 50,000 에포크에 비해 단 70 에포크만으로도 학습을 완료했다.
  • DKRC에서 학습된 역학은 분석적 오일러-라그랑주 선형화와 높은 피어슨 상관계수 0.8926를 보이며, 진정한 시스템 역학과의 높은 유사성을 나타냈다.
  • DKRC는 오일러-라그랑주 MPC 방법에 비해 직립 자세로 수렴하는 데 약 20%의 시간만을 소요하여 수렴 속도가 뛰어나다는 것을 입증했다.
  • 모델 기반 DKRC 프레임워크는 특히 큰 초기 이격을 다룰 때 DDPG보다 초기 조건 변화에 더 강건한 성능를 보였다.
  • DKRC가 학습한 선형 모델에 적용된 MPC 컨트롤러는 작은 모델 오차에도 불구하고 내성을 보이며, 모델 기반 학습에서 피드백 제어의 이점을 확인했다.
  • 데이터 기반 쿠르프만 표현은 오직 2,000개의 데이터 포인트만으로도 시스템의 본질적 역학을 성공적으로 포착했으며, 이는 샘플 효율성과 실세계 적용 잠재력의 증거이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.