Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning of Koopman Representation for Control

Yiqiang Han, Wenjian Hao|arXiv (Cornell University)|2020. 10. 15.
Model Reduction and Neural Networks참고 문헌 25인용 수 5
한 줄 요약

이 논문은 비선형 제어 시스템을 선형이며 무한차원 공간으로 러프팅하기 위해 코프만 연산자를 활용하는 데이터 기반, 모델 기반 프레임워크인 Deep Koopman Representation for Control (DKRC)을 제안한다. 이 방법은 딥 뉴럴 네트워크(DNN)를 사용해 최적의 기저 함수를 학습하며, OpenAI Gym 환경인 흔들리는 단순 진자와 Lunar Lander에서 DDPG 강화 학습보다 훈련 효율성과 제어 성능 면에서 뛰어나다.

ABSTRACT

We develop a data-driven, model-free approach for the optimal control of the dynamical system. The proposed approach relies on the Deep Neural Network (DNN) based learning of Koopman operator for the purpose of control. In particular, DNN is employed for the data-driven identification of basis function used in the linear lifting of nonlinear control system dynamics. The controller synthesis is purely data-driven and does not rely on a priori domain knowledge. The OpenAI Gym environment, employed for Reinforcement Learning-based control design, is used for data generation and learning of Koopman operator in control setting. The method is applied to two classic dynamical systems on OpenAI Gym environment to demonstrate the capability.

연구 동기 및 목표

  • 비선형 시스템 제어에서 사전 도메인 지식이나 수작업으로 만든 기저 함수가 필요 없도록 데이터 기반, 모델 기반의 제어 프레임워크를 개발하는 것.
  • 자율 시스템에서의 딥 러닝 기반 코프만 연산자 식별을 입력 제어가 있는 제어된 동역학 시스템으로 확장하는 것.
  • DNN를 통해 적절한 고차원 기저 함수를 학습함으로써 러프팅된 공간에서 선형 제어 기법(LQR 및 MPC)을 가능하게 하는 것.
  • OpenAI Gym의 벤치마크 제어 환경(예: 진자 및 Lunar Lander 포함)에서 제안된 방법의 효과성을 입증하는 것.
  • 모델 기반 제어와 모델 기반 강화 학습 간 격차를 데이터 기반 코프만 표현을 활용해 메우는 것.

제안 방법

  • 이 방법은 OpenAI Gym 환경에서의 시계열 데이터를 활용해 비선형 상태 공간의 유한차원 고차원 러프팅을 위해 딥 뉴럴 네트워크(DNN)를 사용한다.
  • 러프팅된 공간에서 코프만 연산자는 선형 모델을 통해 근사된다: Ψ(x_{t+1}) = AΨ(x_t) + Bu_t, 여기서 Ψ(x)는 DNN에 의해 학습된 기저 함수를 나타낸다.
  • 기본적으로 정의된 함수(예: 다항식 또는 반경 기반 함수)에 의존하지 않고 데이터로부터 종단 간(end-to-end)으로 기저 함수를 학습한다.
  • 충분한 탐색을 보장하기 위해 오르누슈타인-율리히 노이즈가 첨가된 무작위 정책으로 생성된 데이터를 사용해 코프만 표현을 훈련한다.
  • 식별된 선형 동역학을 기반으로 러프팅된 공간에서 모델 예측 제어(MPC)를 적용하여 제어 합성을 수행한다.
  • 이 프레임워크는 두 개의 OpenAI Gym 환경에서 평가된다: 진자 스위치 업 작업과 Lunar Lander 제어 작업.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크는 사전 도메인 지식 없이 비선형 동역학 시스템의 선형 제어를 가능하게 하는 코프만 기저 표현을 효과적으로 학습할 수 있는가?
  • RQ2훈련 효율성과 제어 정확성 측면에서 DNN에 의해 학습된 코프만 표현은 최신 강화 학습 기법(예: DDPG)과 비교해 어떻게 성능을 내는가?
  • RQ3제안된 방법은 복잡한 환경인 Lunar Lander에서 다양한 초기 조건에 일반화되고 외부 교란에 저항하는가?
  • RQ4학습된 코프만 표현이 시스템 에너지 동역학을 얼마나 잘 유지하며 목표 상태에 빠르게 수렴시키는가?
  • RQ5순수하게 데이터 기반의 코프만 학습 프레임워크로 모델 기반 제어 성능을 달성할 수 있는가?

주요 결과

  • DKRC 프레임워크는 Lunar Lander 환경에서 다섯 게임 동안 수집한 1876개의 데이터 쌍을 기반으로 코프만 표현을 성공적으로 학습하여 진짜 시스템 모델에 접근할 수 없음에도 효과적인 제어를 가능하게 하였다.
  • 진자 제어 작업에서 DKRC 컨트롤러는 시스템 에너지 수준을 신속히 최소화하여 단시간 내에 목표 상태(θ=0, ˙θ=0)에 도달하였으며, 해밀토니안 에너지 수준선을 효율적으로 횡단하는 궤적을 통해 이를 입증하였다.
  • DKRC 모델은 랜덤한 초기 조건에 대해 강건성을 보였으며, 진자 및 Lunar Lander 환경에서 10회의 별도 게임 실행에서 목표 상태로의 수렴이 일관되게 관찰되었다.
  • 특히 에너지 최소화와 수렴 속도 측면에서 DDPG 강화 학습 기준선 대비 더 빠른 훈련과 향상된 제어 성능을 달성하였다.
  • 해밀토니안 에너지 수준에 따라 색상 매핑된 3차원 상태-시간 궤적도 DKRC가 체계적 에너지를 효과적으로 감소시켜 최적의 제어 행동을 나타내는 것으로 나타났다.
  • 이 방법은 러프팅된 공간에서 MPC를 성공적으로 적용하였으며, 코프만 기반 선형 모델이 비선형 시스템에 대해 고전적인 선형 제어 기법을 적용할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.