Skip to main content
QUICK REVIEW

[논문 리뷰] Koopman-Assisted Reinforcement Learning

Preston Rozwood, Edward Mehrez|arXiv (Cornell University)|2024. 03. 04.
EEG and Brain-Computer InterfacesNeuroscience인용 수 3
한 줄 요약

이 논문은 비선형 동역계를 무한차원 함수 공간에서 선형 표현으로 올리는 데 Koopman 연산자를 활용하는 새로운 프레임워크인 Koopman-Assisted Reinforcement Learning (KARL)을 소개한다. 이를 통해 해밀턴-자코비-벨만 방정식의 해법이 더 다루기 쉽게 된다. Koopman 텐서를 사용해 소프트 밸류 반복과 소프트 액터-크리틱을 재구성함으로써, KARL은 비선형, 혼돈적, 확률적인 제어 과제에서 최신 기준 성능을 달성하며, 표준 SAC 및 고전적 LQR 기준보다 뛰어난 성능을 보인다.

ABSTRACT

The Bellman equation and its continuous form, the Hamilton-Jacobi-Bellman (HJB) equation, are ubiquitous in reinforcement learning (RL) and control theory. However, these equations quickly become intractable for systems with high-dimensional states and nonlinearity. This paper explores the connection between the data-driven Koopman operator and Markov Decision Processes (MDPs), resulting in the development of two new RL algorithms to address these limitations. We leverage Koopman operator techniques to lift a nonlinear system into new coordinates where the dynamics become approximately linear, and where HJB-based methods are more tractable. In particular, the Koopman operator is able to capture the expectation of the time evolution of the value function of a given system via linear dynamics in the lifted coordinates. By parameterizing the Koopman operator with the control actions, we construct a ``Koopman tensor'' that facilitates the estimation of the optimal value function. Then, a transformation of Bellman's framework in terms of the Koopman tensor enables us to reformulate two max-entropy RL algorithms: soft value iteration and soft actor-critic (SAC). This highly flexible framework can be used for deterministic or stochastic systems as well as for discrete or continuous-time dynamics. Finally, we show that these Koopman Assisted Reinforcement Learning (KARL) algorithms attain state-of-the-art (SOTA) performance with respect to traditional neural network-based SAC and linear quadratic regulator (LQR) baselines on four controlled dynamical systems: a linear state-space system, the Lorenz system, fluid flow past a cylinder, and a double-well potential with non-isotropic stochastic forcing.

연구 동기 및 목표

  • 강화학습에서 흔히 발생하는 고차원 비선형 시스템에서 해밀턴-자코비-벨만 방정식의 해법이 비가역적인 문제를 해결하기 위해.
  • 비선형 역학을 선형 Koopman 프레임워크에 통합함으로써 딥 강화학습의 해석 가능성과 샘플 효율성을 향상시키기 위해.
  • 소프트 Q-학습 및 SAC와 같은 최대 엔트로피 강화학습 알고리즘을 Koopman-통합 공간에서 작동하도록 확장하기 위해.
  • 혼돈적이고 확률적인 동역계를 포함한 도전적인 시스템에 대해 일반화 능력과 성능 향상을 달성할 수 있는 강력한 제어를 가능하게 하기 위해.

제안 방법

  • 비선형 역학을 Koopman 불변 함수 공간으로 올려, 시스템 역학이 근사적으로 선혠회게 되는 환경을 만든다.
  • 값 함수를 Koopman 관측량으로 표현함으로써, Koopman 연산자를 통한 선형적 값 추정 전파를 가능하게 한다.
  • 상태와 제어 입력에 대한 동역학의 공동 의존성을 캐릭터라이즈하는 Koopman 텐서를 구성함으로써, 벨만 갱신의 매개변수화를 가능하게 한다.
  • Koopman 텐서를 사용해 소프트 밸류 반복과 소프트 액터-크리틱을 재구성함으로써, 올린 공간에서 최대 엔트로피 목표를 유지한다.
  • 동적 모드 분해 또는 확장된 DMD를 통해 데이터 기반 Koopman 연산자 근사치를 계산함으로써, 궤적에서 Koopman 연산자를 추정한다.
  • 계산의 실현 가능성을 확보하기 위해 소프트 Koopman 밸류 반복에서 이산화된 행동 공간을 구현한다.

실험 결과

연구 질문

  • RQ1Koopman 연산자는 비선형 마르코프 결정 과정에서 값 함수 역학을 선형화하는 데 사용될 수 있는가? 이를 통해 더 효율적이고 안정적인 강화학습가 가능해지는가?
  • RQ2Koopman 연산자는 소프트 Q-학습 및 SAC와 같은 최대 엔트로피 강화학습 알고리즘에 어떻게 통합될 수 있는가? 이를 통해 탐색 능력을 유지하면서 샘플 효율성을 향상시킬 수 있는가?
  • RQ3Koopman 기반 방법은 비선형, 혼돈적, 확률적인 시스템에서 표준 딥 강화학습 및 고전적 제어 기준보다 어느 정도 뛰어난 성능을 보일 수 있는가?
  • RQ4Koopman 프레임워크는 복잡한 동역계에서 학습된 정책과 값 함수의 해석 가능성을 어느 정도 향상시키는가?

주요 결과

  • KARL은 네 가지 벤치마크 제어 과제에서 최신 기준 성능을 달성했다: 선형 상태공간 시스템, 로렌츠 시스템, 원통 주위의 유체 흐름, 비등방성 확률적 외력이 작용하는 더블웰 포텐셜.
  • KARL은 비선형 및 혼돈적 시스템에서 표준 신경망 기반 소프트 액터-크리틱(SAC) 및 고전적 선형 제곱조절기(LQR) 기준보다 뛰어난 성능을 보였다.
  • Koopman 보조 소프트 밸류 반복 및 액터-크리틱 알고리즘은 최적 정책 학습에서 뛰어난 샘플 효율성과 안정성을 보였다.
  • 추가 실험 결과는 Koopman 텐서의 수식이 성능에 필수적임을 확인하였으며, Koopman 올림이 제거될 경우 성능이 크게 떨어짐을 보였다.
  • 이 프레임워크는 주요 관측량(특징)이 값 함수 역학을 어떻게 이끄는지 드러내어, 고차원 시스템에서 성능 향상과 함께 해석 가능성을 향상시켰다.
  • 연속 행동에 대한 초보적 결과는 가우시안 공간에서 소프트 정책의 KL 근사치를 사용하면 연속 행동 확장이 가능할 수 있음을 시사하였으며, 완전한 구현은 향후 작업으로 남겨두었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.