Skip to main content
QUICK REVIEW

[논문 리뷰] Deep 2FBSDEs For Systems With Control Multiplicative Noise

Marcus A. Pereira, Ziyi Wang|arXiv (Cornell University)|2019. 06. 11.
Stochastic processes and financial applications참고 문헌 39인용 수 7
한 줄 요약

이 논문은 제어 곱셈 노이즈가 있는 시스템에 대해 완전히 비선형 힐버트-자코비-벨만(HJB) 편미분방정식으로 지배되는 스토크라스틱 최적 제어 문제를 해결하기 위해 장기 단기 기억(LSTM) 순환 신경망을 기반으로 한 딥러닝 기반 알고리즘을 제안한다. 제2의 후방-전방 확률미분방정식(2FBSDE)을 활용함으로써 기존 방법에서 발생하는 오차 누적 및 확장성 문제를 해결하며, 로봇 및 생체역학 시스템의 시뮬레이션에서 뛰어난 성능과 안정성을 보여준다.

ABSTRACT

We present a deep recurrent neural network architecture to solve a class of stochastic optimal control problems described by fully nonlinear Hamilton Jacobi Bellmanpartial differential equations. Such PDEs arise when one considers stochastic dynamics characterized by uncertainties that are additive and control multiplicative. Stochastic models with the aforementioned characteristics have been used in computational neuroscience, biology, finance and aerospace systems and provide a more accurate representation of actuation than models with additive uncertainty. Previous literature has established the inadequacy of the linear HJB theory and instead rely on a non-linear Feynman-Kac lemma resulting in a second order forward-backward stochastic differential equations representation. However, the proposed solutions that use this representation suffer from compounding errors and computational complexity leading to lack of scalability. In this paper, we propose a deep learning based algorithm that leverages the second order Forward-Backward SDE representation and LSTM based recurrent neural networks to not only solve such Stochastic Optimal Control problems but also overcome the problems faced by previous approaches and scales well to high dimensional systems. The resulting control algorithm is tested on non-linear systems in robotics and biomechanics to demonstrate feasibility and out-performance against previous methods.

연구 동기 및 목표

  • 고차원 스토크라스틱 최적 제어 문제에 대해 선형화 및 샘플링 기반 방법의 한계를 해결하기 위해.
  • 비선형 HJB 편미분방정식을 위한 기존 FBSDE 기반 솔버에서 발생하는 오차 누적 및 계산 복잡도 문제를 극복하기 위해.
  • 완전히 비선형 HJB 방정식을 해결하기 위해 제2의 후방-전방 확률미분방정식 표현을 활용하는 확장 가능한 딥러닝 프레임워크를 개발하기 위해.
  • 로봇공학 및 생체역학 분야의 비선형 시스템에서 기존 방법(예: iLQG 및 표준 FBSDE)에 비해 타당성과 성능 향상을 입증하기 위해.
  • 순환 신경망을 위한 새로운 초기화 전략을 통해 고차원 시스템의 안정적인 학습을 가능하게 하기 위해.

제안 방법

  • 제어 곱셈 노이즈가 있는 시스템에 대해 비선형 페인만-카프 보조정리로부터 유도되는 제2의 후방-전방 확률미분방정식(2FBSDE)을 사용하여 스토크라스틱 최적 제어 문제를 수식화하기 위해.
  • 2FBSDE 시스템의 해를 근사하기 위해 장기 단기 기억(LSTM) 유닛 기반의 깊은 순환 신경망 아키텍처를 설계하기 위해.
  • 후방 SDE의 동역학에 기반한 손실 함수를 사용하며, 시간 이산화된 기울기를 역전파를 통한 시간 역행(backpropagation through time) 방식으로 계산하기 위해.
  • 이중 단계 학습 전략을 구현: 초기 학습 단계에서 네트워크 가중치를 0으로 초기화하여 발산을 방지하고, 이후 적응형 학습률을 사용하여 미세조정하기 위해.
  • 학습된 네트워크를 활용해 학습된 가치 함수 및 제어 함수에서 전방 확률미분방정식을 샘플링하여 제어 정책을 생성하기 위해.
  • 저차원 시스템(예: 카트폴)에는 Xavier 초기화를 사용하지만, 고차원 시스템(예: 퀴드코pter, 인간 팔)에는 학습을 안정화시키기 위해 0 초기화로 전환하기 위해.

실험 결과

연구 질문

  • RQ12FBSDE를 활용한 딥러닝 기반 접근법이 제어 곱셈 노이즈가 있는 고차원 스토크라스틱 최적 제어 문제를 효과적으로 해결할 수 있는가?
  • RQ2제안된 LSTM 기반 2FBSDE 프레임워크는 표준 FBSDE 솔버에 비해 오차 누적 문제를 줄일 수 있는가?
  • RQ3비선형 시스템에서 iLQG 및 표준 FBSDE에 비해 제어 궤적의 분산을 낮추고 더 높은 안정성을 확보할 수 있는가?
  • RQ4어떤 초기화 전략이 고차원 스토크라스틱 제어 문제를 위한 깊은 순환 신경망의 안정적 학습을 가능하게 하는가?
  • RQ52FBSDE 제어기가 시뮬레이션에서 제어 비용과 노이즈 수준이 다양할 경우 어떻게 성능을 발휘하는가?

주요 결과

  • 카트폴 시스템에서 2FBSDE 제어기는 FBSDE 및 iLQG에 비해 제어 궤적의 분산이 유의미하게 낮게 나타났으며, 특히 제어 비용이 낮을 경우(R=0.1) 두드러진 성능 향상을 보였다.
  • 6개의 근육과 제어 곱셈 노이즈가 있는 인간 팔 시뮬레이션에서 2FBSDE 제어기는 낮은 궤적 분산으로 목표에 성공적으로 도달했으며, iLQG는 발산하였다.
  • 쿼드코pter 시스템에서 2FBSDE는 3초 동안 안정적인 비행과 궤적 추적 성능을 보였으며, FBSDE 및 iLQG보다 분산이 낮았다.
  • 인간 팔 및 쿼드코프터와 같은 고차원 시스템에서 깊은 순환 신경망의 학습을 위해 0 초기화의 사용이 필수적이었으며, 이는 Xavier 초기화가 실패한 상황에서 수렴을 가능하게 했다.
  • 이 방법은 로봇공학 및 생체역학 분야의 다양한 비선형 시스템에서 뛰어난 확장성과 강건성을 보였으며, 기존 접근법보다 시뮬레이션에서 뛰어난 성능을 발휘했다.
  • 인간 팔 실험의 단계도 그래프는 2FBSDE가 작은 분산을 유지하고 목표에 도달한 반면, iLQG는 수렴하지 못했다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.