Skip to main content
QUICK REVIEW

[논문 리뷰] Deep neural networks algorithms for stochastic control problems on finite horizon: numerical applications

Achref Bachouch, Côme Huré|arXiv (Cornell University)|2018. 12. 13.
Stochastic processes and financial applications참고 문헌 25인용 수 68
한 줄 요약

이 논문은 성능 반복(Performance Iteration)과 하이브리드 반복( Hybrid Iteration) 알고리즘을 통해 가치 함수와 최적 정책을 신경망을 이용해 근사함으로써 고차원 유한시간 영역 확률적 제어 문제를 해결하기 위한 딥러닝 기반 알고리즘—NNcontPI, Hybrid-Now, Hybrid-LaterQ, ClassifHybrid—을 제안한다. 이 방법들은 특히 고차원에서 Qknn와 같은 양자화 기반 기준 대비 경쟁력 있거나 우수한 성능을 보이며, 100차원 PDE, 옵션 헤징, 마이크로그리드 관리 문제에서 실증적으로 검증되었다.

ABSTRACT

This paper presents several numerical applications of deep learning-based algorithms that have been introduced in [HPBL18]. Numerical and comparative tests using TensorFlow illustrate the performance of our different algorithms, namely control learning by performance iteration (algorithms NNcontPI and ClassifPI), control learning by hybrid iteration (algorithms Hybrid-Now and Hybrid-LaterQ), on the 100-dimensional nonlinear PDEs examples from [EHJ17] and on quadratic backward stochastic differential equations as in [CR16]. We also performed tests on low-dimension control problems such as an option hedging problem in finance, as well as energy storage problems arising in the valuation of gas storage and in microgrid management. Numerical results and comparisons to quantization-type algorithms Qknn, as an efficient algorithm to numerically solve low-dimensional control problems, are also provided; and some corresponding codes are available on https://github.com/comeh/.

연구 동기 및 목표

  • 고차원 유한시간 영역 확률적 제어 문제에서의 차원의 극복 문제를 딥 뉴럴 네트워크를 통해 해결하기 위해.
  • 성능 반복 및 하이브리드 반복 알고리즘을 도입하여 액터-크리틱 강화학습 방법을 유한시간 문제로 확장하기 위해.
  • 고차원 및 저차원 제어 문제에 대해 딥러닝 기반 알고리즘의 수치적 검증을 제공하기 위해.
  • 정확도 및 계산 효율성 측면에서 기존의 양자화 기반 방법(Qknn)과 제안된 알고리즘을 비교하기 위해.
  • 가스 저장 및 마이크로그리드 관리와 같은 복잡한 실세계 제어 문제를 해결하는 데 있어 딥러닝의 실현 가능성과 효율성을 입증하기 위해.

제안 방법

  • 제어 정책과 가치 함수를 각각 매개변수 θ와 β를 가진 딥 뉴럴 네트워크(DNNs)로 매개변수화한다.
  • 몬테 카를로 회귀를 이용해 성능 반복(PI)과 하이브리드 반복 기반의 반복적 개선 기법을 활용하여 정책 및 가치 함수 추정치를 향상시킨다.
  • 두 가지 학습 전략 변형을 적용한다: 탐색 없이 지식 기반의 이용 전용 전략과, 초기 제어 추정치로부터의 경험적 측도를 사용하는 탐색 후 이용 전략.
  • 분류와 회귀를 융합한 하이브리드 접근 방식(ClassifHybrid)을 통해 마이크로그리드 관리와 같은 혼합 이산-연속 제어 공간을 효과적으로 다룬다.
  • 각 시간 단계에서 상태를 샘플링하기 위해 균일 분포 또는 경험적 분포를 기반으로 한 훈련 측도 µn을 설계한다.
  • 수렴 가속화와 시간 안정성 향상을 위해 다음 시간 단계의 가중치를 사용해 가치 함수 네트워크를 사전 학습한다.

실험 결과

연구 질문

  • RQ1기존 방법이 차원의 극복 문제로 실패하는 고차원 확률적 제어 문제를 딥러닝 기반 알고리즘이 효과적으로 해결할 수 있는가?
  • RQ2100차원 비선형 PDE와 이차 백분화 방정식(Quadratic BSDEs)에서 성능 반복 및 하이브리드 반복 알고리즘이 정확도와 계산 비용 측면에서 어떻게 비교되는가?
  • RQ3저차원 제어 문제에서 제안된 딥러닝 방법이 Qknn와 같은 양자화 기반 알고리즘을 어느 정도 초월하는가?
  • RQ4학습 분포 선택(이용 전용 vs. 탐색)이 학습된 정책의 수렴성과 정확성에 어떤 영향을 미치는가?
  • RQ5하이브리드 신경망 아키텍처가 마이크로그리드 관리와 같은 혼합 이산-연속 제어 공간을 기존 방법보다 더 효과적으로 다룰 수 있는가?

주요 결과

  • N=30일 때 ClassifHybrid는 마이크로그리드 문제에 대해 가치 함수 추정치 33.34 (±0.31)를 달성하여 Qknn의 35.37 (±0.34)보다 뛰어난 성능을 보였다.
  • N=200일 때 Qknn는 가치 함수를 231.8 (±1.2)로 추정하여 장기간에 걸친 안정적인 성능을 나타냈다.
  • Hybrid-Now는 마이크로그리드 문제에서 Qknn를 능가했지만, Qknn의 1분 미만 런타임 대비 7분이 소요되었다.
  • Qknn에서 유래한 최적 결정은 자연스러운 행동을 보였다: 배터리 용량이 부족할 때 발전기를 켜고, 수요가 음수거나 배터리가 가득 찬 경우 끈다.
  • ClassifHybrid는 복잡한 혼합 이산-연속 제어 공간을 효과적으로 관리하여 Qknn보다 더 우수한 결과를 달성했다.
  • 다음 시간 단계의 가중치를 사용해 가치 함수 네트워크를 사전 학습함으로써 훈련 시간을 크게 단축하고 추정치의 시간 안정성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.