Skip to main content
QUICK REVIEW

[논문 리뷰] Neural SDEs as Infinite-Dimensional GANs

Patrick Kidger, James Foster|arXiv (Cornell University)|2021. 02. 06.
Model Reduction and Neural Networks참고 문헌 60인용 수 7
한 줄 요약

이 논문은 신경망 기반 확률 미분 방정식(Stochastic Differential Equations, SDEs)을 무한차원 Wassertein GAN으로 재해석함으로써 연속시간 생성 모델로 제시한다. 여기서 신경망 SDE는 생성기 역할을 하며, 신경망 제어 미분 방정식(Neural Controlled Differential Equation, CDE)은 판별기 역할을 한다. 이 방법은 사전에 정의된 통계 또는 밀도 함수에 의존하지 않고, 임의의 드리프트 및 확산 함수를 엔드 투 엔드로 학습할 수 있게 하여, 무한한 데이터 근처에서 유일한 전역 수렴성을 보장함으로써 시계열 모델링 과제에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Stochastic differential equations (SDEs) are a staple of mathematical modelling of temporal dynamics. However, a fundamental limitation has been that such models have typically been relatively inflexible, which recent work introducing Neural SDEs has sought to solve. Here, we show that the current classical approach to fitting SDEs may be approached as a special case of (Wasserstein) GANs, and in doing so the neural and classical regimes may be brought together. The input noise is Brownian motion, the output samples are time-evolving paths produced by a numerical solver, and by parameterising a discriminator as a Neural Controlled Differential Equation (CDE), we obtain Neural SDEs as (in modern machine learning parlance) continuous-time generative time series models. Unlike previous work on this problem, this is a direct extension of the classical approach without reference to either prespecified statistics or density functions. Arbitrary drift and diffusions are admissible, so as the Wasserstein loss has a unique global minima, in the infinite data limit any SDE may be learnt. Example code has been made available as part of the exttt{torchsde} repository.

연구 동기 및 목표

  • 클래식한 SDE 모델링과 현대적 딥러닝을 통합하기 위해 SDE 피팅 문제를 Wassertein GAN 문제로 재해석함으로써 SDE 모델링을 재정의한다.
  • 이전의 신경망 SDE 접근 방식이 사전에 정의된 통계나 밀도 함수에 의존하는 한계를 극복한다.
  • 임의의 드리프트 및 확산 함수를 사용하여 유연하고 고용량의 확률적 시계열 모델링을 가능하게 한다.
  • Wassertein GAN 공식화가 무한한 데이터 근처에서 SDE 학습에 대해 고유한 전역 최소값을 보장함으로써 임의의 SDE를 일관적으로 학습시킬 수 있음을 입증한다.

제안 방법

  • 브라운 운동 입력으로부터 샘플 경로를 생성하는 신경망 SDE를 생성기로 설정한다.
  • 실제 데이터 경로와 생성된 경로를 구분하기 위해 신경망 CDE를 판별기로 사용한다.
  • 1-Wasserstein 손실을 사용하여 생성기와 판별기를 함께 최소-최대 목표 함수를 통해 학습시킨다.
  • 완전한 유연성을 확보하기 위해 드리프트 및 확산 함수를 모두 딥 뉴럴 네트워크로 파arameter화한다.
  • GAN 유사 목표 함수의 학습 안정성을 높이기 위해 확률적 가중치 평균화와 최종 tanh 비선형성 적용.
  • 진동 행동이 일반적인 최소-최대 학습에서 발생하는 것을 완화하기 위해 Adadelta 옵timizer와 가중치 감쇠를 사용한다.

실험 결과

연구 질문

  • RQ1기존에 사전 정의된 통계에 의존하는 고전적 SDE 피팅 문제를 GAN 기반 학습 문제로 재해석할 수 있는가?
  • RQ2신경망 SDE를 무한차원 GAN으로 재해석함으로써 밀도 추정 없이도 임의의 드리프트 및 확산 함수를 학습시킬 수 있는가?
  • RQ3이 방법은 기존의 Latent ODEs나 CTFPs와 비교해 시계열 모델링 과제에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ4Wasserstein GAN 공식화가 SDE 학습에 대해 무한한 데이터 근처에서 고유한 전역 수렴성을 보장하는가?
  • RQ5연속시간 GAN에서 최소-최대 목표 함수의 안정성을 높이기 위한 학습 기법은 무엇인가?

주요 결과

  • 금융 시계열 데이터셋에서 신경망 SDE는 예측(0.144 ± 0.045)과 MMD(1.92 ± 0.09)에서 최고 성능을 기록하여 CTFP 및 Latent ODE를 앞서며 뛰어난 성능을 보였다.
  • 대기 질 데이터셋에서 신경망 SDE는 가장 낮은 MMD(0.000160 ± 0.000029)와 경쟁 가능한 예측(0.395 ± 0.056)을 기록하여 뛰어난 경로 공간 모델링 능력을 입증했다.
  • MNIST 무게 동역학 데이터셋에서 신경망 SDE는 최고의 MMD(5.28 ± 1.27)를 기록했으며, CTFP 대비 예측 오차가 10배 향상되었다(0.00843 ± 0.00759).
  • 확률적 가중치 평균화와 최종 tanh 비선형성은 학습 안정성과 최종 모델 성능을 크게 향상시켰다.
  • Adadelta는 SGD와 Adam보다 학습 안정성과 최종 지표 성능에서 뛰어난 성능을 보였지만, 그 이유는 아직 명확하지 않다.
  • Wasserstein 손실의 고유한 전역 최소값 덕분에 이 방법은 무한한 데이터 근처에서 임의의 SDE를 성공적으로 학습시켜 일관되고도 민감한 모델링이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.