Skip to main content
QUICK REVIEW

[논문 리뷰] Large-time asymptotics in deep learning

Carlos Esteve, Borjan Geshkovski|arXiv (Cornell University)|2020. 08. 06.
Model Reduction and Neural Networks참고 문헌 93인용 수 9
한 줄 요약

이 논문은 신경 미분방정식(Neural ODE) 프레임워크를 통해 딥러닝의 장기적 점근적 성질을 연구하며, 학습 오차가 최종 시간 $T$에 대해 $\mathcal{O}(1/T)$로 감소하고, 최적 파라미터가 최소 $L^2$-노름 보간자로 수렴함을 보여준다. 전도성 이론에서 영감을 얻은 적분 정규화 항을 도입함으로써, 오차와 파라미터 양측 모두가 지수적 감소 $\mathcal{O}(e^{-\mu t})$를 보이며, 이는 이동 격자를 통한 시간에 따라 변하는 너비를 갖는 변수형 ResNet을 포함한 연속 공간-시간 신경망으로까지 확장된다.

ABSTRACT

We consider the neural ODE perspective of supervised learning and study the impact of the final time $T$ (which may indicate the depth of a corresponding ResNet) in training. For the classical $L^2$--regularized empirical risk minimization problem, whenever the neural ODE dynamics are homogeneous with respect to the parameters, we show that the training error is at most of the order $\mathcal{O}\left(\frac{1}{T} ight)$. Furthermore, if the loss inducing the empirical risk attains its minimum, the optimal parameters converge to minimal $L^2$--norm parameters which interpolate the dataset. By a natural scaling between $T$ and the regularization hyperparameter $λ$ we obtain the same results when $λ\searrow0$ and $T$ is fixed. This allows us to stipulate generalization properties in the overparametrized regime, now seen from the large depth, neural ODE perspective. To enhance the polynomial decay, inspired by turnpike theory in optimal control, we propose a learning problem with an additional integral regularization term of the neural ODE trajectory over $[0,T]$. In the setting of $\ell^p$--distance losses, we prove that both the training error and the optimal parameters are at most of the order $\mathcal{O}\left(e^{-μt} ight)$ in any $t\in[0,T]$. The aforementioned stability estimates are also shown for continuous space-time neural networks, taking the form of nonlinear integro-differential equations. By using a time-dependent moving grid for discretizing the spatial variable, we demonstrate that these equations provide a framework for addressing ResNets with variable widths.

연구 동기 및 목표

  • 신경 ODE 시각에서 최종 시간 $T$가 딥러닝의 학습 오차와 일반화에 미치는 영향을 분석하기 위해.
  • 과다 매개변수화된 영역에서 $T \to \infty$일 때 최적 파라미터가 최소 $L^2$-노름 보간자로 수렴함을 확립하기 위해.
  • 최적 제어 이론의 전도성 이론에서 영감을 얻은 적분 정규화를 통한 증강된 경험 위험에 의한 다항 감소율 향상.
  • 비선형 적분미분방정식으로 제어되는 연속 공간-시간 신경망으로 결과를 확장하기 위해.
  • 시간에 따라 변화하는 이동 격자를 통한 연속 공간-시간 공식화에서 변수형 너비 ResNet을 모델링할 수 있음을 보여주기 위해.

제안 방법

  • 깊이를 시간 범위로 간주하면서, 최종 시간 $T$를 가진 신경 ODE 최적 제어 문제로 감독 학습을 공식화한다.
  • 동차 동역학 하에서 $L^2$-정규화된 경험 위험 최소화를 분석하고, $\mathcal{O}(1/T)$ 학습 오차 감소를 도출한다.
  • 전도성 유사 행동과 지수 안정성을 강제하기 위해 $[0,T]$에 걸쳐 적분 정규화 항을 포함한 증강된 손실을 도입한다.
  • 그론발의 부등식과 제어 가능성 논증을 사용하여 궤적과 파라미터에 대한 안정성 추정을 유도한다.
  • 시간에 따라 변화하는 이동 격자를 도입하여 연속 공간-시간 신경망의 공간 변수를 이산화하고, 변수형 너비 ResNet 모델링을 가능하게 한다.
  • $\ell^p$-손실에 대해 증강된 공식화 하에서, 학습 오차와 최적 파라미터가 모두 $\mathcal{O}(e^{-\mu t})$로 지수 감소함을 증명한다.

실험 결과

연구 질문

  • RQ1신경 ODE에서 최종 시간 $T$를 증가시킬 경우, $L^2$-정규화된 학습에서 학습 오차에 어떤 영향을 미치는가?
  • RQ2과다 매개변수화된 영역에서 $T \to \infty$일 때 최적 파라미터의 점근적 행동은 어떠한가?
  • RQ3궤적 전역에 걸쳐 적분 정규화를 적용하면, $\mathcal{O}(1/T)$를 초월한 수렴 속도 향상이 가능한가?
  • RQ4결과들이 너비가 변하는 연속 공간-시간 신경망으로 어떻게 확장되는가?
  • RQ5전도성 이론은 신경 ODE 학습에서 지수 수렴을 달성하는 데 어떤 역할을 하는가?

주요 결과

  • 신경 ODE 동역학이 파라미터에 대해 동차일 경우, $L^2$-정규화된 경험 위험 최소화 하에서 학습 오차는 $\mathcal{O}(1/T)$로 감소한다.
  • 최적 파라미터는 $T \to \infty$일 때 데이터셋의 최소 $L^2$-노름 보간자로 수렴하며, 이는 과다 매개변수화된 영역에서 일반화를 보장한다.
  • $\lambda \searrow 0$로 스케일링하고 $T$를 고정할 경우, 동일한 $\mathcal{O}(1/T)$ 감소율이 유지되며, 깊이와 정규화 사이의 연관성을 확립한다.
  • 추가적인 적분 정규화 항이 존재할 경우, $t \in [0,T]$ 전역에서 학습 오차와 최적 파라미터가 모두 지수적으로 감소하는 $\mathcal{O}(e^{-\mu t})$를 보인다.
  • 지수 감소 결과는 $\ell^p$-거리 손실에 대해 성립하며, 비선형 적분미분방정식으로 제어되는 연속 공간-시간 신경망으로까지 확장된다.
  • 시간에 따라 변화하는 이동 격자는 연속 공간-시간 프레임워크가 변수형 너비 ResNet을 모델링할 수 있도록 하며, 안정성과 수렴 성질을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.