Skip to main content
QUICK REVIEW

[논문 리뷰] When Does Preconditioning Help or Hurt Generalization?

Шун-ичи Амари, Jimmy Ba|arXiv (Cornell University)|2020. 06. 18.
Sparse and Compressive Sensing Techniques참고 문헌 88인용 수 11
한 줄 요약

이 논문은 조건부 경사하강법 하에서 오버파rameterized 리지드 없는 선형 회귀에서 일반화 오차의 정확한 渐近적 편향-분산 분해를 제공하며, 레이블에 노이즈가 있을 경우, 모델이 잘못 지정되어 있을 경우, 또는 신호가 특징과 정렬되지 않았을 경우 자연 경사하강법(NGD)이 일반 경사하강법(GD)보다 더 잘 일반화됨을 보여준다. 반대로, 레이블이 깨끗하고, 모델이 잘 지정되어 있거나, 신호가 특징과 정렬되어 있을 경우 GD가 더 잘 일반화된다.

ABSTRACT

While second order optimizers such as natural gradient descent (NGD) often speed up optimization, their effect on generalization has been called into question. This work presents a more nuanced view on how the extit{implicit bias} of first- and second-order methods affects the comparison of generalization properties. We provide an exact asymptotic bias-variance decomposition of the generalization error of overparameterized ridgeless regression under a general class of preconditioner $\boldsymbol{P}$, and consider the inverse population Fisher information matrix (used in NGD) as a particular example. We determine the optimal $\boldsymbol{P}$ for both the bias and variance, and find that the relative generalization performance of different optimizers depends on the label noise and the "shape" of the signal (true parameters): when the labels are noisy, the model is misspecified, or the signal is misaligned with the features, NGD can achieve lower risk; conversely, GD generalizes better than NGD under clean labels, a well-specified model, or aligned signal. Based on this analysis, we discuss several approaches to manage the bias-variance tradeoff, and the potential benefit of interpolating between GD and NGD. We then extend our analysis to regression in the reproducing kernel Hilbert space and demonstrate that preconditioned GD can decrease the population risk faster than GD. Lastly, we empirically compare the generalization error of first- and second-order optimizers in neural network experiments, and observe robust trends matching our theoretical analysis.

연구 동기 및 목표

  • 일반화 성능에서 1차 및 2차 최적화 방법의 암묵적 편향을 이해한다.
  • 오버파라미터라이제이션된 리지드 없는 회귀에서 조건부화가 일반화에 어떤 영향을 미치는지 조사한다.
  • NGD가 GD를 초월하고, 그 반대의 경우가 되는 조건을 규명한다.
  • 이론적 결과를 재생핵 힐버트 공간으로 확장하고 신경망 실험을 통해 검증한다.

제안 방법

  • 오버파라미터라이제이션된 리지드 없는 회귀에서 랜덤 행렬 이론을 사용하여 일반화 오차의 정확한 渐近적 편차-분산 분해를 유도한다.
  • 일반적인 조건부화 행렬 P의 클래스를 고려하며, NGD에서 사용되는 인버스 인구 피셔 정보 행렬을 특수한 경우로 포함한다.
  • 시간에 따라 변하지 않는 조건부화 행렬 하에서 인구 리스크를 편향 및 분산 성분으로 표현한다.
  • 편향과 분산을 각각 최소화하는 최적의 P를 식별하여 상호 간의 트레이드오프를 드러낸다.
  • 분석을 재생핵 힐버트 공간에서의 회귀로 확장하여, 조건부화된 GD가 GD보다 인구 리스크를 더 빨리 감소시킴을 보여준다.
  • 신경망에서 1차 및 2차 최적화 방법의 일반화 오차를 실증적으로 평가하여 이론적 경향을 검증한다.

실험 결과

연구 질문

  • RQ1NGD를 통한 조건부화가 GD보다 일반화를 향상시키는 조건은 무엇인가?
  • RQ2레이블 노이즈나 모델의 잘못 지정이 NGD와 GD의 상대적 일반화 성능에 어떤 영향을 미치는가?
  • RQ3특징과의 신호 정렬 불일치가 조건부화된 최적화 방법의 편향-분산 트레이드오프에서 어떤 역할을 하는가?
  • RQ4GD와 NGD 사이를 조절하는 것이 편향과 분산을 균형 잡는 데 도움이 되어 일반화를 향상시킬 수 있는가?
  • RQ5핵 방법에서 조건부화가 수렴 속도와 인구 리스크에 어떤 영향을 미치는가?

주요 결과

  • 레이블에 노이즈가 있거나, 모델이 잘못 지정되어 있거나, 신호가 특징과 정렬되지 않았을 경우 NGD는 GD보다 더 잘 일반화된다.
  • 레이블이 깨끗하고, 모델이 잘 지정되어 있거나, 신호가 특징과 정렬되어 있을 경우 GD는 NGD보다 더 잘 일반화된다.
  • 편향과 분산을 위한 최적의 조건부화 행렬이 다르므로, 일반화 성능에 근본적인 트레이드오프가 존재한다.
  • 특수한 경우 γ=2에서, GD와 NGD의 편향이 동일해지는 임계 지수 r*는 정확히 -1/2이다.
  • 재생핵 힐버트 공간 설정에서 조건부화된 GD는 GD보다 인구 리스크를 더 빨리 감소시킨다.
  • 신경망 실험 결과는 이론적 편향-분산 분석과 일치하는 강력한 실증적 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.