Skip to main content
QUICK REVIEW

[논문 리뷰] Early Stopping in Deep Networks: Double Descent and How to Eliminate it

Reinhard Heckel, Fatih Yılmaz|arXiv (Cornell University)|2020. 07. 20.
Stochastic Gradient Optimization Techniques참고 문헌 33인용 수 7
한 줄 요약

이 논문은 오버파ram터화된 딥 네트워크에서 에포크 단위의 더블 디센트가 초기 정지에 의한 모델 복잡도 제어 때문이 아니라, 서로 다른 학습 속도를 가진 네트워크 레이어들 간의 이질적인 학습 동역학으로 인해 발생하는 다수의 편향-분산 트레이드오프의 수반 현상에서 기인한다는 것을 규명한다. 레이어별 학습 속도를 조정함으로써 이 더블 디센트를 이론적·실험적으로 제거할 수 있음을 분석 및 실험적으로 보여주며, 오버파라미터화된 모델에서의 초기 정지 성능 향상이 뚜렷하게 향상됨을 입증한다.

ABSTRACT

Over-parameterized models, such as large deep networks, often exhibit a double descent phenomenon, whereas a function of model size, error first decreases, increases, and decreases at last. This intriguing double descent behavior also occurs as a function of training epochs and has been conjectured to arise because training epochs control the model complexity. In this paper, we show that such epoch-wise double descent arises for a different reason: It is caused by a superposition of two or more bias-variance tradeoffs that arise because different parts of the network are learned at different epochs, and eliminating this by proper scaling of stepsizes can significantly improve the early stopping performance. We show this analytically for i) linear regression, where differently scaled features give rise to a superposition of bias-variance tradeoffs, and for ii) a two-layer neural network, where the first and second layer each govern a bias-variance tradeoff. Inspired by this theory, we study two standard convolutional networks empirically and show that eliminating epoch-wise double descent through adjusting stepsizes of different layers improves the early stopping performance significantly.

연구 동기 및 목표

  • 오버파라미터화된 딥 네트워크에서 에포크 단위의 더블 디센트의 근본 원인을 이해하는 것.
  • 초기 정지가 모델 복잡도를 제어하고 더블 디센트를 유도한다는 기존 가설을 도전하는 것.
  • 더블 디센트가 서로 다른 학습 역학을 가진 레이어들 간의 수반된 편향-분산 트레이드오프에서 기인한다는 것을 보여주는 것.
  • 에포크 단위의 더블 디센트를 제거할 수 있는 확장 가능한 레이어별 학습 속도 조정 전략을 제안하는 것.
  • 표준 CNN에서 제안된 방법을 실험적으로 검증하여, 초기 정지 성능 향상이 이루어짐을 보여주는 것.

제안 방법

  • 다른 스케일의 특징을 가진 선형 회귀 분석을 통해, 편향-분산 트레이드오프의 수반 현상이 더블 디센트를 유도함을 보여주는 것.
  • 두 층으로 구성된 ReLU 네트워크에 대해 초기 정지된 리스크의 이론적 경계를 유도하여, 이는 레이어별 초기화 및 학습 속도에 의해 결정됨을 보여주는 것.
  • 레이어별 학습 속도와 스텝 사이즈가 더블 디센트의 발생 또는 억제와 어떻게 연결되는지를 설명하는 이론적 프레임워크를 도입하는 것.
  • 실용적인 방법 제안: 서로 다른 네트워크 구성 요소의 효과적 업데이트 속도를 균형 잡기 위해 각 레이어별로 학습 속도를 스케일링하는 것.
  • CIFAR-10에서 20%의 레이블 노이즈를 가진 5층 CNN과 ResNet-18에서 방법을 실험적으로 평가하는 것.
  • 최소 테스트 오차 시점에서 초기 정지를 적용하여, 학습 속도 조정 전후의 성능을 비교하는 것.

실험 결과

연구 질문

  • RQ1왜 오버파라미터화된 딥 네트워크에서 에포크 수에 따라 더블 디센트가 발생하는가?
  • RQ2이전에 추측된 바와 같이, 초기 정지에 의한 효과적 모델 복잡도 제어가 에포크 단위의 더블 디센트를 유도하는가?
  • RQ3다른 레이어들 간의 학습 속도 조정을 통해 더블 디센트를 제거할 수 있는가?
  • RQ4레이어별 초기화 및 학습 속도는 학습 중 리스크 곡선에 어떻게 영향을 미치는가?
  • RQ5에포크 단위의 더블 디센트를 제거하면 표준 아키텍처에서 초기 정지 성능이 향상되는가?

주요 결과

  • 에포크 단위의 더블 디센트는 모델 복잡도 제어 때문이 아니라, 서로 다른 학습 속도를 가진 레이어들 간의 편향-분산 트레이드오프의 수반 현상에서 기인한다.
  • 다른 스케일의 특징을 가진 선형 회귀에서, 초기 정지된 최소 제곱법은 겹치는 편향-분산 곡선으로 인해 더블 디센트를 보인다.
  • 두 층으로 구성된 ReLU 네트워크의 경우, 초기 정지된 리스크는 각각 레이어별 초기화 및 학습 속도에 의해 지배되는 겹치는 편향-분산 트레이드오프들의 합으로 상한이 존재한다.
  • 각 레이어의 학습 속도를 조정하여 효과적 업데이트 속도를 균형 잡음으로써, 이론적·실제로 더블 디센트를 제거할 수 있다.
  • 5층 CNN과 ResNet-18에서의 실험 결과, 학습 속도 스케일링을 통해 초기 정지 시점에서 테스트 오차가 최대 30% 감소함을 확인하였다.
  • 이 방법은 과적합 없이 글로벌 최소값에 더 이른 시점에 수렴할 수 있도록 일반화 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.