Skip to main content
QUICK REVIEW

[논문 리뷰] Explicit Regularization in Overparametrized Models via Noise Injection

Antonio Orvieto, Anant Raj|arXiv (Cornell University)|2022. 06. 09.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 과다 매개변수화된 신경망에서 계층별 노이즈 주입을 제안하여 분산 폭발 없이 명시적 정규화를 유도한다. 작은 변동이 더 평탄한 최소값을 선호함으로써 일반화 성능 향상에 기여함을 입증한다. 이 방법은 각 계층에 독립적인 노이즈를 주입함으로써 ℓ₁, 그룹 ℓ₁, 또는 노르멀 노름을 통한 증명 가능한 정규화를 가능하게 하며, 패션 MNIST와 CIFAR-10에서 넓고 깊은 모델을 대상으로 실험적으로 검증된다.

ABSTRACT

Injecting noise within gradient descent has several desirable features, such as smoothing and regularizing properties. In this paper, we investigate the effects of injecting noise before computing a gradient step. We demonstrate that small perturbations can induce explicit regularization for simple models based on the L1-norm, group L1-norms, or nuclear norms. However, when applied to overparametrized neural networks with large widths, we show that the same perturbations can cause variance explosion. To overcome this, we propose using independent layer-wise perturbations, which provably allow for explicit regularization without variance explosion. Our empirical results show that these small perturbations lead to improved generalization performance compared to vanilla gradient descent.

연구 동기 및 목표

  • 훈련 중 소규모 변동이 단순한 모델에서 명시적 정규화를 유도하는지 조사하기.
  • 같은 변동이 넓은 너비를 가진 과다 매개변수화된 신경망에서도 효과를 가지는지 검토하기.
  • 유도된 정규화가 실제로 일반화 성능 향상에 기여하는지 확인하기.
  • 넓은 네트워크에서 분산 폭발을 방지하면서도 정규화 이점을 유지하는 노이즈 주입 전략 개발하기.

제안 방법

  • 분산 폭발을 방지하기 위해 기울기 계산 이전에 계층별로 소규모이고 독립적인 노이즈 변동을 주입하는 방식.
  • 계층별 노이즈 주입에 대응하는 효과적 정규화 손실 함수를 유도하여, ℓ₁, 그룹 ℓ₁, 또는 노르멀 노름을 통한 명시적 정규화를 입증하는 방식.
  • 무한한 너비를 가진 네트워크에서 표준 노이즈 주입에서 관찰되는 분산 폭발을 방지하기 위해 계층별 변동이 효과적임을 증명하는 방식.
  • 다중 은닉층을 가진 깊은 ReLU 네트워크로 이론적 분석를 확장하는 방식.
  • 다양한 노이즈 주입 전략 하에서 일반화 성능를 비교하기 위해 완전 연결 및 컨볼루션 네트워크에서 실험적 평가를 수행하는 방식.
  • 각 계층의 파라미터 수가 다를 경우에도 일관된 신호 대 노이즈 비율을 유지하기 위해 계층별 주입의 노이즈 강도에 척도 인자(예: √M)를 적용하는 방식.

실험 결과

연구 질문

  • RQ1기울기 계산 이전에 노이즈 주입이 ℓ₁, 그룹 ℓ₁, 또는 노르멀 노름을 사용하는 단순한 모델에서 명시적 정규화를 유도하는가?
  • RQ2표준 노이즈 주입이 넓은 너비를 가진 과다 매개변수화된 신경망에서 실패하는 이유는 무엇이며, 분산 폭발의 원인은 무엇인가?
  • RQ3계층별 노이즈 주입이 분산 폭발 문제를 해결하면서도 명시적 정규화를 유지할 수 있는가?
  • RQ4제안된 방법이 일반적인 확률적 경사 하강법에 비해 더 나은 일반화 성능을 보이는가?

주요 결과

  • 표준 노이즈 주입은 무한한 수의 변동되는 뉴런으로 인해 과다 매개변수화된 모델에서 분산 폭발을 유도하여 정규화에 효과적이지 않다.
  • 계층별 노이즈 주입은 분산 폭발을 효과적으로 방지하고, 완전 연결 및 깊은 ReLU 네트워크에서 ℓ₁, 그룹 ℓ₁, 또는 노르멀 노름을 통한 명시적 정규화를 증명 가능하게 한다.
  • 실험 결과, 계층별 노이즈 주입은 표준 노이즈 주입 및 일반적인 SGD에 비해 패션 MNIST와 CIFAR-10에서 얕고 깊고 넓고 좁은 모델 모두에서 테스트 정확도 향상을 보였다.
  • 완전 연결 네트워크와 컨볼루션 네트워크를 포함한 다양한 아키텍처에서 일관된 성능 향상이 관찰되었으며, 높은 너비에서도 안정적인 성능 유지를 보였다.
  • 정규화된 헤시안 트레이스 역학은 계층별 주입 하에서 감쇠되어 더 부드러운 최적화와 더 평탄한 최소값 선호를 나타낸다.
  • 계층별 주입에서 노이즈를 √M로 스케일링하면, 파라미터 수가 다른 계층 간에도 일관된 정규화 강도를 유지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.