Skip to main content
QUICK REVIEW

[논문 리뷰] A Scale Mixture Perspective of Multiplicative Noise in Neural Networks

Eric Nalisnick, Anima Anandkumar|arXiv (Cornell University)|2015. 06. 10.
Gaussian Processes and Bayesian Inference참고 문헌 23인용 수 6
한 줄 요약

이 논문은 딥 네ural 네트워크에서의 곱셈 노이즈 정규화를 분석적으로 이해하기 위해 베이지안 가우시안 스케일 믹스 프레임워크를 제안한다. 노이즈를 계층적 사전확률로 재정의함으로써, 평균과 분산이 큰 가중치를 선호하는 폐쇄형 정규화 페널티를 유도한다—이것은 희박성보다는 내성적 안정성(로버스트니)을 증진시킨다. 이에 기반해 기존의 신호 대 노이즈 비율 히우리스틱과 경쟁하는 새로운 프루닝 규칙(SP)을 도입한다.

ABSTRACT

Corrupting the input and hidden layers of deep neural networks (DNNs) with multiplicative noise, often drawn from the Bernoulli distribution (or 'dropout'), provides regularization that has significantly contributed to deep learning's success. However, understanding how multiplicative corruptions prevent overfitting has been difficult due to the complexity of a DNN's functional form. In this paper, we show that when a Gaussian prior is placed on a DNN's weights, applying multiplicative noise induces a Gaussian scale mixture, which can be reparameterized to circumvent the problematic likelihood function. Analysis can then proceed by using a type-II maximum likelihood procedure to derive a closed-form expression revealing how regularization evolves as a function of the network's weights. Results show that multiplicative noise forces weights to become either sparse or invariant to rescaling. We find our analysis has implications for model compression as it naturally reveals a weight pruning rule that starkly contrasts with the commonly used signal-to-noise ratio (SNR). While the SNR prunes weights with large variances, seeing them as noisy, our approach recognizes their robustness and retains them. We empirically demonstrate our approach has a strong advantage over the SNR heuristic and is competitive to retraining with soft targets produced from a teacher model.

연구 동기 및 목표

  • 딥 네럴 네트워크에서 곱셈 노이즈 정규화가 과적합을 방지하는 이론적 기반을 제공하는 것.
  • 베이지안 사전확률 하에 곱셈 노이즈의 분석적 비가역성을 해결하기 위해 이를 가우시안 스케일 믹스(GSM)로 프레임화하는 것.
  • 가중치의 사후 평균과 분산에 의존하는 폐쇄형 정규화 페널티를 유도하여 곱셈 노이즈의 이중 효과(희박성 또는 척도 변화에 대한 불변성)를 드러내는 것.
  • 기존의 히우리스틱 방법(예: 신호 대 노이즈 비율(SNR))과 대비되는 데이터 기반, 원리에 기반한 가중치 프루닝 전략을 개발하는 것.
  • 제안된 프루닝 규칙(SPR)이 압축 과정에서 성능 유지 능력이 SNR보다 뛰어나고 지식 디스티illation과 경쟁할 수 있음을 실증적으로 검증하는 것.

제안 방법

  • 네트워크 가중치에 평균이 0인 가우시안 사전확률를 부여하고 노이즈 분산을 랜덤 변수로 간주함으로써 딥 네트워크의 곱셈 노이즈를 가우시안 스케일 믹스(GSM)로 모델링하는 것.
  • 노이즈와 가능도가 조건부 독립이 되도록 계층적 재정의를 사용하여 타입-II 최대우도 추정을 가능하게 하는 것.
  • 가중치의 사후 평균과 분산에 의존하는 폐쇄형 표현식을 유도함: $\mathbb{E}^2[v] + \text{Var}[v]$.
  • 신호-플러스-로버스트니(SPR)라는 새로운 프루닝 규칙을 제안: $|\mu_{l,j,k}| + \sigma_{l,j,k} < \tau$—이 규칙은 높은 평균과 높은 분산을 가진 가중치를 유지한다.
  • 베르누이 곱셈 노이즈로 학습한 후 사후 가중치 분포에서 샘플링하기 위해 랭지에빈 역동법을 적용함으로써 프루닝 규칙의 실증적 평가를 가능하게 하는 것.
  • 분류 및 회귀 과제에서 MNIST, IMDB, 및 밀리언 송 데이터셋(MSD)에 대해 SPR 프루닝을 SNR 및 지식 디스티illation(소프트 타겟 재학습)과 비교하는 것.

실험 결과

연구 질문

  • RQ1곱셈 노이즈 정규화는 딥 네럴 네트워크의 가중치 분포에 어떤 영향을 미치는가?
  • RQ2베이지안 계층적 프레임워크를 통해 딥 네트워크에서 곱셈 노이즈의 기능적 복잡성을 분석적으로 해결할 수 있는가?
  • RQ3곱셈 노이즈가 유도하는 암묵적 인도적 편향은 무엇인가—특히 희박성인지, 또는 척도 변화에 대한 불변성을 유도하는가?
  • RQ4유도된 정규화 페널티는 기존의 히우리스틱(예: 신호 대 노이즈 비율)과 비교해 더 뛰어난 원리에 기반한 가중치 프루닝 전략을 이끌어낼 수 있는가?
  • RQ5제안된 프루닝 규칙(SPR)은 더 큰 모델 압축을 가능하게 하면서도 지식 디스티illation과 경쟁할 수 있는 성능을 달성할 수 있는가?

주요 결과

  • 곱셈 노이즈 정규화는 가우시안 스케일 믹스를 유도하여 타입-II 최대우도를 통한 정규화 효과의 폐쇄형 분석을 가능하게 한다.
  • 유도된 페널티는 희박성 또는 척도 변화에 대한 불변성을 유도하는 가중치를 선호하며, 고분산 가중치는 내성적 안정성이 높고 새로운 규칙에 의해 유지된다.
  • SPR 프루닝 규칙($|\mu| + \sigma < \tau$)은 테스트 오차가 급격히 증가하기 전까지 최소 20% 더 많은 파라미터 제거를 허용하여 SNR 히우리스틱을 능가한다.
  • IMDB 감성 분류 과제에서 SPR로 프루닝된 모델은 50%의 파라미터 감소까지 재학습된 소프트 타겟 모델과 동등하거나 슈퍼어리어를 기록했다.
  • MNIST, IMDB, MSD에서의 실증 결과는 SPR가 다양한 데이터 모odal리티와 과제(회귀 포함)에서 SNR보다 성능 유지 능력이 뛰어나며, 다양한 환경에서 우수한 성능을 보였다.
  • 분석 결과, 고분산 가중치는 노이즈가 아니라 내성적 안정성이 높은 것으로 나타났으며, 이는 SNR 히우리스틱이 먼저 제거하는 경향을 뒤집는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.