Skip to main content
QUICK REVIEW

[논문 리뷰] Dropout: Explicit Forms and Capacity Control

Raman Arora, Peter L. Bartlett|arXiv (Cornell University)|2020. 03. 06.
Stochastic Gradient Optimization Techniques참고 문헌 44인용 수 12
한 줄 요약

이 논문은 행렬 완성과 두 층의 ReLU 네트워크에서 드롭아웃이 유도하는 정규화 항의 명시적 형태를 제공하며, 드롭아웃이 데이터에 따라 변하는 용량 제어 메커니즘으로 작용함을 보여준다. 가중 치환 노름(행렬 완성)과 $\alpha/\sqrt{n}$ 유형의 복잡도 측정법(딥 네트워크)에 비례하는 일반화 경계를 수립하였으며, MovieLens, MNIST, Fashion-MNIST 데이터셋에서 실증적으로 검증하였다.

ABSTRACT

We investigate the capacity control provided by dropout in various machine learning problems. First, we study dropout for matrix completion, where it induces a data-dependent regularizer that, in expectation, equals the weighted trace-norm of the product of the factors. In deep learning, we show that the data-dependent regularizer due to dropout directly controls the Rademacher complexity of the underlying class of deep neural networks. These developments enable us to give concrete generalization error bounds for the dropout algorithm in both matrix completion as well as training deep neural networks. We evaluate our theoretical findings on real-world datasets, including MovieLens, MNIST, and Fashion-MNIST.

연구 동기 및 목표

  • 드롭아웃이 행렬 완성과 딥 신경망에서 유도하는 명시적 정규화 항을 이해하기 위해.
  • 드롭아웃을 데이터에 따라 변하는 용량 제어와 연결하여 이론적 일반화 경계를 수립하기 위해.
  • MovieLens, MNIST, Fashion-MNIST와 같은 실세계 데이터셋에서 이론적 결과를 실증적으로 검증하기 위해.
  • 드롭아웃이 공적응을 방지하고 모델 복잡도를 제어하는 메커니즘을 명확히 하기 위해.
  • 요구된 모델과 딥 네트워크에서 드롭아웃에 대한 정확하고 데이터에 따라 변하는 일반화 경계를 제공함으로써 이전 연구를 확장하기 위해.

제안 방법

  • 행렬 완성에서 드롭아웃이 유도하는 정규화 항의 명시적 형태를 요인 곱의 데이터에 따라 변하는 가중 치환 노름으로 유도한다.
  • 두 층의 ReLU 네트워크에서 드롭아웃이 유도하는 정규화 항은 데이터에 따라 변하는 $\beta$-경로 노름으로 해석되며, Neyshabur 등(2015a)의 $\emptyset$-경로 노름과 유사하다.
  • Rademacher 복잡도를 사용하여 행렬 완성과 딥 네트워크 모두에 대한 일반화 경계를 수립하였으며, 경계는 $O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$ 비례한다.
  • 대칭화와 경험 위험 최소화를 통해 복잡도 측정법 $\alpha/\sqrt{n}$을 유도하고 실험적으로 검증한다.
  • 다양한 네트워크 너비와 드롭아웃 비율에서 유도된 복잡도 측정법과 일반화 갭 간의 관계를 실증적으로 평가한다.
  • 딥 컨볼루션 네트워크에 유도된 정규화 항을 적용하기 위해 상단 레이어의 정규화 항을 $R(\mathbf{w}) = \frac{p}{1-p} \sum_{i=1}^{\texttt{width}} \|\mathbf{u}_i\|^2 a_i^2$로 모델링하며, 여기서 $a_i^2 = \mathbb{E}_\mathbf{x}[\texttt{feature}_i(\mathbf{x})^2]$이다.

실험 결과

연구 질문

  • RQ1드롭아웃은 행렬 완성 문제에서 어떤 명시적 정규화 항을 유도하는가?
  • RQ2드롭아웃은 두 층의 ReLU 네트워크에서 Rademacher 복잡도를 어떻게 제어하는가?
  • RQ3데이터에 따라 변하는 복잡도 측정법을 사용하여 드롭아웃 정규화 모델의 일반화 오차를 경계로 제시할 수 있는가?
  • RQ4유도된 정규화 항은 넓은 네트워크에서 일반화 갭과 공적응과 어떻게 상관관계가 있는가?
  • RQ5실세계 데이터셋에서의 실증 결과는 이론적 일반화 경계를 어느 정도 확인하는가?

주요 결과

  • 행렬 완성에서 드롭아웃은 요인 곱의 가중 치환 노름과 기대값에서 동일한 데이터에 따라 변하는 정규화 항을 유도하며, 강력한 일반화 보장을 제공한다.
  • 두 층의 ReLU 네트워크에서 드롭아웃이 유도하는 정규화 항은 데이터에 따라 변하는 $\ell_2$-경로 노름으로 작용하여 정밀한 일반화 경계를 가능하게 한다.
  • 일반화 오차 경계는 $O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$ 비례하며, 여기서 $R(\mathbf{w})$는 드롭아웃 하에서 모델의 복잡도를 캡처한다.
  • MNIST, Fashion-MNIST, MovieLens에서의 실증 결과는 복잡도 측정법 $\alpha/\sqrt{n}$의 값이 낮을수록 일반화 갭이 작아지는 경향을 확인한다.
  • 드롭아웃 비율을 높이면 공적응과 일반화 갭이 감소하며, 드롭아웃으로 훈련된 넓은 네트워크는 낮은 공적응 수준으로 수렴하는 경향을 보인다.
  • 유도된 정규화 항은 상단 레이어에만 적용되어도 딥 네트워크에서 효과적으로 작용하며, 일반화 갭은 복잡도 측정법 $\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}$와 강하게 상관관계가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.