Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Dropout for Shallow and Deep Learning

Zhe Li, Boqing Gong|arXiv (Cornell University)|2016. 02. 06.
Advanced Neural Network Applications참고 문헌 19인용 수 12
한 줄 요약

이 논문은 두 번째 순서 통계를 기반으로 특징 또는 뉴런을 적응적으로 샘플링함으로써 얕은 학습과 깊은 학습에서 수렴성과 일반화 성능을 향상시키는 분포에 의존하는 다항분포 드롭아웃 방법을 제안한다. 진화적 드롭아웃 변형은 미니배치에서 실시간으로 샘플링 확률을 계산하여 CIFAR-100에서 표준 드롭아웃 대비 수렴 속도 50% 이상 빠르고 테스트 오차에서 10% 이상의 상대적 향상을 달성한다.

ABSTRACT

Dropout has been witnessed with great success in training deep neural networks by independently zeroing out the outputs of neurons at random. It has also received a surge of interest for shallow learning, e.g., logistic regression. However, the independent sampling for dropout could be suboptimal for the sake of convergence. In this paper, we propose to use multinomial sampling for dropout, i.e., sampling features or neurons according to a multinomial distribution with different probabilities for different features/neurons. To exhibit the optimal dropout probabilities, we analyze the shallow learning with multinomial dropout and establish the risk bound for stochastic optimization. By minimizing a sampling dependent factor in the risk bound, we obtain a distribution-dependent dropout with sampling probabilities dependent on the second order statistics of the data distribution. To tackle the issue of evolving distribution of neurons in deep learning, we propose an efficient adaptive dropout (named extbf{evolutional dropout}) that computes the sampling probabilities on-the-fly from a mini-batch of examples. Empirical studies on several benchmark datasets demonstrate that the proposed dropouts achieve not only much faster convergence and but also a smaller testing error than the standard dropout. For example, on the CIFAR-100 data, the evolutional dropout achieves relative improvements over 10\% on the prediction performance and over 50\% on the convergence speed compared to the standard dropout.

연구 동기 및 목표

  • 독립적이고 동일하게 분포된(i.i.d.) 샘플링을 사용하는 표준 드롭아웃의 비최적의 수렴 문제를 해결하기 위해 더 효과적인 샘플링 전략을 제안한다.
  • 데이터의 두 번째 순서 통계에서 유도된 샘플링 확률을 통해 위험을 최소화하는 분포에 의존하는 드롭아웃의 이론적 근거를 제시한다.
  • 내부 공변량 이동을 다루기 위해 미니배치당 동적으로 샘플링 확률을 업데이트하는 효율적이고 적응적인 드롭아웃 방법—진화적 드롭아웃—을 개발한다.
  • 기본 데이터셋에서 수렴 속도와 테스트 오차 측면에서 제안된 드롭아웃이 표준 드롭아웃을 능가함을 경험적으로 검증한다.

제안 방법

  • 특징 또는 뉴런을 그들의 분산 또는 두 번째 순서 통계에서 유도된 비균일한 확률로 샘플링하는 다항분포 드롭아웃을 제안한다.
  • 다항분포 드롭아웃을 사용한 확률적 최적화의 리스크 한계를 유도하여, 분포에 의존하는 샘플링이 기대 리스크를 감소시킴을 보여준다.
  • 학습 특징의 두 번째 순서 통계를 사용하여 샘플링 확률를 설정함으로써 얕은 학습을 위한 데이터에 의존하는 드롭아웃을 도입한다.
  • 깊은 학습을 위한 진화적 드롭아웃을 개발하여, 레이어 출력의 미니배치 통계에서 실시간으로 샘플링 확률을 계산함으로써 변화하는 내부 분포에 적응한다.
  • 미니배치 통계를 사용하여 샘플링 확률를 효율적으로 계산함으로써 깊은 신경망에서의 병렬 처리와 확장성을 가능하게 한다.
  • 이 방법을 데이터에 의존하는 정규화 요소로 간주하여 표준 백프로파게이션과 추론과의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1얕은 학습에서 i.i.d. 드롭아웃 대비 데이터에 의존하는 확률을 갖는 다항분포 샘플링이 수렴성과 일반화 성능을 향상시킬 수 있는가?
  • RQ2드롭아웃을 사용한 확률적 최적화에서 리스크를 최소화하기 위해 샘플링 확률를 최적화하여 설정할 수 있는가?
  • RQ3깊은 신경망에서 실시간으로 적응하는 샘플링 확률이 내부 공변량 이동을 효과적으로 다루고 학습을 가속화할 수 있는가?
  • RQ4진화적 드롭아웃은 수렴 속도와 테스트 정확도 측면에서 배치 정규화와 비교해 어떤가?

주요 결과

  • CIFAR-100에서 진화적 드롭아웃은 표준 드롭아웃 대비 수렴 속도 50% 이상 빠르고 테스트 오차에서 10% 이상의 상대적 향상을 달성한다.
  • 진화적 드롭아웃은 표준 드롭아웃을 사용한 배치 정규화 수준의 성능을 달성하여 내부 공변량 이동을 효과적으로 완화함을 보여준다.
  • 얕은 학습에서는 특징 분산에 기반한 데이터에 의존하는 드롭아웃이 균일 드롭아웃보다 더 빠른 수렴을 이룬다.
  • 제안된 방법은 리스크 한계 최소화 이론에 기반하여, 분포에 의존하는 샘플링이 더 작은 기대 리스크를 유도함을 보여준다.
  • 추가 파라미터나 레이어를 도입하지 않아 간편성과 표준 딥러닝 프레임워크와의 호환성을 유지한다.
  • 경험적 결과는 MNIST, SVHN, CIFAR-10, CIFAR-100 전반에서 일관된 향상이 있음을 보여주며, 이 방법의 강건성과 일반화 능력을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.