Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Network Sparsification via Dependent Variational Beta-Bernoulli Dropout

Juho Lee, Saehoon Kim|arXiv (Cornell University)|2018. 05. 28.
Domain Adaptation and Few-Shot Learning참고 문헌 25인용 수 7
한 줄 요약

이 논문은 입력에 따라 각 뉴런의 드롭아웃 비율을 학습하는 스파arsity 유도형 베타-베르누이 사전을 사용하는 적응형 변분 베타-베르누이 드롭아웃을 제안한다. 뉴런이 적응적으로 일반화, 입력 특화, 또는 잘리게 되는 것을 허용함으로써, 다양한 데이터셋에서 일관된 정확도 향상과 함께 훨씬 더 컴act한 모델을 달성하며, 기준 스파arsity 기법들을 능가한다.

ABSTRACT

While variational dropout approaches have been shown to be effective for network sparsification, they are still suboptimal in the sense that they set the dropout rate for each neuron without consideration of the input data. With such input-independent dropout, each neuron is evolved to be generic across inputs, which makes it difficult to sparsify networks without accuracy loss. To overcome this limitation, we propose adaptive variational dropout whose probabilities are drawn from sparsity-inducing beta Bernoulli prior. It allows each neuron to be evolved either to be generic or specific for certain inputs, or dropped altogether. Such input-adaptive sparsity-inducing dropout allows the resulting network to tolerate larger degree of sparsity without losing its expressive power by removing redundancies among features. We validate our dependent variational beta-Bernoulli dropout on multiple public datasets, on which it obtains significantly more compact networks than baseline methods, with consistent accuracy improvements over the base networks.

연구 동기 및 목표

  • 표준 변분 드롭아웃이 모든 입력에 대해 고정된, 입력에 의존하지 않는 드롭아웃 비율을 적용한다는 한계를 해결하기 위해.
  • 입력 맥락에 따라 뉴런이 적응적으로 일반화, 입력 특화, 또는 프루닝되도록 하여 스파arsity 효율성을 향상시키기 위해.
  • 모델 표현력을 유지하면서 입력 적응형 스파arsity 패턴을 학습하여 네트워크의 중복을 줄이기 위해.
  • 구조적 스파arsity 유도 사전을 통해 정확도 저하 없이 더 높은 모델 컴팩트니스를 달성하기 위해.
  • 공개 벤치마크에서 방법을 검증하여 기존 스파arsity 기법들보다 일관된 향상을 보여주기 위해.

제안 방법

  • 드롭아웃 비율이 스파arsity를 유도하는 베타-베르누이 사전에서 유도되도록 하는 종속된 변분 추론 프레임워크를 사용한다.
  • 각 뉴런의 드롭아웃 확률은 입력 특징에 기반해 동적으로 결정되어 입력 적응형 행동을 가능하게 한다.
  • 베타-베르누이 사전은 구조적 스파arsity 패턴을 유도하여 뉴런이 활성화, 입력 특화, 또는 완전히 제거되는 것을 허용한다.
  • 재파rameterization을 사용한 효율적 기울기 추정을 위해 확률적 경량 최적화를 사용하여 엔드 투 엔드로 모델을 훈련한다.
  • 다양한 입력 유형에서 중복된 특징을 자동으로 식별하고 제거할 수 있도록 한다.
  • 뉴런별로 입력에 의존하는 프루닝 정책을 학습하여 모델 표현력과 스파arsity를 균형 잡는다.

실험 결과

연구 질문

  • RQ1입력 적응형 드롭아웃 비율은 정확도를 유지하면서 네트워크 스파arsity를 향상시킬 수 있는가?
  • RQ2종속된 베타-베르누이 사전은 표준 변분 드롭아웃보다 더 효과적인 뉴런 프루닝을 가능하게 하는가?
  • RQ3입력 특화 패턴에 적응함으로써 고스파arsity 수준에서도 표현력을 유지할 수 있는가?
  • RQ4모델 크기와 정확도 측면에서 제안된 방법은 기준 스파arsity 기법들과 어떻게 비교되는가?
  • RQ5입력 적응형 스파arsity를 통해 특징의 중복을 얼마나 제거할 수 있으며, 성능 저하 없이 수행할 수 있는가?

주요 결과

  • 제안된 방법은 여러 공개 데이터셋에서 기준 기법들보다 훨씬 더 컴팩트한 네트워크를 달성한다.
  • 높은 스파arsity 수준에서도 기반 네트워크와 비교해 정확도를 유지하거나 향상시킨다.
  • 이 방법은 입력 맥락에 따라 뉴런이 적응적으로 특화되거나 제거되도록 하여 특징의 중복을 줄인다.
  • 종속된 베타-베르누이 사전을 사용함으로써 표준 변분 드롭아웃보다 더 효과적인 스파arsity 유도가 가능하다.
  • 모델 효율성과 정확도의 상호보완적 관계 측면에서 기존 스파arsity 기법들을 일관되게 능가한다.
  • 다양한 데이터셋에서 높은 성능을 보이며, 입력 적응형 스파arsity의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.