Skip to main content
QUICK REVIEW

[논문 리뷰] GASL: Guided Attention for Sparsity Learning in Deep Neural Networks

Amirsina Torfi, Rouzbeh A. Shirvani|arXiv (Cornell University)|2019. 01. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 52인용 수 9
한 줄 요약

이 논문은 정확도 저하를 방지하기 위해 분산 정규화를 통한 절단 감시를 통해 구조적이고 비구조적인 희소성을 강제하는 일반적이고 주의 기반 방법인 Guided Attention for Sparsity Learning (GASL)을 제안한다. Cifar-100에서 48%의 희소성과 2.91배의 속도 향상을 달성하며 최신 기술 수준을 넘어서고, 하이퍼파rameter 설정에 대해 뛰어난 내구성을 보인다.

ABSTRACT

The main goal of network pruning is imposing sparsity on the neural network by increasing the number of parameters with zero value in order to reduce the architecture size and the computational speedup. In most of the previous research works, sparsity is imposed stochastically without considering any prior knowledge of the weights distribution or other internal network characteristics. Enforcing too much sparsity may induce accuracy drop due to the fact that a lot of important elements might have been eliminated. In this paper, we propose Guided Attention for Sparsity Learning (GASL) to achieve (1) model compression by having less number of elements and speed-up; (2) prevent the accuracy drop by supervising the sparsity operation via a guided attention mechanism and (3) introduce a generic mechanism that can be adapted for any type of architecture; Our work is aimed at providing a framework based on interpretable attention mechanisms for imposing structured and non-structured sparsity in deep neural networks. For Cifar-100 experiments, we achieved the state-of-the-art sparsity level and 2.91x speedup with competitive accuracy compared to the best method. For MNIST and LeNet architecture we also achieved the highest sparsity and speedup level.

연구 동기 및 목표

  • 딥 네ural 네트워크에서 공격적인 절단으로 인한 정확도 저하 문제를 해결하기 위해.
  • 구조적이고 비구조적인 희소성을 동시에 유도할 수 있는 일반적이고 아키텍처에 의존하지 않는 방법을 개발하기 위해.
  • 모델 성능을 모니터링하는 해석 가능한 주의 메커니즘을 사용하여 희소성 학습 과정을 감시하기 위해.
  • 희소성 정규화 계수에 대한 민감도를 줄여 광범위한 하이퍼파rameter 튜닝에 의존하지 않도록 내구성을 향상시키기 위해.
  • 특히 70%를 초과하는 높은 희소성 수준에서도 높은 모델 정확도를 유지하기 위해.

제안 방법

  • 절단 중 어떤 뉴런이나 채널이 활성 상태를 유지해야 하는지 제어하기 위해 분산 정규화를 활용하는 가이드된 주의 메커니즘을 도입한다.
  • 표준 분류 손실과 분산 기반 정규화 손실을 조합한 이중 손실 목표 함수를 적용하여 희소성 동역학을 제어한다.
  • 동적 희소성 계수 λs와 희소성 제어를 위한 분산 계수 α = λv/λs를 도입하여 절단과 성능 유지 간의 균형을 조절한다.
  • 모듈러 주의 모듈을 통해 비구조적(가중치 수준)과 구조적(필터/채널/특징 맵 수준) 희소성 모두에 적응한다.
  • 기존의 구조적 주의 프레임워크와 통합하여 성능 인식 기반의 절단 가이드 기능을 강화한다.
  • 정확도 유지와 함께 점진적으로 희소성을 증가시키기 위해 반복적 절단과 재학습을 적용한다.

실험 결과

연구 질문

  • RQ1감시된 주의 메커니즘이 딥 네트워크에서 정확도 저하를 방지하기 위해 효과적으로 희소성을 제어할 수 있는가?
  • RQ2고도의 희소성 수준(예: >70%)에서 GASL은 최신 기술 수준의 방법과 비교해 어떻게 성능을 내는가?
  • RQ3제안된 방법은 특히 분산 정규화 계수 α에 대해 내구성이 있는가?
  • RQ4GASL은 다양한 네트워크 아키텍처와 희소성 유형(구조적/비구조적)에 일반적으로 적용될 수 있는가?
  • RQ5주의 기반 감시가 모델 정확도를 희생시키지 않고 더 높은 계산 속도 향상을 이끌 수 있는가?

주요 결과

  • Cifar-100에서 GASL은 48%의 희소성과 2.91배의 속도 향상을 달성했으며 오직 25.41%의 오차율을 기록하여 고도의 희소성 수준에서 베이스라인 및 이전 방법을 초월했다.
  • 80%의 희소성에서 GASL은 정확도 저하를 2.23%로 줄였으며, ℓ1-정규화(4.21%)나 구조적 희소성 학습(2.81%)과 비교해 뚜렷한 우월성을 보였다.
  • α 하이퍼파rameter의 변화에 대해 [0.01, 100] 범위에서 정확도 저하 변화가 미미하여 조정에 대한 민감도가 낮음을 확인했으며, 내구성이 뛰어남을 입증했다.
  • MNIST와 LeNet에 대해서도 GASL은 비교된 방법들 중 가장 높은 희소성 및 속도 향상 수준을 달성하여 그 일반성과 타당성을 확인했다.
  • 주의 메커니즘이 중요한 특징을 유지함으로써 효과적으로 절단을 가이드했으며, 공격적인 희소성 수준에서도 안정된 성능을 기록함으로써 이를 입증했다.
  • 희소성 정규화 항을 추가했음에도 불구하고 모델 복잡도는 유지되었고, 파라미터 수가 증가하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.