Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-Based Guided Structured Sparsity of Deep Neural Networks

Amirsina Torfi, Rouzbeh A. Shirvani|arXiv (Cornell University)|2018. 02. 13.
Advanced Neural Network Applications참고 문헌 12인용 수 13
한 줄 요약

이 논문은 깊이 신경망에서 그룹 스파arsity를 강제하면서도 중요한 정보 복잡도를 유지하기 위해 그룹 분산 손실을 사용하는 어텐션 기반 방법인 가이드드 구조적 스파arsity(GSS)를 제안한다. CIFAR-10에서 90% 스파arsity일 때 기준선보다 6%의 정확도 향상을 달성했고, 이는 가이드되지 않은 프루닝 방법 대비 정확도 손실을 2.6배 줄인 것이다.

ABSTRACT

Network pruning is aimed at imposing sparsity in a neural network architecture by increasing the portion of zero-valued weights for reducing its size regarding energy-efficiency consideration and increasing evaluation speed. In most of the conducted research efforts, the sparsity is enforced for network pruning without any attention to the internal network characteristics such as unbalanced outputs of the neurons or more specifically the distribution of the weights and outputs of the neurons. That may cause severe accuracy drop due to uncontrolled sparsity. In this work, we propose an attention mechanism that simultaneously controls the sparsity intensity and supervised network pruning by keeping important information bottlenecks of the network to be active. On CIFAR-10, the proposed method outperforms the best baseline method by 6% and reduced the accuracy drop by 2.6x at the same level of sparsity.

연구 동기 및 목표

  • 네트워크 프루닝에서 통제되지 않은 스파arsity로 인해 과소 파rameter화된 모델에서 심각한 정확도 손실이 발생하는 문제를 해결하기 위해.
  • 프루닝 중 활성 뉴런의 부분 집합을 유지함으로써 중요한 정보 복잡도를 유지하는 방법을 개발하기 위해.
  • 일관된, 계층에 의존하지 않는 메커니즘을 사용해 합성곱 및 완전 연결 계층 양쪽에서 구조적 스파arsity를 가능하게 하기 위해.
  • 정확도 열화를 최소화하면서 스파arsity 강제를 이끄는 가역적이고 어텐션 기반 정규화를 제공하기 위해.

제안 방법

  • 이 방법은 소프트맥스 손실, ℓ₂ 정규화, 그룹 스파arsity 손실(Lgs), 그리고 그룹 분산 손실(Lgv)을 조합한 복합 손실 함수를 도입한다.
  • 합성곱 계층에서는 채널 단위로, 완전 연결 계층에서는 뉴런 단위로 그룹 스파arsity를 강제함으로써 전체 필터나 뉴런을 구조적으로 프루닝할 수 있다.
  • 그룹 분산 손실(Lgv)은 대부분의 그룹이 0에 가까운 반면 일부 그룹은 상당히 큰 분포를 유도함으로써 중요한 정보 통로를 유지한다.
  • 손실 함수는 그룹 수로 정규화되어 훈련을 안정화시키고, 계층 간 일관된 스파arsity 제어를 보장한다.
  • 어텐션 메커니즘은 변동성이 높고 활성인 그룹에 초점을 맞춰 스파arsity 강도를 동적으로 조절함으로써 필수 특징의 과다 프루닝을 방지한다.
  • 이 방법은 어떤 계층 유형과도 호환되며, 아키텍처 수정 없이도 표준 훈련 파ip라인에 원활하게 통합될 수 있다.

실험 결과

연구 질문

  • RQ1어떤 어텐션 메커니즘이 중요한 정보 복잡도를 유지함으로써 깊이 신경망에서 구조적 스파arsity를 향상시킬 수 있는가?
  • RQ2그룹 분산 손실을 사용한 가이드된 스파arsity는 표준 구조적 스파arsity와 비교해 정확도와 스파arsity 간의 트레이드오프에서 어떻게 성능을 내는가?
  • RQ3고스파arsity 수준에서 이 방법이 정확도 손실을 얼마나 줄일 수 있는가?
  • RQ4제안된 방법은 합성곱 계층과 완전 연결 계층 양쪽에 효과적으로 적용되어 일관된 성능을 보일 수 있는가?

주요 결과

  • 90% 스파arsity에서 CIFAR-10에서 제안된 방법은 오차율 16.13%를 달성했으며, 최고의 기준선(18.71%)보다 6%포인트 우수했다.
  • 유사한 스파arsity 수준에서 가이드되지 않은 프루닝 방법 대비 정확도 손실을 2.6배 줄여 더 높은 강건성을 입증했다.
  • 90% 스파arsity에서 MNIST에서 제안된 방법은 테스트 오차율 1.21%를 기록했으며, 다음으로 우수한 방법(1.43%)보다 0.22%포인트 우수했다.
  • 그룹 분산 손실은 고크기 가중치 그룹의 부분 집합을 효과적으로 유지하여 프루닝 중 정보 복잡도가 활성 상태로 유지됨을 보여주었다.
  • 합성곱 계층과 완전 연결 계층 양쪽에서 일관된 성능을 보여 이 방법의 일반화 능력을 확인했다.
  • 높은 스파arsity 수준에서 제안된 방법은 그림 2에 나타나 있듯이 모든 기준선 대비 뛰어난 정확도 유지 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.