Skip to main content
QUICK REVIEW

[논문 리뷰] Building Efficient ConvNets using Redundant Feature Pruning

Babajide O. Ayinde, Jacek M. Żurada|arXiv (Cornell University)|2018. 02. 21.
Advanced Neural Network Applications참고 문헌 21인용 수 50
한 줄 요약

이 논문은 중복 필터 및 그 피처 맵을 제거하는 군집 기반 응집(pruning) 방법을 제시한다. CIFAR-10 모델에서 추론 FLOPs를 최대 약 40%까지 감소시키면서도 경쟁력 있는 정확도를 유지한다. 가지치기 후 재학습은 하이퍼파라미터를 바꾸지 않고도 성능 회복에 도움을 준다.

ABSTRACT

This paper presents an efficient technique to prune deep and/or wide convolutional neural network models by eliminating redundant features (or filters). Previous studies have shown that over-sized deep neural network models tend to produce a lot of redundant features that are either shifted version of one another or are very similar and show little or no variations; thus resulting in filtering redundancy. We propose to prune these redundant features along with their connecting feature maps according to their differentiation and based on their relative cosine distances in the feature space, thus yielding smaller network size with reduced inference costs and competitive performance. We empirically show on select models and CIFAR-10 dataset that inference costs can be reduced by 40% for VGG-16, 27% for ResNet-56, and 39% for ResNet-110.

연구 동기 및 목표

  • 네트워크가 과잉 매개화된 CNN에서 무의미한 중복 피처(필터)를 제거함으로써 네트워크 크기와 추론 비용의 감소를 목표로 한다.
  • 유사성에 기반해 필터를 클러스터로 그룹화하고 전체 중복 클러스터를 제거하는 원샷 가지치기 전략을 제안하며, 각 클러스터의 관련 피처 맵도 함께 제거한다.
  • 가지치기가 정확도를 크게 낮추지 않으면서 FLOPs를 실질적으로 감소시키는지 재학습이 필요한지에 대한 실증적 근거를 제시한다.
  • 중복 인식 가지치기가 기존의 필터 가지치기 방법과 비교해 실용적인 지침과 경험적 근거를 제공한다.]
  • method:["각 층의 필터를 피처 벡터(열로 표현된 W^(l))로 표현한다."
  • "피어-와이즈 코사인 유사도를 계산하여 필터 간 거리를 정의한다."
  • "높은 유사도를 가진 필터 그룹을 병합하기 위해 계층적 응집 클러스터링을 적용하고, 클러스터 간 평균 유사도가 임계값 tau 이하가 될 때까지 반복한다."
  • "클러스터당 하나의 대표 필터를 제외한 모든 필터를 가지치기하고(또는 원하는 가지치기 수에 도달하도록 충분한 필터를 제거) 해당 피처 맵과 다음 층의 가중치를 함께 제거한다."
  • " l-번째 및 (l+1)-번째 층의 커널 행렬을 감소된 필터 수를 반영하도록 업데이트한다."
  • "원래 하이퍼파라미터를 바꾸지 않고 짧은 기간 동안 가지치기된 네트워크를 재학습하여 정확도를 회복한다."]
  • research_questions:[
  • 일반적인 CNN 아키텍처에서 중복 필터를 식별하고 제거하는 것이 재학습으로만 회복된다고 해서 성능 저하가 제한되는가?
  • VGG-16 및 ResNet 변형에서 CIFAR-10에 대해 중복 특징을 가지치면 추론 비용(FLOPs)을 얼마나 절감할 수 있는가?
  • 피처 중복성 기반 가지치기가 Li et al. (2017)과 같은 크기 기반 가지치기 방법보다 이 모델들에서 더 나은 성능을 나타내는가?
  • 가지치기 순서와 임계값 tau가 가지치기 효과와 최종 정확도에 어떤 영향을 주는가?
  • 재학습이 가지치기된 모델에서 충분히 정확도를 회복하거나 개선시키는가, 그리고 이는 가지치기-에서-처음(pruning-from-scratch)과 어떻게 비교되는가?

제안 방법

  • "각 층의 필터를 피처 벡터(열로 표현된 W^(l))로 표현한다.",
  • ,

실험 결과

연구 질문

  • RQ1

주요 결과

  • VGG-16 가지치기에서 tau = 0.54는 매개변수 약 78% 이상 가지치기 및 약 40% FLOP 감소를 달성하며 경쟁력 있는 정확도를 보인다.
  • ResNet-56 가지치기는 재학습 후 Li et al. (2017) 대비 매개변수 가지치기 및 정확도가 개선되며 약 27.9% FLOP 감소를 달성한다.
  • ResNet-110 가지치기는 약 39.1% FLOP 감소를 달성하며 매개변수 가지치기도 유사하지만 재학습 후 일부 경우 Li et al. (2017)보다 정확도가 약간 낮을 수 있다.
  • 모델 전반에 걸쳐 더 나중 층을 더 공격적으로 가지치면 이점이 크고, 초기 층은 가지치기에 더 민감하여 임계값을 신중하게 설정해야 한다.
  • 추론 시간 감소는 FLOP 감소와 거의 비례하며 CIFAR-10 테스트 실행(Table 3)에서 실질적인 속도 향상을 보여준다.
  • 사전 학습된 모델에서의 가지치기와 재학습이 처음부터 가지치기(pruning-from-scratch)보다 일반적으로 더 나은 성과를 낸다(Table 4).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.