Skip to main content
QUICK REVIEW

[논문 리뷰] Centripetal SGD for Pruning Very Deep Convolutional Networks with Complicated Structure

Xiaohan Ding, Guiguang Ding|arXiv (Cornell University)|2019. 04. 08.
Advanced Neural Network Applications참고 문헌 69인용 수 16
한 줄 요약

이 논문은 중심가속SGD(C-SGD)라는 새로운 최적화 방법을 제안한다. C-SGD는 합성곱 신경망의 다수 필터가 가중치 공간에서 동일한 파arameter 값으로 수렴하도록 하여, 성능 저하 없이 필터 프루닝을 가능하게 한다. 중복된 필터를 하나의 대표 필터로 압축하고, 그들의 입력 채널 파라미터를 재분배함으로써, 미세조정 없이도 훈련 후 즉각적인 네트워크 슬리밍을 가능하게 한다. 이는 CIFAR-10과 ImageNet에서 최고 성능을 기록하며 최소한의 정확도 저하로 구현된다.

ABSTRACT

The redundancy is widely recognized in Convolutional Neural Networks (CNNs), which enables to remove unimportant filters from convolutional layers so as to slim the network with acceptable performance drop. Inspired by the linear and combinational properties of convolution, we seek to make some filters increasingly close and eventually identical for network slimming. To this end, we propose Centripetal SGD (C-SGD), a novel optimization method, which can train several filters to collapse into a single point in the parameter hyperspace. When the training is completed, the removal of the identical filters can trim the network with NO performance loss, thus no finetuning is needed. By doing so, we have partly solved an open problem of constrained filter pruning on CNNs with complicated structure, where some layers must be pruned following others. Our experimental results on CIFAR-10 and ImageNet have justified the effectiveness of C-SGD-based filter pruning. Moreover, we have provided empirical evidences for the assumption that the redundancy in deep neural networks helps the convergence of training by showing that a redundant CNN trained using C-SGD outperforms a normally trained counterpart with the equivalent width.

연구 동기 및 목표

  • 구조적 의존성을 따라야 하는 매우 깊고 복잡한 CNN에서 제약 조건이 있는 필터 프루닝 문제를 해결하기 위해.
  • 네트워크 슬리밍 과정에서 성능 손실가 없도록 하여, 프루닝 후에 미세조정이 필요 없도록 하기 위해.
  • 깊은 네트워크에서의 중복성(레이어 내 필터의 유사성)이 훈련 수렴성과 일반화 능력을 향상시킬 수 있는지 탐색하기 위해.
  • 필터 크기의 크기를 0으로 설정하는 것보다 더 나은 표현 능력을 유지하는 방법을 개발하기 위해.
  • 중복된 필터 수렴이 훈련 안정성과 성능 향상에 기여한다는 경험적 증거를 제공하기 위해.

제안 방법

  • C-SGD는 레이어 내 다수의 필터가 가중치 초입공간에서 동일한 파라미터 값으로 수렴하도록 유도하는 새로운 손실 항을 도입한다.
  • 이 방법은 중심가속력 유사 업데이트 규칙을 사용하여 필터 파라미터를 공통 중심점으로 끌어당기며, 클러스터 내 필터 간의 제곱 편차 합을 최소화한다.
  • 필터는 클러스터로 묶이며(예: 레이어당 5/8의 필터), 최적화는 다음의 편차 지표 $\chi = \sum_{i\in\mathcal{L}} \sum_{j\in\mathcal{P}_i} \| \mathbf{K}^{(i)}_{:,:,:.j} - \mathbf{c}^{(i)} \|_2^2 $ 를 최소화한다. 여기서 $\mathbf{c}^{(i)}$ 는 클러스터 중심이다.
  • 훈련 후 동일한 필터는 하나로 통합되며, 남아 있는 필터에 입력 채널 파라미터가 합산되어 즉각적인 프루닝이 가능해지며, 정확도 저하 없이 실행된다.
  • 이 방법은 그룹-Lasso 정규화를 사용하지 않고 직접적인 파라미터 클러스터링을 사용함으로써, 크기 기반 정규화에 비해 계산 비용을 감소시킨다.
  • C-SGD는 일정한 학습률로 표준 훈련 기간 동안 적용되며, 필터 클러스터의 지수 수렴을 달성한다.

실험 결과

연구 질문

  • RQ1CNN의 필터들이 파라미터 공간에서 동일하게 수렴하도록 훈련시킬 수 있는가? 이를 통해 미세조정 없이 프루닝이 가능한가?
  • RQ2동일한 필터를 융합하는 것이 필터 크기를 0으로 설정하는 것보다 네트워크 용량을 더 잘 유지하는가?
  • RQ3C-SGD는 Residual 및 Dense 연결 구조를 포함한 매우 깊고 복잡한 네트워크에서 훈련 수렴성과 일반화 능력을 향상시킬 수 있는가?
  • RQ4정규화 기반의 그룹-Lasso와 크기 기반 프루닝에 비해 C-SGD는 정확도와 안정성 측면에서 어떻게 비교되는가?
  • RQ5중복된 필터 클러스터링은 동일한 네트워크 폭을 가진 표준 훈련보다 더 나은 성능을 낼 수 있는가?

주요 결과

  • C-SGD는 ResNet-56 및 DenseNet-40에서 프루닝 후 성능 손실 없이도, 크기 기반 또는 그룹-Lasso 방법과 달리 미세조정이 필요 없었다.
  • CIFAR-10에서 C-SGD 기반 프루닝은 레이어당 3개의 필터로 줄인 후에도 ResNet-56에서 93.8%의 top-1 정확도를 달성했으며, 크기 기반 및 APoZ 방법을 모두 능가했다.
  • ImageNet에서 C-SGD는 레이어당 3개의 필터로 줄인 ResNet-56에서 76.1%의 top-1 정확도를 기록했으며, 기준 방법들보다 2% 이상 뛰어났다.
  • C-SGD 하에서 제곱 커널 편차 합 $\chi$ 는 단조롭고 지수적으로 감소하여, 필터 클러스터의 안정적이고 빠른 수렴을 나타냈다.
  • 그룹-Lasso 정규화는 600 에포크가 걸렸고, 여전히 프루닝 후 약 10%의 정확도 저하를 초래했지만, C-SGD는 100 에포크 미만으로도 유사하거나 더 뛰어난 성능을 달성했다.
  • 그룹-Lasso보다 C-SGD 훈련이 두 배 빠르게 진행되었으며, 정규화 과정에서 비용이 많이 드는 제곱근 연산을 피했기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.