[논문 리뷰] Training Compact CNNs for Image Classification using Dynamic-coded Filter Fusion
이 논문은 사전 훈련 모델이나 희박성 정규화에 의존하지 않고 압축된 CNN을 훈련할 수 있는 새로운 필터 프루닝 방법인 동적코딩 필터 융합(DCFF)을 제안한다. 온도 조절된 상호유사도 분포를 필터의 대체 지표로 사용하여, DCFF는 동적으로 필터 중요도를 평가하고 가중 평균을 통한 융합을 통해 효율적이고 종단간(end-to-end)으로 초기 상태에서 훈련할 수 있다. 이 방법은 FLOP와 파라미터를 크게 줄이며 최고 수준의 정확도를 달성한다. 예를 들어, CIFAR-10에서 93.47%의 top-1 정확도를 기록하면서 72.77M FLOPs와 1.06M 파라미터를 사용하는 압축된 VGGNet-16을 구현한다.
The mainstream approach for filter pruning is usually either to force a hard-coded importance estimation upon a computation-heavy pretrained model to select "important" filters, or to impose a hyperparameter-sensitive sparse constraint on the loss objective to regularize the network training. In this paper, we present a novel filter pruning method, dubbed dynamic-coded filter fusion (DCFF), to derive compact CNNs in a computation-economical and regularization-free manner for efficient image classification. Each filter in our DCFF is firstly given an inter-similarity distribution with a temperature parameter as a filter proxy, on top of which, a fresh Kullback-Leibler divergence based dynamic-coded criterion is proposed to evaluate the filter importance. In contrast to simply keeping high-score filters in other methods, we propose the concept of filter fusion, i.e., the weighted averages using the assigned proxies, as our preserved filters. We obtain a one-hot inter-similarity distribution as the temperature parameter approaches infinity. Thus, the relative importance of each filter can vary along with the training of the compact CNN, leading to dynamically changeable fused filters without both the dependency on the pretrained model and the introduction of sparse constraints. Extensive experiments on classification benchmarks demonstrate the superiority of our DCFF over the compared counterparts. For example, our DCFF derives a compact VGGNet-16 with only 72.77M FLOPs and 1.06M parameters while reaching top-1 accuracy of 93.47% on CIFAR-10. A compact ResNet-50 is obtained with 63.8% FLOPs and 58.6% parameter reductions, retaining 75.60% top-1 accuracy on ILSVRC-2012. Our code, narrower models and training logs are available at https://github.com/lmbxmu/DCFF.
연구 동기 및 목표
- 기존의 필터 프루닝 방법이 계산 비용이 큰 사전 훈련 모델이나 초모수 민감도가 높은 희박성 제약 조건에 의존하는 한계를 해결하기 위해.
- 정밀조정(fine-tuning)이나 희박성 정규화 없이도 계산 효율적이고 정확도가 높은 압축된 CNN을 유도하기 위한 방법을 개발하기 위해.
- 온도 조절된 상호유사도 대체 지표를 사용하여 훈련 중에 동적으로 필터 중요도 평가를 가능하게 하기 위해.
- 필터 제거를 필터 융합으로 대체하여 상대적 중요도에 기반한 가중 평균을 통해 모델 용량을 유지하기 위해.
- 압축 모델을 사전 훈련 없이 초기 상태에서 훈련함으로써 뛰어난 성능과 복잡도 감소를 달성할 수 있음을 보여주기 위해.
제안 방법
- 각 필터는 대표성 표현을 위해 온도 조절된 상호유사도 분포를 대체 지표로 할당받는다.
- Kullback-Leibler 발산 기반의 동적코딩 기준은 필터의 대체 지표를 필터 전체 평균 대체 지표와 비교하여 필터 중요도를 평가한다.
- 낮은 중요도 점수를 가진 필터는 기각되지 않고, 할당된 대체 지표를 융합 가중치로 사용하여 가중 평균을 통한 융합을 수행한다.
- 융합된 필터는 최종 압축 모델로 유지되며, 원본 필터는 훈련 중 역전파를 통해 업데이트된다.
- 온도 파rameter T는 점차 무한대에 수렴하도록 증가하여 대체 지표 분포가 일항(oneshot) 벡터로 수렴하게 하여 동적 중요도 재평가를 가능하게 한다.
- 이 방법은 사전 훈련에 의존하지 않고 희박성 정규화 제약 조건을 피하는 종단간 초기 훈련을 수행한다.
실험 결과
연구 질문
- RQ1계산 비용이 큰 사전 훈련 모델에 의존하지 않고도 필터 프루닝을 수행할 수 있는가?
- RQ2초모수 민감도가 높은 희박성 제약 조건 없이도 동적 필터 중요도 평가를 달성할 수 있는가?
- RQ3대체 지표 기반 가중 평균 융합이 단순한 필터 제거보다 모델 정확도 유지에 더 우수한가?
- RQ4정규화 없이 종단간 방식으로 사전 훈련 없이도 최고 수준의 성능을 달성하는 압축된 CNN을 초기 상태에서 훈련할 수 있는가?
- RQ5대체 지표 분포의 온도 파rameter가 최종 압축 모델의 안정성과 성능에 어떤 영향을 미치는가?
주요 결과
- DCFF는 압축된 VGGNet-16에서 CIFAR-10에서 93.47%의 top-1 정확도를 기록하면서 72.77M FLOPs와 1.06M 파라미터를 사용한다.
- ResNet-50의 경우, DCFF는 FLOPs를 63.8% 감소시키고 파라미터를 58.6% 감소시키며 ImageNet에서 75.60%의 top-1 정확도를 유지한다.
- 온도 파rameter T가 10^4로 증가할 때 성능이 안정화되며, 안정적인 중요도 코드화를 위한 일항 분포에 수렴한다.
- 층별 프루닝 비율을 위한 구조 탐색(ABCPruner)이나 글로벌 랭킹(EagleEye)을 사용하면 수동 비율 설정보다 성능이 향상되며, DCFF는 2256M FLOPs와 18.02M 파라미터에서 75.79%의 top-1 정확도를 달성한다.
- 무작위 필터 융합은 성능을 55.63%로 떨어뜨려, 대체 지표 기반 중요도 유도가 핵심임을 확인한다.
- 기존 베이스라인 대비 정확도와 효율성 측면에서 모두 뛰어난 성능을 보이며, 사전 훈련 없이 희박성 제약 없이도 압축된 CNN 훈련에서 우수성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.