Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Network Pruning with Residual-Connections and Limited-Data

Jian-Hao Luo, Jianxin Wu|arXiv (Cornell University)|2019. 11. 19.
Advanced Neural Network Applications참고 문헌 39인용 수 11
한 줄 요약

이 논문은 KL-발산 기반 기준을 사용하여 잔차 연결 내외의 채널을 동시에 제거하는 새로운 필터 수준 프루닝 방법인 CURL을 제안한다. 이는 더 효율적인 '지갑 모양'의 네트워크 구조를 가능하게 한다. 또한, 데이터가 제한된 상황에서 지식 증착과 레이블 정제를 조합하여 노이즈가 있는 소프트 레이블의 영향을 완화함으로써, CUB200 및 Pets와 같은 소규모 데이터셋에서만 훈련된 경우에도 대규모 사전 훈련 모델의 미세조정 성능과 비교해도 열등하지 않은 성능을 달성한다.

ABSTRACT

Filter level pruning is an effective method to accelerate the inference speed of deep CNN models. Although numerous pruning algorithms have been proposed, there are still two open issues. The first problem is how to prune residual connections. We propose to prune both channels inside and outside the residual connections via a KL-divergence based criterion. The second issue is pruning with limited data. We observe an interesting phenomenon: directly pruning on a small dataset is usually worse than fine-tuning a small model which is pruned or trained from scratch on the large dataset. Knowledge distillation is an effective approach to compensate for the weakness of limited data. However, the logits of a teacher model may be noisy. In order to avoid the influence of label noise, we propose a label refinement approach to solve this problem. Experiments have demonstrated the effectiveness of our method (CURL, Compression Using Residual-connections and Limited-data). CURL significantly outperforms previous state-of-the-art methods on ImageNet. More importantly, when pruning on small datasets, CURL achieves comparable or much better performance than fine-tuning a pretrained small model.

연구 동기 및 목표

  • 깊은 CNN에서 잔차 연결을 프루닝하는 데 도전하는 것 — 이는 종종 성능 저하를 초래하는 시계열 형태의 아키텍처로 이어진다.
  • 대규모 데이터셋이 가용하지 않은 실제 시나리오에서, 훈련 데이터가 제한된 상황에서 모델 정확도를 향상시키는 것.
  • 대규모 사전 훈련에 대한 의존도를 줄이고, 높은 정확도를 유지하면서도 소규모 타겟 데이터셋에서 직접 프루닝을 가능하게 하는 것.
  • 소규모 데이터셋에서 미세조정을 수행할 때 지식 증착 과정에서 발생하는 노이즈가 많은 소프트 레이블의 부정적 영향을 완화하는 것.

제안 방법

  • KL-발산 기반 기준은 잔차 경로와 아이덴티티 경로 양쪽에서 필터의 중요도를 평가하여, 잔차 연결 내외의 채널을 동시에 프루닝할 수 있도록 한다.
  • 프루닝은 잔차 스테이지의 모든 블록에 동시에 적용되어, 잔차 연결의 구조적 통합성을 유지한다.
  • 믹스업을 통한 데이터 증강을 사용하여 소규모 데이터셋을 확장함으로써 훈련 다양성과 모델의 강건성을 향상시킨다.
  • 지식 증착 과정 중에 소프트 레이블을 업데이트하는 레이블 정제 전략을 도입하여, 노이즈가 많은 교사 모델 예측의 영향을 줄인다.
  • 데이터 증강과 레이블 정제를 지식 증착과 융합하여, 제한된 데이터에서의 성능 향상을 도모한다.
  • 이 방법은 종단 간(end-to-end)으로 적용되어, 대규모 사전 훈련 데이터에 접근할 필요 없이 소규모 데이터셋에서 직접 프루닝을 수행할 수 있다.

실험 결과

연구 질문

  • RQ1잔차 경로 내외의 필터를 동시에 프루닝하는 것이, 기존의 잔차 경로 내부의 필터만 제거하는 전통적 프루닝 방식에 비해 모델의 효율성과 정확도를 향상시키는가?
  • RQ2소규모 데이터셋에서 미세조정을 수행할 때, 노이즈가 많은 소프트 레이블의 영향을 줄이기 위해 지식 증착을 어떻게 향상시킬 수 있는가?
  • RQ3데이터 증강을 지식 증착과 레이블 정제와 융합하면, 기존의 표준 증착 방식에 비해 저데이터 환경에서 더 높은 성능을 달성할 수 있는가?
  • RQ4소규모 데이터셋에서 직접 훈련된 프루닝된 모델이, 대규모 데이터셋에서 사전 훈련된 모델을 미세조정한 성능과 비교해도 유사하거나 뛰어난 성능을 낼 수 있는가?

주요 결과

  • ImageNet에서 CURL은 이전 최고 성능의 프루닝 방법들을 능가하며, 지갑 모양의 잔차 블록 아키텍처를 통해 뛰어난 정확도와 효율성을 입증했다.
  • CUB200에서 제안된 KL-발산 기준은 미세조정 없이도 프루닝 후 66.33%의 top-1 정확도를 달성했으며, 무작위(6.80%) 및 가중치 합계(8.25%) 기반 베이스라인에 비해 뚜렷한 우월성을 보였다.
  • 레이블 정제를 적용한 MobileNetV2는 CUB200에서 78.72%의 top-1 정확도를 기록했으며, 정제 없이 표준 지식 증착을 사용한 경우보다 1.29% 향상된 성능을 보였다.
  • 소규모 데이터셋에서 CURL을 사용해 미세조정한 ResNet50은 CUB200에서 83.64%의 정확도를 달성했으며, 표준 증착 방식의 82.88%를 초월했다.
  • 레이블 정제 방법은 개 데이터셋에서 최대 0.84%의 정확도 향상을 이끌어내어, 레이블 노이즈의 영향을 줄이는 데 효과적임을 입증했다.
  • 믹스업, 지식 증착, 레이블 정제의 조합을 통해 소규모 데이터셋에서 직접 프루닝을 수행함으로써, ImageNet에서 사전 훈련된 모델을 미세조정한 성능을 도달하거나 초월할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.