Skip to main content
QUICK REVIEW

[논문 리뷰] Trainability Preserving Neural Pruning

Huan Wang, Yun Fu|arXiv (Cornell University)|2022. 07. 25.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 훈련 가능성 유지 프루닝(Trainability Preserving Pruning, TPP)을 제안한다. 이는 프루닝된 필터의 그람 행렬을 정규화하여 유지된 필터로부터 상관관계를 줄이고, 배치 정규화 파라미터를 동시에 정규화함으로써 신경망의 훈련 가능성을 유지하는 구조적 프루닝 방법이다. TPP는 CIFAR-10/100 및 ImageNet-1K에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 고조밀도 조건에서 기존 방법을 능가하며, 선형 네트워크에서 오라클 훈련 가능성 복구 성능과도 맞먹는다.

ABSTRACT

Many recent works have shown trainability plays a central role in neural network pruning -- unattended broken trainability can lead to severe under-performance and unintentionally amplify the effect of retraining learning rate, resulting in biased (or even misinterpreted) benchmark results. This paper introduces trainability preserving pruning (TPP), a scalable method to preserve network trainability against pruning, aiming for improved pruning performance and being more robust to retraining hyper-parameters (e.g., learning rate). Specifically, we propose to penalize the gram matrix of convolutional filters to decorrelate the pruned filters from the retained filters. In addition to the convolutional layers, per the spirit of preserving the trainability of the whole network, we also propose to regularize the batch normalization parameters (scale and bias). Empirical studies on linear MLP networks show that TPP can perform on par with the oracle trainability recovery scheme. On nonlinear ConvNets (ResNet56/VGG19) on CIFAR10/100, TPP outperforms the other counterpart approaches by an obvious margin. Moreover, results on ImageNet-1K with ResNets suggest that TPP consistently performs more favorably against other top-performing structured pruning approaches. Code: https://github.com/MingSun-Tse/TPP.

연구 동기 및 목표

  • 구조적 신경망 프루닝에서 훈련 가능성 저하 문제를 해결함으로써 성능 저하와 하이퍼파라미터에 대한 민감도를 완화한다.
  • ResNet 및 VGG와 같은 깊은 합성곱 신경망에서 훈련 가능성을 유지하지 못하는 기존 프루닝 방법의 한계를 극복한다.
  • 후속 재훈련 히وري스틱에 의존하지 않고도 필터 프루닝 중 훈련 가능성을 유지할 수 있는 확장 가능한 정규화 기반 접근법을 개발한다.
  • 프루닝 과정에서 배치 정규화 파라미터를 명시적으로 고려함으로써, 이들의 무시된 제거가 훈련 가능성에 심각한 영향을 미치는 것을 방지한다.
  • 선형 네트워크에서 오라클 훈련 가능성 복구 성능과 동등한 성능을 달성하면서도, 비선형 합성곱 네트워크에서 최신 기술 수준(SOTA) 방법을 능가한다.

제안 방법

  • 합성곱 필터의 그람 행렬에 대한 새로운 정규화를 제안하여, 프루닝된 필터와 유지된 필터 간의 상관관계를 줄이고 훈련 가능성을 유지한다.
  • 기존의 직교 제약 조건과 달리, 유지된(중요한) 필터의 자기상관관계를 과도하게 페널티 부과하지 않아 최적화 성능 저하와 국소 최적해에 갇히는 것을 방지한다.
  • 프루닝 과정에서 배치 정규화(BN) 스케일 및 시프트 파라미터에 대한 정규화 항을 도입하여, BN 레이어 제거 시 발생하는 성능 저하를 완화한다.
  • 프루닝 전 단계에서 정규화를 적용함으로써, 재훈련 이전에도 프루닝된 모델이 초기 단계부터 훈련 가능하도록 보장한다.
  • 이중 단계 훈련 프로세스를 적용: 먼저 프루닝된 모델에 TPP 정규화를 적용한 후, 표준 재훈련을 통해 미세조정한다.
  • 그람 행렬 정규화를 미분 가능한 손실 항으로 공식화하여, 프루닝된 필터와 유지된 필터 간의 상관관계를 0으로 유도하도록 유도한다.

실험 결과

연구 질문

  • RQ1정규화 기반 프루닝 방법이 ResNet 및 VGG와 같은 깊은 합성곱 신경망에서 기존 방법이 실패하는 상황에서도 훈련 가능성을 유지할 수 있는가?
  • RQ2프루닝된 필터를 유지된 필터로부터 분리시키는 것이 최종 정확도와 학습률과 같은 재훈련 하이퍼파라미터에 대한 민감도에 어떤 영향을 미치는가?
  • RQ3구조적 프루닝 과정에서 배치 정규화 파라미터가 훈련 가능성 저하에 기여하는 정도는 어느 정도이며, 이를 명시적으로 정규화함으로써 성능 향상을 이룰 수 있는가?
  • RQ4제안된 방법이 ImageNet-1K와 같은 대규모 벤치마크에서 기존 최신 기술 수준(SOTA)의 구조적 프루닝 접근법을 능가하는가?
  • RQ5훈련 가능성 저하가 가장 심각한 고조밀도 조건에서 이 방법의 성능은 어떠한가?

주요 결과

  • CIFAR-10/100의 ResNet56 및 VGG19에서 TPP는 모든 비교 기준 모델, 특히 고조밀도 조건에서의 크기 기반 프루닝 및 다른 직교 기반 방법을 능가한다.
  • ResNet50 기반 ImageNet-1K에서 2.31× 속도 향상 조건에서 TPP는 다음으로 좋은 방법보다 정확도를 1.15% 향상시켰으며, 3.06× 속도 향상 조건에서는 2.87% 향상되었다.
  • 선형 MLP에서 TPP는 오라클 훈련 가능성 복구 기법과 유사한 성능을 달성하여, 내재적 훈련 가능성 유지 능력이 뛰어나다는 것을 입증한다.
  • 절단 실험을 통해 그람 행렬 정규화와 BN 파라미터 정규화 모두 필수적임을 확인: 둘 중 하나를 제거하면 고조밀도 조건에서 성능 저하가 심해진다.
  • 직교 기반 정규화(대비로 대각선만 고려하는 것과 비교)는 특히 조밀도 비율 0.7 이상에서 뛰어난 성능을 보이며, VGG19에서 0.7 프루닝 조건에서 최대 3.5% 향상된 성과를 기록한다.
  • ImageNet-1K에서 TPP는 여러 FLOP 수준에서 기존 최신 기술 수준(SOTA) 방법 CHEX를 초월하여, 공격적인 프루닝에 대한 확장성과 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.