Skip to main content
QUICK REVIEW

[논문 리뷰] TRP: Trained Rank Pruning for Efficient Deep Neural Networks

Yuhui Xu, Yuxi Li|arXiv (Cornell University)|2020. 04. 30.
Sparse and Compressive Sensing Techniques인용 수 4
한 줄 요약

이 논문은 깊이 신경망의 학습 과정에 저질서 분해와 노름 규제를 통합하는 Trained Rank Pruning (TRP)을 제안한다. 이는 효율적이고 정확한 모델 압축을 가능하게 하며, 학습 중에 전체 네트워크 용량을 유지함으로써 분해 후 거의 정확도 손실가 없는 성능을 달성하고, CIFAR-10 및 ImageNet에서 기존의 저질서 압축 방법보다 뛰어나며 최대 2.23배의 추론 속도 향상을 이룬다.

ABSTRACT

To enable DNNs on edge devices like mobile phones, low-rank approximation has been widely adopted because of its solid theoretical rationale and efficient implementations. Several previous works attempted to directly approximate a pretrained model by low-rank decomposition; however, small approximation errors in parameters can ripple over a large prediction loss. As a result, performance usually drops significantly and a sophisticated effort on fine-tuning is required to recover accuracy. Apparently, it is not optimal to separate low-rank approximation from training. Unlike previous works, this paper integrates low rank approximation and regularization into the training process. We propose Trained Rank Pruning (TRP), which alternates between low rank approximation and training. TRP maintains the capacity of the original network while imposing low-rank constraints during training. A nuclear regularization optimized by stochastic sub-gradient descent is utilized to further promote low rank in TRP. The TRP trained network inherently has a low-rank structure, and is approximated with negligible performance loss, thus eliminating the fine-tuning process after low rank decomposition. The proposed method is comprehensively evaluated on CIFAR-10 and ImageNet, outperforming previous compression methods using low rank approximation.

연구 동기 및 목표

  • 압축된 DNN에서 후행 훈련 시 저질서 분해로 인한 성능 저하 문제를 해결하기 위해.
  • 저질서 분해 이후 광범위한 미세조정이 필요 없도록 과정을 훈련 과정에 통합하기 위해.
  • 최적화 중에 저질서 구조를 강제하면서도 전체 네트워크 용량을 유지함으로써 모델의 효율성과 정확도를 향상시키기 위해.
  • 깊이 있는 저질서 네트워크에서 효과적인 랭크 선택과 안정적인 최적화를 가능하게 하는 훈련 체계를 개발하기 위해.

제안 방법

  • TRP는 매 m회 반복마다 표준 역전파와 절단된 특이값 분해(Truncated SVD, TSVD)를 번갈아 적용하여 최적화 중 원래 가중치를 유지한다.
  • 스토하스틱 부분미분 하강법으로 최적화된 핵심 노름 규제를 사용하여 훈련 중에 가중치 행렬의 저질서 구조를 촉진한다.
  • 반복적인 TSVD와 기울기 업데이트를 통해 점차적으로 가중치를 저질서 형태로 이동시키면서도 원래 네트워크의 전체 용량을 유지한다.
  • 채널 기반 및 공간 기반 저질서 분해 모두와 호환되어 탄력적인 압축을 가능하게 한다.
  • 핵심 노름 규제는 스토하스틱 부분미분 하강법으로 최적화되어 계산 부담 증가 없이 저질서 촉진을 향상시킨다.
  • 훈련 과정에서 특이값 감쇠의 이론적 경계가 유지되어 안정적인 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1후처리 시 저질서 분해로 인한 성능 저하를 방지하기 위해 저질서 분해를 훈련 과정에 효과적으로 통합할 수 있는가?
  • RQ2스토하스틱 부분미분 하강법으로 최적화된 핵심 노름 규제가 저질서 네트워크 훈련의 안정성과 정확도를 어떻게 향상시키는가?
  • RQ3표준 벤치마크에서 TRP는 얼마나 높은 속도 향상과 함께 정확도를 유지할 수 있는가?
  • RQ4TRP는 채널 기반 및 공간 기반 분해 설정 모두에서 기존의 저질서 압축 방법을 초월하는가?

주요 결과

  • ImageNet에서 TRP는 1.80배의 속도 향상으로 Top-1 74.06%, Top-5 92.07%의 정확도를 달성하여 유사 압축 비율에서 Luo 등(2017)과 He 등(2017)을 능가한다.
  • 2.23배의 가속도를 확보한 상태에서 TRP의 Top-5 정확도 손실은 1.4%에 그치며, 동일한 속도 향상 수준에서 He 등(2017)과 Zhou 등(2019)을 뛰어넘는다.
  • ResNet-18에서 공간 기반 분해를 적용한 TRP는 CPU에서 추론 시간을 0.31ms로 줄여 1장당 49.88ms의 처리 속도를 달성하여 기준값(118.02ms)을 뛰어넘는다.
  • 핵심 노름 규제는 기본 방법에 대해 성능 향상을 크게 이끌었지만, TRP에선 수익 감소 효과를 보이며, TRP가 이미 효과적으로 저질서 구조를 유도하고 있음을 시사한다.
  • 랭크 분포 분석 결과 특이값이 훈련 전반에 걸쳐 안정적으로 감쇠하며, 에너지가 첫 번째 몇 개의 특이값에 집중되며, 최소 에너지 비율이 임계값 e=0.05에 도달할 때 수렴한다.
  • 특이값 감쇠의 이론적 경계가 훈련 전반에 걸쳐 유지되어 TRP 최적화 과정의 안정성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.