Skip to main content
QUICK REVIEW

[논문 리뷰] SPDY: Accurate Pruning with Speedup Guarantees

Elias Frantar, Dan Alistarh|arXiv (Cornell University)|2022. 01. 31.
Advanced Neural Network Applications인용 수 4
한 줄 요약

SPDY는 특정 하드웨어에서 목표 인fer 속도 향상을 보장하면서 정확도 손실을 최소화하는 최적의 계층별 희소성 프로파일을 자동으로 결정하는 동적 프rogram밍 기반 방법을 도입한다. 이는 효율적인 동적 프로그래밍 솔버와 국소 검색 절차를 결합하여 소규모 校정 데이터에서 계층별 오차 점수를 학습하며, 비전 및 언어 모델에서 일괄 및 점진적 프루닝 모두에서 기존 프루닝 방법을 능가한다.

ABSTRACT

The recent focus on the efficiency of deep neural networks (DNNs) has led to significant work on model compression approaches, of which weight pruning is one of the most popular. At the same time, there is rapidly-growing computational support for efficiently executing the unstructured-sparse models obtained via pruning. Yet, most existing pruning methods minimize just the number of remaining weights, i.e. the size of the model, rather than optimizing for inference time. We address this gap by introducing SPDY, a new compression method which automatically determines layer-wise sparsity targets achieving a desired inference speedup on a given system, while minimizing accuracy loss. SPDY is composed of two new techniques: the first is an efficient dynamic programming algorithm for solving the speedup-constrained layer-wise compression problem assuming a set of given layer-wise sensitivity scores; the second is a local search procedure for determining accurate layer-wise sensitivity scores. Experiments across popular vision and language models show that SPDY guarantees speedups while recovering higher accuracy relative to existing strategies, both for one-shot and gradual pruning scenarios, and is compatible with most existing pruning approaches. We also extend our approach to the recently-proposed task of pruning with very little data, where we achieve the best known accuracy recovery when pruning to the GPU-supported 2:4 sparsity pattern.

연구 동기 및 목표

  • 기존 프루닝 방법이 모델 크기 최적화에 치중되어 있어 특정 하드웨어에서의 인fer 속도 최적화에 빈도가 떨어지는 격차를 메운다.
  • 목표 속도 향상을 보장하면서 정확도 저하를 최소화하는 자동적이고 시스템 인지형 희소성 프로파일 생성을 가능하게 한다.
  • 히우리스틱 또는 균일한 희소성 할당의 한계를 극복하기 위해 최소한의 校정 데이터에서 계층별 감도 점수를 학습한다.
  • 일괄 및 점진적 프루닝 모두에 호환되며, 저데이터 및 2:4 희소성 설정으로도 확장 가능하다.
  • 비구조적 프루닝을 넘어서 양자화나 저랭크 근사와 같은 다른 압축 기법에도 일반화 가능한 프레임워크를 제공한다.

제안 방법

  • 목표 속도 향상을 달성하면서 정확도 손실을 최소화하는 제약 조건이 있는 최적화 문제로 계층별 희소성 선택 문제를 수립한다.
  • 레이어 수와 각 레이어의 희소성 선택지 수에 대해 선형 시간 복잡도를 가지는 동적 프로그래밍 알고리즘을 제안하여 제약 조건이 있는 압축 문제를 효율적이고 정확하게 해결한다.
  • 소규모 校정 세트에서 재구성된 희소 모델의 성능을 평가하여 계층별 오차 점수를 자동으로 학습하는 국소 검색 절차를 도입한다.
  • 희소 모델 재구성을 위해 AdaPrune의 수정 버전을 사용하여 다양한 희소성 프로파일의 영향을 정확하게 추정한다.
  • 교정 데이터에서의 전역 프루닝 행동을 활용해 상호 레이어 영향을 고려한 감도 점수를 유추함으로써, 개별 레이어 히우리스틱보다 더 뛰어난 강건성을 확보한다.
  • FLOPs, 에너지 소비, 파라미터 수 등 임의의 덧셈 제약 조건을 지원하여 속도 향상 외의 분야로도 확장 가능한 프레임워크를 제공한다.

실험 결과

연구 질문

  • RQ1특정 하드웨어 플랫폼에서 특정 인fer 속도 향상을 보장하는 계층별 희소성 수준을 자동으로 결정할 수 있는 일반적 방법을 개발할 수 있는가?
  • RQ2전역 네트워크 행동을 반영하고 기존 히우리스틱(예: 가중치 크기)보다 정확도를 향상시키는 방식으로 계층별 오차 점수를 어떻게 학습할 수 있는가?
  • RQ3제안된 방법이 다양한 모델과 프루닝 방식에서 정확도와 속도 향상 일致성 측면에서 기존 프루닝 전략을 능가하는가?
  • RQ4저데이터 또는 사후 훈련 2:4 희소성 설정으로도 강력한 성능을 발휘할 수 있는가?
  • RQ5학습된 희소성 프로파일이 일괄 프루닝 대비 점진적 프루닝과 같은 다양한 훈련 제약 조건 간에 얼마나 잘 일반화되는가?

주요 결과

  • SPDY는 ResNet50, YOLOv5m, BERT를 포함한 모든 테스트 모델에서 최신 기준선보다 높은 정확도를 달성하며, 특히 높은 속도 향상에서 두각을 나타낸다.
  • YOLOv5m에서 SPDY는 2.00× 속도 향상에서 mAP@0.5 61.50을 달성하여 다음으로 우수한 방법보다 2.5점 이상 높은 성능을 보였다.
  • BERT SQuAD에서 SPDY는 4.00× 속도 향상에서도 F1 87.14를 유지하며, 다음으로 우수한 방법 대비 F1 손실 감소 1.4점의 우수성을 보였다.
  • 유사한 속도 향상에서도 균일하거나 GMP 프루닝보다 전체 모델 희소성 수준을 낮추며, 이는 미세조정 후 더 높은 정확도로 이어질 가능성이 있다.
  • 중간 프루닝 모델에서 재실행하는 반복적 적용을 통해 정확도 향상이 추가로 이루어지며, 점진적 개선 잠재력이 있음을 시사한다.
  • SPDY 프로파일은 일반화 능력이 뛰어나며, AC/DC 훈련된 모델에 적용해도 여전히 뛰어난 성능을 발휘한다. 이는 로또 티켓 원칙과 유사한 아키텍처 인지 전이 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.