Skip to main content
QUICK REVIEW

[논문 리뷰] Structural Pruning via Latency-Saliency Knapsack

Maying Shen, Hongxu Yin|arXiv (Cornell University)|2022. 10. 13.
Advanced Neural Network Applications인용 수 10
한 줄 요약

이 논문은 하드웨어 인식 지연 시간 절삭(HALP)을 제안하며, 보완된 낙량 해법기반 솔버를 사용하여 네트워크 절삭을 지연 시간 제약이 있는 자원 할당 문제로 공식화하는 구조적 절삭 방법이다. 사전 계산된 지연 시간 룩업 테이블과 글로벌 중요도 점수를 결합함으로써 HALP는 목표 지연 시간 예산 내에서 정확도를 최대화할 수 있는 최적의 필터 제거를 효율적으로 식별한다. 이는 여러 모델과 하드웨어 플랫폼에서 ImageNet 및 VOC 벤치마크에서 최신 기술 수준의 정확도-지연 시간 트레이드오프를 달성한다.

ABSTRACT

Structural pruning can simplify network architecture and improve inference speed. We propose Hardware-Aware Latency Pruning (HALP) that formulates structural pruning as a global resource allocation optimization problem, aiming at maximizing the accuracy while constraining latency under a predefined budget on targeting device. For filter importance ranking, HALP leverages latency lookup table to track latency reduction potential and global saliency score to gauge accuracy drop. Both metrics can be evaluated very efficiently during pruning, allowing us to reformulate global structural pruning under a reward maximization problem given target constraint. This makes the problem solvable via our augmented knapsack solver, enabling HALP to surpass prior work in pruning efficacy and accuracy-efficiency trade-off. We examine HALP on both classification and detection tasks, over varying networks, on ImageNet and VOC datasets, on different platforms. In particular, for ResNet-50/-101 pruning on ImageNet, HALP improves network throughput by $1.60 imes$/$1.90 imes$ with $+0.3\%$/$-0.2\%$ top-1 accuracy changes, respectively. For SSD pruning on VOC, HALP improves throughput by $1.94 imes$ with only a $0.56$ mAP drop. HALP consistently outperforms prior art, sometimes by large margins. Project page at https://halp-neurips.github.io/.

연구 동기 및 목표

  • 실제 하드웨어 제약 조건 하에서 최적의 정확도-지연 시간 트레이드오프를 달성하는 구조적 신경망 절삭의 과제를 해결하기 위해.
  • 특히 비선형 지연 패턴을 보이는 GPU 플랫폼에서 FLOPs 기반 절삭의 한계를 극복하기 위해 실제 하드웨어 지연 측정치를 통합함으로써.
  • 정의된 지연 시간 예산을 충족시키면서 모델 정확도를 최대화하는 제약 조건이 있는 최적화 문제로 글로벌 구조적 절삭을 공식화하기 위해.
  • 층별 구조적 제약 조건과 하드웨어 특화 지연 행동을 고려하는 효율적이고 확장 가능한 절삭 알고리즘을 개발하기 위해.
  • 다양한 모델과 데이터셋에서 기존 절삭 방법을 뛰어넘는 정확도와 추론 속도를 달성하기 위해.

제안 방법

  • HALP는 대상 하드웨어에서 층별 지연 시간 룩업 테이블을 구축하여, 채널 수가 변할 때의 비단조화적이고 계단형 지연 행동을 캡처한다.
  • 각 필터의 글로벌 중요도 점수를 계산하여 정확도에 대한 제거 영향을 추정하고, 중요도 기반 순위 매기기를 가능하게 한다.
  • 지연 시간 예산 내에서 보상 최대화 문제로 절삭을 공식화하며, 보상은 유지된 필터의 누적 중요도 점수이다.
  • 보완된 낙량 해법기를 사용하여 필터를 선택하며, 층별 순서를 존중하는 탐욕적 근사 방법을 적용한다: 한 층 내에서 더 중요한 필터만 더 낮은 중요도의 필터보다 먼저 유지된다.
  • 해법기는 지연 제약 조건 하에서 유지할 최적의 필터 조합을 동적으로 추적하여, 하드웨어 제약 조건 하에서도 최적의 정확도를 보장한다.
  • 알고리즘은 탐욕적 및 비탐욕적 버전을 모두 지원하며, 효율성과 비교 가능한 성능로 인해 실무에서는 탐욕적 버전을 사용한다.

실험 결과

연구 질문

  • RQ1FLOPs를 대체로 사용하는 대신 하드웨어 특화 지연 행동을 모델링함으로써 구조적 절삭을 향상시킬 수 있는가?
  • RQ2딥 네트워크의 모든 층을 아우르는 글로벌이고 종단 간 최적화 방식으로 정확도와 지연 시간을 동시에 최적화할 수 있는가?
  • RQ3층별 구조적 제약 조건이 절삭 과정에 미치는 영향은 무엇이며, 이를 효율적으로 구현할 수 있는가?
  • RQ4하드웨어 인식 지연 시간과 중요도 점수를 통합한 낙량 기반 공식화가 기존 절삭 방법보다 정확도와 속도 면에서 뛰어나게 되는가?
  • RQ5다양한 모델(예: ResNet, SSD)과 하드웨어 플랫폼에서 다양한 지연 시간 예산 하에서 절삭 성능은 어떻게 변화하는가?

주요 결과

  • 1G 지연 시간 예산 하에서 ImageNet의 ResNet-50에 대해 HALP는 77.45%의 상위-1 정확도와 1203 FPS를 달성하여, 정확도 변화는 +0.3%에 불과하지만 처리량을 1.60배 향상시켰다.
  • 동일한 1G 예산 하에서 ResNet-101에 대해 HALP는 76.56%의 상위-1 정확도와 1672 FPS를 달성하여 처리량을 1.90배 향상시키고 정확도는 -0.2% 감소시켰다.
  • VOC에서 SSD에 대해 HALP는 처리량을 1.94배 향상시키며 단지 0.56 mAP 감소만을 기록하여 객체 검출에서 뛰어난 성능을 보였다.
  • 비탐욕적 낙량 해법기는 탐욕적 버전보다 약간 더 높은 정확도를 달성하지만(예: ResNet-50에서 77.51% 대비 77.45%), 상당히 높은 계산 비용을 수반한다.
  • HALP는 평가된 모든 모델, 데이터셋, 하드웨어 플랫폼에서 이전 최신 기술 수준의 구조적 절삭 방법을 뛰어넘는 일관된 성능을 보였다.
  • 제거 분석 결과, 지연 시간 룩업 테이블과 중요도 기반 순위 매기기가 최적의 정확도-지연 시간 트레이드오프를 달성하는 데 모두 핵심적인 역할을 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.