Skip to main content
QUICK REVIEW

[논문 리뷰] PCNN: Pattern-based Fine-Grained Regular Pruning towards Optimizing CNN Accelerators

Zhanhong Tan, Jiebo Song|arXiv (Cornell University)|2020. 02. 11.
Advanced Neural Network Applications참고 문헌 17인용 수 7
한 줄 요약

PCNN는 커널 수준의 희소성 정보를 인코딩하는 새로운 Sparsity Pattern Mask (SPM) 인덱스 포맷을 사용하여 정교하고 규칙적인 1D 가중치 프루닝 방법을 제안한다. 이는 효율적인 하드웨어 구현을 가능하게 하며, 55nm 구현에서 최대 9.0× 속도 향상과 28.39 TOPS/W의 에너지 효율을 달성한다. 모델 정확도 손실은 0.2% 미만이며, 온칩 메모리 오버헤드는 3.1%에 불과하다. VGG-16 및 ResNet-18에서 성능을 입증하였다.

ABSTRACT

Weight pruning is a powerful technique to realize model compression. We propose PCNN, a fine-grained regular 1D pruning method. A novel index format called Sparsity Pattern Mask (SPM) is presented to encode the sparsity in PCNN. Leveraging SPM with limited pruning patterns and non-zero sequences with equal length, PCNN can be efficiently employed in hardware. Evaluated on VGG-16 and ResNet-18, our PCNN achieves the compression rate up to 8.4X with only 0.2% accuracy loss. We also implement a pattern-aware architecture in 55nm process, achieving up to 9.0X speedup and 28.39 TOPS/W efficiency with only 3.1% on-chip memory overhead of indices.

연구 동기 및 목표

  • 불규칙한 가중치 프루닝이 하드웨어에서 높은 인덱스 오버헤드와 워크로드 불균형을 유발하는 문제를 해결한다.
  • 모델 정확도를 유지하면서도 CNN 가속기의 메모리 및 계산 오버헤드를 줄인다.
  • 병렬 처리 유닛 간 균형 잡힌 워크로드 분배를 가능하게 하는 규칙적이고 정교한 프루닝 방법을 개발한다.
  • 비트폭을 줄이고 저장 요구량을 감소시키는 데 기여하는 컴act한 인덱스 포맷(SPM)을 통해 하드웨어 우군 희소성 인코딩을 가능하게 한다.
  • 기존의 압축 기법(예: 채널 프루닝 및 커널 프루닝)과의 상호 운용성과 상호 보완성을 입증하여 더 높은 종합 압축률을 달성한다.

제안 방법

  • 각 컨볼루션 커널의 비제로 가중치 패턴을 하나의 인덱스로 인코딩하는 커널 수준의 인덱스 포맷인 Sparsity Pattern Mask (SPM)을 도입한다.
  • 특정 레이어 내 모든 커널에 동일한 희소성(비제로 가중치 수)을 적용하여 규칙성과 워크로드 균형을 확보한다.
  • 유일한 희소성 패턴 수를 줄이기 위해 다중 캐리어 백서프레임워크를 적용하여 SPM의 비트폭과 인덱스 저장 비용을 최소화한다.
  • SPM로 인코딩된 가중치와 활성화를 매핑하기 위한 특수한 메모리 최적화 기법을 적용한 55nm 기술 기반의 패턴 인식 가속기 아키텍처를 설계한다.
  • SPM 기반 인덱스 포맷을 활용해 희소 가중치와 활성화를 동시에 처리할 수 있는 스파arsity 인식 PE 어레이를 설계한다.
  • 기존의 프루닝 기법(예: 채널 프루닝 및 커널 프루닝)과 PCNN를 통합하여 상호 보완적이고 누적 가능한 압축 성과를 달성한다.

실험 결과

연구 질문

  • RQ1정교하고 규칙적인 프루닝 방법이 하드웨어 인덱스 오버헤드를 줄이면서도 높은 모델 정확도를 유지할 수 있는가?
  • RQ2커널 수준의 희소성 패턴을 어떻게 컴act하게 인코딩할 수 있을까? 이는 CNN 가속기의 메모리 및 면적 오버헤드를 최소화할 수 있는가?
  • RQ3균일한 커널 희소성과 함께 규칙적인 프루닝을 통해 병렬 처리 유닛 간 워크로드 균형을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 SPM 기반 프루닝 방법이 성능 및 에너지 비용을 최소화하면서도 효율적으로 하드웨어에 매핑될 수 있는가?
  • RQ5채널 프루닝과 같은 다른 압축 기법과 결합했을 때 PCNN 방법의 압축 비율과 정확도는 어떻게 되는가?

주요 결과

  • PCNN는 VGG-16 및 ResNet-18에서 최대 8.4× 모델 압축을 달성하면서도 정확도 손실이 0.2% 미만이다.
  • 55nm 기술 기반으로 제작된 패턴 인식 가속기에서 최대 9.0× 속도 향상과 28.39 TOPS/W의 에너지 효율을 달성하였으며, 인덱스에 대한 온칩 메모리 오버헤드는 3.1%에 불과하다.
  • 불규칙한 프루닝 대비 SPM 인덱스 포맷이 인덱스 저장 오버헤드를 줄였으며, 레이어당 16개의 패턴에 대해서도 오직 3.1%의 메모리 오버헤드만을 요구한다.
  • PCNN는 채널 프루닝 및 커널 수준의 프루닝과 상호 운용 가능하며, VGG-16에서 종합 압축 비율을 최대 34.4×까지 끌어올릴 수 있으며 정확도 손실은 거의 없어진다.
  • 아키텍처는 높은 병렬성과 효율성을 유지하여 88.9%의 희소성에서도 28.39 TOPS/W의 높은 하드웨어 효율을 달성하였다.
  • 패턴 SRAM는 칩 면적의 2.4%와 전력의 1.9%만을 차지하여, 인덱스 저장을 위한 하드웨어 프로파일이 매우 작다는 것을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.