Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Hardware Realization of Convolutional Neural Networks using Intra-Kernel Regular Pruning

Maurice Yang, Mahmoud Faraj|arXiv (Cornell University)|2018. 03. 15.
Advanced Neural Network Applications참고 문헌 21인용 수 5
한 줄 요약

이 논문은 효율적인 하드웨어 가속을 위해 정규 컨볼루션 커널 구조를 유지하면서 컨볼루션 커널 내부의 중복 가중치를 제거하는 미세한 수준의 프루닝 기법인 Intra-Kernel Regular (IKR) 프루닝을 제안한다. 이 방법은 최대 10배의 파라미터 감소와 7배의 계산량 감소를 달성하면서 정확도 저하가 1% 미만이며, 자원 제약이 있는 하드웨어에서 컴팩트하고 고효율적인 CNN 추론을 가능하게 한다.

ABSTRACT

The recent trend toward increasingly deep convolutional neural networks (CNNs) leads to a higher demand of computational power and memory storage. Consequently, the deployment of CNNs in hardware has become more challenging. In this paper, we propose an Intra-Kernel Regular (IKR) pruning scheme to reduce the size and computational complexity of the CNNs by removing redundant weights at a fine-grained level. Unlike other pruning methods such as Fine-Grained pruning, IKR pruning maintains regular kernel structures that are exploitable in a hardware accelerator. Experimental results demonstrate up to 10x parameter reduction and 7x computational reduction at a cost of less than 1% degradation in accuracy versus the un-pruned case.

연구 동기 및 목표

  • 자원 제약이 있는 환경에서 깊이 신경망(CNN)의 증가하는 계산 및 메모리 요구량을 해결하기 위해.
  • 미세한 수준의 프루닝이 불규칙한 희소성 구조를 만들어내어 효율적인 하드웨어 구현을 어렵게 하는 한계를 극복하기 위해.
  • 고도로 희소화된 구조를 유지하면서도 정규 커널 패턴을 유지하는 구조적 프루닝 방법을 개발하여 효율적인 하드웨어 매핑을 가능하게 하기 위해.
  • 미세한 수준의 프루닝의 이점을 유지하면서도 하드웨어 友好的한 커널 구조를 갖춘 방법을 통해 컴팩트하고 저전력의 CNN 추론을 실현하기 위해.
  • IKR 프루닝된 네트워크를 위한 특화된 스파ARSE 프로세싱 엔진(SPE) 아키텍처를 제안하여 실용적인 하드웨어 타당성을 입증하기 위해.

제안 방법

  • 각 컨볼루션 커널 내부에서 개별 가중치 수준에서 인tra-커널 프루닝을 적용하여 중복 파라미터를 제거한다.
  • 커널 간에 규칙적인 프루닝 패턴을 적용하여 구조적 규칙성을 유지함으로써 효율적인 하드웨어 매핑을 가능하게 한다.
  • 비어 있지 않은 가중치와 마스크 인덱스만 저장하는 압축된 희소 패턴(CSP) 형식을 사용하여 메모리 사용량을 최소화한다.
  • 최적의 프루닝 패턴을 식별하기 위해 패턴 생성 및 선택 메커니즘을 도입하여 모델 정확도를 유지한다.
  • 프루닝 후 정확도 복구를 위해 스케줄된 학습률을 사용한 미세조정(fine-tuning)을 통해 프루닝된 네트워크를 재학습한다.
  • IKR 프루닝된 커널의 규칙적인 희소성 특성을 최대한 활용할 수 있도록 설계된 스파ARSE 프로세싱 엔진(SPE) 하드웨어 아키텍처를 제안한다.

실험 결과

연구 질문

  • RQ1정규 커널 구조를 유지함으로써 미세한 수준의 프루닝을 효율적인 하드웨어 가속과 호환 가능하게 만들 수 있는가?
  • RQ2인tra-커널 정규 프루닝을 통해 CNN의 파라미터와 계산 복잡도를 얼마나 줄일 수 있으며, 정확도 저하 없이도 성능을 유지할 수 있는가?
  • RQ3기존의 프루닝 방법들인 미세한 수준의 프루닝과 커널 수준의 프루닝과 비교했을 때 IKR 프루닝은 희소성, 정확도, 하드웨어 효율성 측면에서 어떻게 다른가?
  • RQ4구조적 CNN 프루닝에서 희소성, 정확도, 하드웨어 구현 가능성 사이의 최적의 균형은 무엇인가?
  • RQ5특화된 하드웨어 가속기(SPE)는 IKR 프루닝이 생성한 규칙적인 희소성 패턴을 효과적으로 활용하여 고성능·저에너지 추론을 실현할 수 있는가?

주요 결과

  • IKR 프루닝은 LeNet-5에서 최대 10배의 네트워크 파라미터 감소와 7배의 계산 연산 감소를 달성했으며, 프루닝되지 않은 기준 모델 대비 오차율 증가가 0.5% 이하에 그쳤다.
  • CIFAR-10 데이터셋을 사용한 $CNN_{small}$ 모델에서 IKR 프루닝은 모델 크기를 4배 감소시키고 계산량을 6배 줄였으며, 동일한 1% 정확도 저하 수준에서 FMK 프루닝보다 약간 더 높은 무게 희소성(스파arsity)을 달성했다.
  • 강력한 압축에도 불구하고 IKR 프루닝된 네트워크는 정확도가 프루닝되지 않은 모델과 1% 이내로 유지되어 핵심 가중치의 효과적인 보존을 입증했다.
  • 제안된 압축된 희소 패턴(CSP) 형식은 비어 있지 않은 가중치와 마스크 인덱스만 저장하여 IKR 프루닝된 커널의 컴팩트한 저장을 가능하게 했다.
  • 스파ARSE 프로세싱 엔진(SPE) 아키텍처는 IKR 프루닝된 커널의 규칙적인 희소성 특성을 효율적으로 활용하여 고스루풋·저에너지 추론을 실현했다.
  • IKR 프루닝은 정확도를 유지하면서도 하드웨어 친화적인 구조를 확보함으로써 굵은 수준의 프루닝 방법보다 뛰어난 성능을 보였으며, 희소성과 효율성 사이의 균형을 더 잘 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.