Skip to main content
QUICK REVIEW

[논문 리뷰] Partition Pruning: Parallelization-Aware Pruning for Deep Neural Networks

Sina Shahhosseini, Ahmad Albaqsami|arXiv (Cornell University)|2019. 01. 21.
Advanced Neural Network Applications참고 문헌 23인용 수 6
한 줄 요약

이 논문은 깊이 신경망의 완전 연결 계층에서 모델 크기를 줄이고 추론 속도를 높이기 위해 병렬 처리를 고려한 프루닝 방법인 Partition Pruning을 제안한다. 프루닝된 가중치 행렬을 여러 가속기 간에 분할함으로써, 단일 가속기에서의 프루닝되지 않은 추론 대비 TinyVGG16에서 7.72×의 속도 향상과 2.73×의 에너지 절감을 달성하였으며, 재학습 후 정확도 손실는 최소한이었다.

ABSTRACT

Parameters of recent neural networks require a huge amount of memory. These parameters are used by neural networks to perform machine learning tasks when processing inputs. To speed up inference, we develop Partition Pruning, an innovative scheme to reduce the parameters used while taking into consideration parallelization. We evaluated the performance and energy consumption of parallel inference of partitioned models, which showed a 7.72x speed up of performance and a 2.73x reduction in the energy used for computing pruned layers of TinyVGG16 in comparison to running the unpruned model on a single accelerator. In addition, our method showed a limited reduction some numbers in accuracy while partitioning fully connected layers.

연구 동기 및 목표

  • 엣지 장치에서 점점 커지는 대규모 딥 뉴럴 네트워크(DNN)의 메모리 및 에너지 수요를 해결한다.
  • 스pars티를 활용한 지능적인 프루닝을 통해 오프칩 메모리 액세스와 에너지 소비를 줄인다.
  • 다중 가속기 간의 프루닝과 분할을 공동 설계하여 효율적인 병렬 추론을 가능하게 한다.
  • 재학습과 제약 기반 분할을 통해 극도로 프루닝된 상태에서도 높은 모델 정확도를 유지한다.
  • 하드웨어 인식 병렬 처리를 최적화하여 다핵 가속기 시스템에서 성능과 에너지 효율성을 향상시킨다.

제안 방법

  • 병렬 처리, 오프칩 액세스 감소, 정확도 유지 간의 균형을 고려한 제약 최적화 문제로 프루닝을 수식화한다.
  • 가중치의 크기를 기반으로 50–80%의 완전 연결 계층 가중치를 제거하여 덜 중요한 연결을 선택한다.
  • 프루닝된 가중치 행렬을 부분 행렬으로 분할하고 병렬 추론을 위해 여러 가속기 간에 분산한다.
  • 부하 균형과 가속기 간 통신 오버헤드 최소화를 위해 제약 조건을 적용한다.
  • 프루닝 후에만 비프루닝된 가중치만 재학습하여 정확도를 복구하며, TensorFlow와 NumPy를 사용해 구현한다.
  • 다중 가속기 구성에서 성능과 에너지를 평가하기 위해 gem5-Aladdin 사이클 정밀 시뮬레이터를 사용한다.

실험 결과

연구 질문

  • RQ1완전 연결 계층의 프루닝과 분할을 병행함으로써 DNN의 추론 속도와 에너지 효율성을 향상시킬 수 있는가?
  • RQ2프루닝된 병렬 DNN 추론에서 파artition 수가 정확도 손실과 성능 향상에 어떤 영향을 미치는가?
  • RQ3프루닝이 오프칩 메모리 액세스를 얼마나 줄여주며, 이로 인해 DNN 가속기의 에너지 효율성이 얼마나 향상되는가?
  • RQ4다양한 프루닝 비율과 분할 방식에서 모델 압축과 정확도 저하 간의 상호 관계는 어떻게 나타나는가?
  • RQ5하드웨어 제약 조건(예: 버스 혼잡)이 다중 가속기 환경에서 분할 아키텍처의 성능 확장성에 어떤 영향을 미치는가?

주요 결과

  • Partition Pruning는 단일 코어에서의 프루닝되지 않은 모델 대비 삼코어 가속기에서 실행된 TinyVGG16의 추론 성능에서 7.72×의 속도 향상을 달성했다.
  • 다중 가속기 환경에서 프루닝된 레이어에 대해 에너지 소비가 2.73× 감소하였다.
  • 재학습 후, TinyVGG16의 정확도 손실은 3개 파artition, 재학습 없음일 경우 10.59%에서 3개 파artition, 재학습 있음일 경우 0.87%로 감소하였다.
  • 프루닝은 파artition 수에 비례하여 모델 크기를 줄였으며(예: 2개 파artition 시 2배), 가속기 간 효율적인 분포를 가능하게 하였다.
  • 단일 DMA로 인한 버스 혼잡으로 인해 성능 스케일링이 제한되었으며, 두 가속기에서는 1.8×, 세 가속기에서는 2.5×의 속도 향상에 그쳤다. 이는 이론적 잠재력에 비해 낮은 성능이었다.
  • 이 방법은 매개변수 수와 오프칩 메모리 트래픽을 크게 줄였음에도 불구하고 높은 정확도를 유지하였으며, 효과적인 하드웨어 인식 모델 압축을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.