Skip to main content
QUICK REVIEW

[논문 리뷰] Complexity-Driven CNN Compression for Resource-constrained Edge AI

Muhammad Zawish, Steven Davy|arXiv (Cornell University)|2022. 08. 26.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 반복적 재학습이 필요 없는 복잡도 기반의 계산 효율적인 CNN 프루닝 프레임워크를 제안한다. 이는 엣지 장치에서 더 빠른 배포를 가능하게 하며, 파rameter, FLOPs 또는 메모리 복잡도 기반으로 레이어를 분류함으로써 기존의 프루닝 파이pline 대비 최대 60% 빠른 학습 속도를 달성하면서도 경쟁 가능한 정확도를 확보한다.

ABSTRACT

Recent advances in Artificial Intelligence (AI) on the Internet of Things (IoT)-enabled network edge has realized edge intelligence in several applications such as smart agriculture, smart hospitals, and smart factories by enabling low-latency and computational efficiency. However, deploying state-of-the-art Convolutional Neural Networks (CNNs) such as VGG-16 and ResNets on resource-constrained edge devices is practically infeasible due to their large number of parameters and floating-point operations (FLOPs). Thus, the concept of network pruning as a type of model compression is gaining attention for accelerating CNNs on low-power devices. State-of-the-art pruning approaches, either structured or unstructured do not consider the different underlying nature of complexities being exhibited by convolutional layers and follow a training-pruning-retraining pipeline, which results in additional computational overhead. In this work, we propose a novel and computationally efficient pruning pipeline by exploiting the inherent layer-level complexities of CNNs. Unlike typical methods, our proposed complexity-driven algorithm selects a particular layer for filter-pruning based on its contribution to overall network complexity. We follow a procedure that directly trains the pruned model and avoids the computationally complex ranking and fine-tuning steps. Moreover, we define three modes of pruning, namely parameter-aware (PA), FLOPs-aware (FA), and memory-aware (MA), to introduce versatile compression of CNNs. Our results show the competitive performance of our approach in terms of accuracy and acceleration. Lastly, we present a trade-off between different resources and accuracy which can be helpful for developers in making the right decisions in resource-constrained IoT environments.

연구 동기 및 목표

  • CNN 압축에서 기존의 학습-프루닝-재조정 파이pline이 유발하는 높은 계산 오버헤드 문제를 해결한다.
  • 기존의 프루닝 방법이 개별 레이어의 복잡도 기여도(예: 파라미터, FLOPs, 메모리)를 고려하지 않는 한계를 극복한다.
  • 중요도 평가나 반복적 정밀 조정 단계 없이도 프루닝된 모델을 직접 효율적으로 학습시켜 불필요한 단계를 제거한다.
  • 개발자들이 엣지 장치에서 정확도와 자원 사용량을 균형 있게 조절할 수 있도록 파라미터 인식, FLOPs 인식, 메모리 인식의 유연한 압축 모드를 제공한다.
  • 자원이 풍부한 장치와 자원이 제한된 엣지 플랫폼 양쪽에서 학습 효율성과 모델 성능을 입증한다.

제안 방법

  • 전체 모델 복잡도(파라미터, FLOPs, 메모리)에 기여하는 레이어 수준의 기여도를 기반으로 필터를 식별하고 프루닝하는 복잡도 기반 프루닝 파이pline을 제안한다.
  • 파라미터 인식(PA), FLOPs 인식(FA), 메모리 인식(MA)의 세 가지 별도의 프루닝 모드를 도입하며, 각각 특정 자원 제약을 목표로 한다.
  • 필터 순위 매기기 및 재조정 단계를 생략하고, 무작위 초기화 상태에서 직접 프루닝된 모델을 학습시음으로써 계산 오버헤드를 감소시킨다.
  • 중요도 점수나 반복적 정밀 조정이 필요 없도록, 복잡도 기반 레이어 선택 후에 랜덤 필터 프루닝을 적용한다.
  • 최대 50회 반복하여 프루닝 과정을 수행하며, 선택된 모드에 따라 목표 희박성 비율을 조정한다.
  • CIFAR-10 및 CIFAR-100 데이터셋에서 표준 학습 프rotocol를 사용하여 GPU 및 엣지 장치(예: NVIDIA Jetson Nano)에서 최종 프루닝된 모델을 종단 간(end-to-end)으로 학습시킨다.

실험 결과

연구 질문

  • RQ1필터 순위 매기기 및 재조정 단계를 생략하는 프루닝 파이pline이 학습 시간을 크게 단축하면서도 경쟁 가능한 정확도를 달성할 수 있는가?
  • RQ2표준 CNN인 VGG-16과 AlexNet에서 다양한 모델 복잡도(파라미터, FLOPs, 메모리)가 레이어 간 어떻게 달라지는가?
  • RQ3복잡도 인식 프루닝 모드(PA, FA, MA)가 엣지 장치에서 정확도와 자원 사용량 간의 트레이드오프를 얼마나 효과적으로 가능하게 하는가?
  • RQ4고성능 하드웨어와 엣지 하드웨어 양쪽에서 제안된 직접 학습 방식이 기존의 반복적 프루닝 방법에 비해 학습 효율성이 어떻게 뛰어나게 되는가?
  • RQ5제안된 방법이 자원이 제한된 장치에서 피드럴러닝 또는 점진적 재조정과 같은 실질적인 구현 시나리오를 지원할 수 있는가?

주요 결과

  • 자원이 풍부한 GPU에서 제안된 방법은 PA 모드에서 50.2% 감소, FA 모드에서 59.96% 감소, MA 모드에서 51.4% 감소한 학습 시간을 기록하여 기존의 PLS 프루닝 파이pline 대비 빠른 학습을 달성했다.
  • 자원이 제한된 NVIDIA Jetson Nano에서 FLOPs 인식(FA) 모드가 가장 높은 학습 시간 감소를 기록하여 엣지 배포에 효과적임을 입증했다.
  • 직접 학습된 프루닝된 모델은 재조정이 필요 없이 경쟁 가능한 정확도를 확보했으며, 학습 비용을 극적으로 줄였음에도 불구하고 최신 기술 대비 정확도에서 뛰어나거나 동등한 성능을 보였다.
  • 세 가지 프루닝 모드(PA, FA, MA)는 개발자들이 특정 자원 제약(예: FLOPs, 메모리, 파라미터)과 정확도 간에 정보 기반의 트레이드오프를 가능하게 했다.
  • 낮은 학습 오버헤드 덕분에 이 방법은 점진적 학습 및 피드럴러닝과 같은 실질적인 사용 사례를 엣지 장치에서 지원할 수 있었다.
  • 최대 50회 반복 프루닝 후에도 정확도 저하가 최소한으로 유지되어 높은 성능을 유지함으로써 이 방법의 강건성과 확장성은 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.