Skip to main content
QUICK REVIEW

[논문 리뷰] An Image Enhancing Pattern-based Sparsity for Real-time Inference on Mobile Devices

Xiaolong Ma, Wei Niu|arXiv (Cornell University)|2020. 01. 20.
Advanced Neural Network Applications참고 문헌 42인용 수 6
한 줄 요약

이 논문은 패턴과 연결성 스퍼스리티를 결합한 새로운 스퍼스리티 차원인 패턴 기반 스퍼스리티를 소개한다. 이는 딥 네ural 네트워크에서 높은 모델 정확도와 하드웨어 효율성을 동시에 달성할 수 있도록 한다. 패턴 인식 프루닝 프레임워크를 설계하고 컴파일러 최적화 코드 생성을 활용하여, ResNet-18, ResNet-50, VGG-16와 같은 대규모 DNN에 대해 모바일 디바이스에서 실시간 추론을 구현한다. 이는 이전 방법들보다 정확도와 속도 면에서 뛰어나다.

ABSTRACT

Weight pruning has been widely acknowledged as a straightforward and effective method to eliminate redundancy in Deep Neural Networks (DNN), thereby achieving acceleration on various platforms. However, most of the pruning techniques are essentially trade-offs between model accuracy and regularity which lead to impaired inference accuracy and limited on-device acceleration performance. To solve the problem, we introduce a new sparsity dimension, namely pattern-based sparsity that comprises pattern and connectivity sparsity, and becoming both highly accurate and hardware friendly. With carefully designed patterns, the proposed pruning unprecedentedly and consistently achieves accuracy enhancement and better feature extraction ability on different DNN structures and datasets, and our pattern-aware pruning framework also achieves pattern library extraction, pattern selection, pattern and connectivity pruning and weight training simultaneously. Our approach on the new pattern-based sparsity naturally fits into compiler optimization for highly efficient DNN execution on mobile platforms. To the best of our knowledge, it is the first time that mobile devices achieve real-time inference for the large-scale DNN models thanks to the unique spatial property of pattern-based sparsity and the help of the code generation capability of compilers.

연구 동기 및 목표

  • 구조적 및 비구조적 가중치 프루닝에서 모델 정확도와 하드웨어 효율성 간의 상충 관계를 해결한다.
  • 기존 프루닝 방법의 한계를 극복한다. 즉, 정확도를 희생시키는 구조적 프루닝이나 하드웨어 가속을 지원하지 못하는 비구조적 프루닝을 방지한다.
  • 패턴 기반 스퍼스리티의 내재된 하드웨어 호환성을 통해 대규모 DNN에 대해 모바일 디바이스에서 실시간 추론을 가능하게 하는 새로운 스퍼스리티 차원을 도입한다.
  • 패턴 라이브러리 추출, 패턴 및 연결성 프루닝, 가중치 재학습을 동시에 수행하는 통합 프레임워크를 설계한다.

제안 방법

  • 내부 커널 패턴 스퍼스리티와 외부 커널 연결성 스퍼스리티를 결합한 새로운 스퍼스리티 차원인 패턴 기반 스퍼스리티를 제안한다.
  • 프루닝 문제를 ADMM 최적화 문제로 공식화하고, 확률적 경사 하강법과 정규화를 분리하기 위해 원시-근접 방법을 사용해 해결한다.
  • 특징 추출과 모델 정확도 향상을 위해 가중치의 공간적 구조를 활용하는 이미지 향상 커널 패턴 세트를 설계한다.
  • 지침 수준 및 스레드 수준의 병렬성을 유지하기 위해 필터/커널 재정렬을 구현하여 최대한의 하드웨어 가속을 확보한다.
  • TFLite, TVM, MNN를 사용하여 컴파일러 최적화된 추론 파이프라인에 패턴 기반 스퍼스 모델을 통합하고, 모든 최적화 기능을 활성화한다.
  • 패턴 기반 스퍼스리티의 규칙성을 활용해 코드 생성과 하드웨어 인식 컴파일을 통해 실시간 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1패턴 스퍼스리티와 연결성 스퍼스리티를 조합한 새로운 스퍼스리티 차원이 높은 모델 정확도와 하드웨어 효율성을 동시에 달성할 수 있는가?
  • RQ2철저히 설계된 커널 패턴이 특징 추출과 이미지 품질을 향상시켜 모델 성능을 향상시키는가?
  • RQ3패턴 기반 스퍼스리티는 모바일 플랫폼에서 효율적으로 컴파일되고 실행되어 실시간 추론을 가능하게 하는가?
  • RQ4제안된 프레임워크는 모바일 디바이스에서 정확도, 압축률, 추론 속도 측면에서 기존 프루닝 방법과 비교해 어떻게 성능을 냈는가?
  • RQ5패턴 인식 프루닝 프레임워크는 패턴 라이브러리 추출, 패턴 프루닝, 연결성 프루닝, 가중치 재학습을 동시에 수행할 수 있는가?

주요 결과

  • ResNet-18을 사용해 ImageNet에서 94.0%의 top-1 정확도를 달성했으며, 16× 압축과 8.0× 속도 향상을 기록해 모바일 CPU에서 실시간 추론을 가능하게 했다.
  • ResNet-50에서는 16× 압축에서도 94.2%의 top-1 정확도를 유지하며 5.8× 속도 향상을 기록해 모바일 디바이스에서 실시간 추론 요구사항을 충족했다.
  • VGG-16에서는 19.7× 압축과 12.0× 속도 향상을 기록해 더 깊은 모델에 대해서도 효과를 입증했다.
  • 패턴 기반 스퍼스리티 프레임워크는 모든 평가된 모델, 특히 대규모 DNN에 대해 모바일 CPU 및 GPU에서 실시간 추론(≤33ms/프레임)을 가능하게 했다.
  • 패턴 인식 프루닝 프레임워크는 패턴 라이브러리 추출, 패턴 및 연결성 프루닝의 공동 수행을 성공적으로 수행했으며, 기준 방법 대비 정확도를 유지하거나 향상시켰다.
  • 패턴 기반 모델의 컴파일러 최적화 실행은 비최적화 기준 대비 빠른 속도 향상을 기록했으며, 최대 16×까지 향상되어 하드웨어 우아한 설계를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.