[논문 리뷰] Towards Learning of Filter-Level Heterogeneous Compression of Convolutional Neural Networks
이 논문은 복합 신경망의 필터 수준 이질적 압축을 위한 미분 가능 신경망 아키텍처 탐색(NAS) 프레임워크를 제안한다. 이는 층 간에 양자화 비트폭과 필터 프루닝을 동시에 최적화한다. 각 필터 압축 작업을 학습 가능한 확률로 모델링함으로써, 계산 복잡도 제약 조건 하에서 엔드 투 엔드 학습이 가능해지며, BOPs(Bit Operations) 예산 내에서 정확도 향상을 달성한다. 다만, 이질적 양자화로 인한 변동성으로 인해 실용적 성과는 제한된다.
Recently, deep learning has become a de facto standard in machine learning with convolutional neural networks (CNNs) demonstrating spectacular success on a wide variety of tasks. However, CNNs are typically very demanding computationally at inference time. One of the ways to alleviate this burden on certain hardware platforms is quantization relying on the use of low-precision arithmetic representation for the weights and the activations. Another popular method is the pruning of the number of filters in each layer. While mainstream deep learning methods train the neural networks weights while keeping the network architecture fixed, the emerging neural architecture search (NAS) techniques make the latter also amenable to training. In this paper, we formulate optimal arithmetic bit length allocation and neural network pruning as a NAS problem, searching for the configurations satisfying a computational complexity budget while maximizing the accuracy. We use a differentiable search method based on the continuous relaxation of the search space proposed by Liu et al. (arXiv:1806.09055). We show, by grid search, that heterogeneous quantized networks suffer from a high variance which renders the benefit of the search questionable. For pruning, improvement over homogeneous cases is possible, but it is still challenging to find those configurations with the proposed method. The code is publicly available at https://github.com/yochaiz/Slimmable and https://github.com/yochaiz/darts-UNIQ
연구 동기 및 목표
- 저전력 시스템에서 깊은 CNN의 높은 계산 비용을 해결하기 위해.
- 더 나은 효율성을 위해 양자화와 프루닝을 조합한 필터 수준의 이질적 압축을 탐색하기 위해.
- 비트폭과 필터 수 최적화를 함께 고려한 미분 가능 NAS 문제로 공식화하기 위해.
- 이질적 구성이 동종 기반선과 비교해 얼마나 효과적인지 평가하기 위해.
제안 방법
- 연속적 리프레젠테이션을 사용해 필터 수준의 압축 작업(양자화 및 프루닝)을 학습 가능한 확률로 모델링한다.
- Liu 등(2019a)의 기반 미분 탐색 방법을 활용하며, 운영 확률을 α로 매개변수화하고 Gumbel-Softmax 기법을 통해 소프트-아르그맥스를 적용한다.
- 네트워크 구성은 필터에 층별로 운영을 할당한 가상의 행렬 a로 정의한다.
- 구성에 대한 기대 손실 J(α; ω)의 α에 대한 기울기를 재패arameterization 기법과 구성의 기대값을 활용해 유도한다.
- 계산 복잡도 지표로 BOPs(Bit Operations)를 사용하며, 가중치, 활성화, 누적기록기의 비트폭을 고려한다.
- 필터 수준의 비트폭과 활성화/가중치 정밀도의 영향을 MAC 연산에 반영하는 층별 BOPs 계산을 도입한다.
실험 결과
연구 질문
- RQ1미분 가능 NAS는 CNN의 이질적 필터 수준 압축 구성 학습에 효과적으로 작용할 수 있는가?
- RQ2각 필터당 비트폭이 다른 이질적 양자화는 동종 양자화와 비교해 정확도와 변동성 측면에서 어떻게 다른가?
- RQ3양자화와 프루닝을 함께 최적화하면 동종 압축보다 BOPs 예산 내에서 더 높은 정확도를 달성할 수 있는가?
- RQ4필터 수준의 비트폭 할당은 계산 복잡도와 모델 성능에 어떤 영향을 미치는가?
주요 결과
- 이질적 양자화는 성능의 높은 변동성을 유도하여 탐색 과정이 신뢰할 수 없고 최적화의 이점을 감소시킨다.
- 프루닝의 경우 동종 구성보다 개선을 달성하지만, 최적 구성으로의 수렴은 여전히 도전 과제이다.
- 특정 정밀도 데이터 유형을 사용할 경우 BOPs 지표는 계산 복잡도를 정확하게 반영한다. 특히 FPGA나 ASIC에서 유의미하다.
- 제안된 미분 가능 NAS 프레임워크는 기울기 기반의 필터 수준 압축 작업 탐색을 통해 엔드 투 엔드 학습을 가능하게 한다.
- 비트폭과 필터 수의 공동 최적화가 실현 가능하지만, 이질적 양자화 설정에서의 높은 변동성으로 인해 실용적 성과는 제한된다.
- 코드는 재현 가능성을 위해 https://github.com/yochaiz/Slimmable 및 https://github.com/yachaiz/darts-UNIQ 에 공개되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.