[논문 리뷰] 2-bit Model Compression of Deep Convolutional Neural Network on ASIC Engine for Image Retrieval
이 논문은 ASIC 엔진에서 VGG-16 CNN에 대해 2비트 양자화 기법을 제안하여 메모리와 전력 소비를 최소화하면서 효율적인 이미지 검색을 가능하게 한다. 계층 간 혼합 비트 양자화와 새로운 영역 내장 불변 풀링(RNIP) 전략을 조합함으로써, 224x224 버퍼 내에서 640x480 이미지에 대해 부동소수점 수준의 성능을 달성하며 모델 크기를 59MB에서 4MB로 줄였다. 이로써 mAP는 86.94%를 유지한다.
Image retrieval utilizes image descriptors to retrieve the most similar images to a given query image. Convolutional neural network (CNN) is becoming the dominant approach to extract image descriptors for image retrieval. For low-power hardware implementation of image retrieval, the drawback of CNN-based feature descriptor is that it requires hundreds of megabytes of storage. To address this problem, this paper applies deep model quantization and compression to CNN in ASIC chip for image retrieval. It is demonstrated that the CNN-based features descriptor can be extracted using as few as 2-bit weights quantization to deliver a similar performance as floating-point model for image retrieval. In addition, to implement CNN in ASIC, especially for large scale images, the limited buffer size of chips should be considered. To retrieve large scale images, we propose an improved pooling strategy, region nested invariance pooling (RNIP), which uses cropped sub-images for CNN. Testing results on chip show that integrating RNIP with the proposed 2-bit CNN model compression approach is capable of retrieving large scale images.
연구 동기 및 목표
- ASIC 칩에서 CNN 기반 이미지 검색을 위한 저전력, 저메모리 하드웨어 구현을 가능하게 하기 위해.
- 검색 정확도를 훼손하지 않으면서 CNN 모델의 저장 및 계산 비용을 감소시키기 위해.
- 대규모 이미지를 처리할 때 제한된 片상 버퍼 크기 문제를 해결하기 위해.
- 효율적인 대규모 이미지 검색을 위해 2비트 양자화 모델과 호환되는 풀링 전략을 개발하기 위해.
제안 방법
- 하나의 필터당 스칼라 8비트, 3x3 컨볼루션 필터에 대해 1~5비트 양자화 마스크를 사용하며, 편향에는 12비트 고정소수점 양자화를 적용하는 혼합 비트 양자화 기법을 적용한다.
- 가중치의 동적 범위를 유지하기 위해 계층별로 4비트 지수를 사용하여 효과적인 2비트 양자화를 가능하게 한다.
- 정확도 손실 최소화를 위해 백프로파게이션을 사용하는 재학습 알고리즘을 도입하여 양자화된 고정소수점 모델을 정밀하게 보정한다.
- 영역 내장 불변 풀링(RNIP)을 제안하며, 이는 CNN에 여러 개의 자르기된 부분 영상(서브이미지)을 입력으로 사용하고, 특징 맵에서 얻은 ROI를 연결하여 풀링을 수행한다.
- 2비트 양자화된 CNN와 RNIP를 통합하여 224x224 버퍼 내에서 640x480 이미지 처리가 가능하게 하였다.
- NIP 및 RNIP에서 제곱근, 평균, 최대 풀링의 체인을 사용하여 512차원 기술자(descriptor)를 생성한다.
실험 결과
연구 질문
- RQ1ASIC에서 2비트 양자화된 CNN이 부동소수점 모델과 유사한 이미지 검색 성능을 달성할 수 있는가?
- RQ2CNN 기반 검색에서 대규모 이미지를 처리할 때 제한된 片상 버퍼 크기를 어떻게 극복할 수 있는가?
- RQ3RNIP와 같은 새로운 풀링 전략이 하드웨어 제약 조건 하에서 대규모 이미지의 특징 추출 효율성과 정확도를 향상시킬 수 있는가?
- RQ4하드웨어 최적화된 CNN에서 모델 압축(비트 정밀도)과 검색 성능 간의 상호 상충 관계는 어떠한가?
주요 결과
- 2비트 양자화된 VGG-16 모델은 INRIA Holidays 데이터셋에서 640x480 이미지에 대해 86.94% mAP 성능을 기록하였으며, 이는 부동소수점 모델의 86.81% mAP와 유사한 성능을 보였다.
- 모델 크기는 부동소수점 기준 59MB에서 2비트 고정소수점 기준 4MB로 줄어들었으며, 이는 15.1배의 압축 비율을 달성하였다.
- 14개의 자르기된 서브이미지를 사용하는 RNIP는 512바이트 기술자에 대해 mAP를 0.852로 향상시켜 표준 NIP보다 뛰어난 성능을 보였다.
- 이진화된 기술자(512비트)는 512바이트 기술자 대비 0.03 mAP의 성능 저하를 보였으며, 이는 1비트 정밀도에서의 작은 성능 희생을 의미한다.
- 2비트 양자화 모델은 ImageNet ILSVRC-2012에서 상위 1위 정확도 70.13%, 상위 5위 정확도 89.91%를 기록하여 분류 작업에 대한 강건성을 입증하였다.
- RNIP를 사용함으로써 2비트 모델은 224x224 버퍼 내에서 640x480 이미지를 처리할 때 전체 640x480 입력과 동일한 성능을 달성하였으며, 이는 대규모 이미지 검색의 실현 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.