[论文解读] 2-bit Model Compression of Deep Convolutional Neural Network on ASIC Engine for Image Retrieval
本文提出了一种针对ASIC芯片上VGG-16卷积神经网络的2位量化方案,实现了极低内存与功耗下的高效图像检索。通过结合跨层的混合位宽量化与一种新颖的区域嵌套不变性池化(RNIP)策略,该方法在仅使用224×224缓冲区的情况下,实现了640×480图像的浮点级性能表现,将模型大小从59MB压缩至4MB,同时保持86.94%的mAP。
Image retrieval utilizes image descriptors to retrieve the most similar images to a given query image. Convolutional neural network (CNN) is becoming the dominant approach to extract image descriptors for image retrieval. For low-power hardware implementation of image retrieval, the drawback of CNN-based feature descriptor is that it requires hundreds of megabytes of storage. To address this problem, this paper applies deep model quantization and compression to CNN in ASIC chip for image retrieval. It is demonstrated that the CNN-based features descriptor can be extracted using as few as 2-bit weights quantization to deliver a similar performance as floating-point model for image retrieval. In addition, to implement CNN in ASIC, especially for large scale images, the limited buffer size of chips should be considered. To retrieve large scale images, we propose an improved pooling strategy, region nested invariance pooling (RNIP), which uses cropped sub-images for CNN. Testing results on chip show that integrating RNIP with the proposed 2-bit CNN model compression approach is capable of retrieving large scale images.
研究动机与目标
- 在ASIC芯片上实现低功耗、低内存的基于CNN的图像检索硬件部署。
- 在不牺牲检索精度的前提下,降低CNN模型的存储与计算成本。
- 解决在处理大规模图像时片上缓冲区容量受限的挑战。
- 开发一种与2位量化模型兼容的池化策略,以实现高效的大规模图像检索。
提出的方法
- 采用混合位宽量化:偏置使用12位定点数,每卷积核使用8位标量,3×3卷积核的量化掩码使用1–5位。
- 使用逐层4位指数以保留权重的动态范围,从而实现有效的2位量化。
- 采用带有反向传播的微调算法,对量化后的定点模型进行优化,以最小化精度损失。
- 提出区域嵌套不变性池化(RNIP),即以多个裁剪的子图像作为CNN输入,并将特征图中的感兴趣区域(ROIs)进行拼接以实现池化。
- 将RNIP与2位量化CNN结合,实现在224×224缓冲区内处理大尺寸图像(如640×480)。
- 在NIP与RNIP中使用平方根、平均池化与最大池化的级联结构,生成512维描述符。
实验结果
研究问题
- RQ12位量化CNN是否能在ASIC上实现与全精度浮点模型相当的图像检索性能?
- RQ2在基于CNN的检索中,如何克服处理大规模图像时片上缓冲区容量受限的问题?
- RQ3像RNIP这样的新型池化策略是否能提升在硬件约束下大图像的特征提取效率与精度?
- RQ4在硬件优化的CNN中,模型压缩(位精度)与检索性能之间的权衡关系如何?
主要发现
- 2位量化VGG-16模型在INRIA Holidays数据集上对640×480图像实现了86.94%的mAP,与浮点模型的86.81% mAP相当。
- 模型大小从59MB(浮点)压缩至4MB(2位定点),压缩比达到15.1倍。
- 采用14个裁剪子图像的RNIP将mAP提升至0.852(512字节描述符),优于标准NIP方法。
- 二值化描述符(512位)相比512字节描述符仅出现0.03 mAP的下降,表明在1位精度下性能损失极小。
- 2位量化模型在ImageNet ILSVRC-2012数据集上保持70.13%的top-1准确率与89.91%的top-5准确率,证实其在分类任务中的鲁棒性。
- 通过使用RNIP,2位模型在224×224缓冲区中处理640×480图像的性能与全图输入完全一致,证明了其在大规模图像检索中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。