Skip to main content
QUICK REVIEW

[论文解读] Efficient CNN-LSTM based Image Captioning using Neural Network Compression

Harshit Rampal, Aman Mohanty|arXiv (Cornell University)|Dec 17, 2020
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出了一种针对CNN-LSTM图像字幕模型的端到端压缩流水线,采用基于大小的剪枝与量化技术,在Flickr8k数据集上使用VGG16和LSTM配合量化感知训练,实现了模型大小减少73.1%、推理速度提升71.3%,并相较未压缩基线模型BLEU分数提高7.7%。

ABSTRACT

Modern Neural Networks are eminent in achieving state of the art performance on tasks under Computer Vision, Natural Language Processing and related verticals. However, they are notorious for their voracious memory and compute appetite which further obstructs their deployment on resource limited edge devices. In order to achieve edge deployment, researchers have developed pruning and quantization algorithms to compress such networks without compromising their efficacy. Such compression algorithms are broadly experimented on standalone CNN and RNN architectures while in this work, we present an unconventional end to end compression pipeline of a CNN-LSTM based Image Captioning model. The model is trained using VGG16 or ResNet50 as an encoder and an LSTM decoder on the flickr8k dataset. We then examine the effects of different compression architectures on the model and design a compression architecture that achieves a 73.1% reduction in model size, 71.3% reduction in inference time and a 7.7% increase in BLEU score as compared to its uncompressed counterpart.

研究动机与目标

  • 实现在移动设备和可穿戴系统等资源受限边缘设备上实时部署图像字幕模型。
  • 研究剪枝与量化结合对端到端CNN-LSTM架构的影响,此类架构通常体积庞大且计算开销高。
  • 优化编码器(VGG16/ResNet50)与解码器(LSTM)组件的压缩策略,以保持或提升性能。
  • 评估压缩模型是否能在BLEU分数、模型大小与推理速度方面超越全精度基线模型。

提出的方法

  • 对CNN编码器(VGG16或ResNet50)和LSTM解码器均应用基于大小的剪枝,以移除重要性较低的权重。
  • 在编码器上实施训练后量化,在解码器上采用量化感知训练,将精度从32位浮点降低至更低的位宽。
  • 设计并评估了八种不同的压缩架构,结合编码器与解码器组件的剪枝与量化策略。
  • 在Flickr8k数据集上进行训练与微调,每张图像配有5个字幕,以BLEU分数为主要评估指标。
  • 采用混合压缩策略,对解码器应用量化感知训练,对编码器应用训练后量化,以实现最佳性能。
  • 通过测量模型大小(MB)、每2000个样本的推理时间以及BLEU-1分数,对比压缩模型与基线模型的表现。

实验结果

研究问题

  • RQ1能否通过剪枝与量化技术对端到端的CNN-LSTM图像字幕模型进行压缩,同时在Flickr8k数据集上保持或提升性能?
  • RQ2在联合编码器-解码器架构中,剪枝与量化结合对模型大小、推理速度与BLEU分数有何影响?
  • RQ3在LSTM解码器上使用量化感知训练是否优于训练后量化或仅剪枝?
  • RQ4是否存在一种压缩配置,能在效率与准确性两方面均优于全精度基线模型?

主要发现

  • QVGG-QLSTM模型(使用量化VGG16编码器与量化LSTM解码器)相较基线模型BLEU分数提升了7.7%。
  • 当使用VGG16作为编码器时,该模型将模型大小减少了73.1%(从578.4 MB降至155.39 MB)。
  • 在QVGG-QLSTM配置下,推理时间减少了71.3%(从每2000个样本5.68分钟降至1.63分钟)。
  • 采用量化感知训练的量化解码器优于基线模型与剪枝变体,表明仅通过量化即可提升性能。
  • 单独对编码器或解码器进行剪枝会导致性能显著下降,某些配置下BLEU分数最高下降达20.6%。
  • 表现最佳的模型QVGG-QLSTM在真实图像上的定性比较中,生成了更准确且语义相关的字幕,优于基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。