[論文レビュー] Efficient CNN-LSTM based Image Captioning using Neural Network Compression
本稿では、マグニチュードベースのプルーニングと量子化を用いたエンドツーエンドの圧縮パイプラインを提案し、Flickr8kデータセット上でVGG16とLSTMを用い、量子化感知学習を適用することで、モデルサイズを73.1%削減し、推論速度を71.3%向上させるとともに、元の非圧縮ベースライン比でBLEUスコアを7.7%向上させた。
Modern Neural Networks are eminent in achieving state of the art performance on tasks under Computer Vision, Natural Language Processing and related verticals. However, they are notorious for their voracious memory and compute appetite which further obstructs their deployment on resource limited edge devices. In order to achieve edge deployment, researchers have developed pruning and quantization algorithms to compress such networks without compromising their efficacy. Such compression algorithms are broadly experimented on standalone CNN and RNN architectures while in this work, we present an unconventional end to end compression pipeline of a CNN-LSTM based Image Captioning model. The model is trained using VGG16 or ResNet50 as an encoder and an LSTM decoder on the flickr8k dataset. We then examine the effects of different compression architectures on the model and design a compression architecture that achieves a 73.1% reduction in model size, 71.3% reduction in inference time and a 7.7% increase in BLEU score as compared to its uncompressed counterpart.
研究の動機と目的
- モバイルやウェアラブルデバイスなどのリソース制約のあるエッジデバイスでのリアルタイムな画像キャプションモデルのデプロイを可能にすること。
- 通常は巨大で計算コストの高いエンドツーエンドのCNN-LSTMアーキテクチャにおいて、プルーニングと量子化を組み合わせた影響を調査すること。
- エンコーダー(VGG16/ResNet50)とデコーダー(LSTM)の両方のコンponentsに対して、性能を維持または向上させる圧縮戦略を最適化すること。
- 圧縮モデルが、BLEUスコア、モデルサイズ、推論速度の面で、フル精度の対応モデルを上回る可能性があるかどうかを評価すること。
提案手法
- 重要度の低い重みを削除するために、CNNエンコーダー(VGG16またはResNet50)およびLSTMデコーダーの両方にマグニチュードベースのプルーニングを適用した。
- エンコーダーにはトレーニング後の量子化を、デコーダーには量子化感知学習を適用し、32ビット浮動小数点から低ビット幅に精度を低下させた。
- エンコーダーとデコーダーのコンponentsにわたるプルーニングと量子化の組み合わせを検討した8種類の異なる圧縮アーキテクチャを設計および評価した。
- Flickr8kデータセット上で、1枚の画像に対して5つのキャプションを用いてモデルをトレーニングおよびファインチューニングし、主評価指標としてBLEUスコアを用いた。
- 最適なパフォーマンスを得るために、デコーダーには量子化感知学習、エンコーダーにはトレーニング後の量子化を適用するハイブリッド圧縮戦略を採用した。
- 圧縮モデルとベースラインモデルを比較するため、モデルサイズ(MB単位)、2000サンプルあたりの推論時間、BLEU-1スコアを測定した。
実験結果
リサーチクエスチョン
- RQ1プルーニングと量子化を用いたエンドツーエンドの圧縮によって、Flickr8kデータセット上での画像キャプションモデルの性能が維持または向上するか。
- RQ2プルーニングと量子化の組み合わせが、統合エンコーダ-デコーダアーキテクチャにおけるモデルサイズ、推論速度、BLEUスコアにどのように影響するか。
- RQ3LSTMデコーダーに対して量子化感知学習を適用すると、トレーニング後の量子化やプルーニング単体よりも優れた結果が得られるか。
- RQ4効率性と精度の両面で、フル精度ベースラインを上回る圧縮設定が存在するか。
主な発見
- 量子化されたVGG16エンコーダーと量子化されたLSTMデコーダーを備えたQVGG-QLSTMモデルは、ベースライン比でBLEUスコアを7.7%向上させた。
- このモデルは、エンコーダーにVGG16を使用した場合、モデルサイズを73.1%削減(578.4 MB から 155.39 MB)した。
- QVGG-QLSTM構成では、2000サンプルあたりの推論時間が71.3%短縮され(5.68分から1.63分に)、性能が向上した。
- 量子化感知学習を適用した量子化デコーダーは、ベースラインおよびプルーニング変種を上回り、量子化そのものが性能向上に寄与することが示された。
- エンコーダーまたはデコーダーを単独でプルーニングすると、性能の著しい低下が生じ、一部の設定ではBLEUスコアが最大20.6%低下した。
- 最もパフォーマンスの優れたモデル、QVGG-QLSTMは、実際の画像を用いた定性的な比較でも、ベースラインよりも正確で文脈的に適切なキャプションを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。