Skip to main content
QUICK REVIEW

[論文レビュー] Learning Filter Basis for Convolutional Neural Network Compression

Yawei Li, Shuhang Gu|arXiv (Cornell University)|Aug 23, 2019
Advanced Image Processing Techniques参考文献 54被引用数 7
ひとこと要約

この論文は、3次元畳み込みフィルタを入力チャネル次元に沿って学習可能な基本要素に分解することで、パラメータ削減を実現しながら精度を維持する、畳み込みニューラルネットワーク(CNN)圧縮のための新しいフィルタベース学習法を提案する。この手法は、画像分類および超解像ベンチマークにおいて最先端の圧縮パフォーマンスを達成し、従来のフィルタ分解手法に比べてパラメータ効率性と精度保持性に優れている。

ABSTRACT

Convolutional neural networks (CNNs) based solutions have achieved state-of-the-art performances for many computer vision tasks, including classification and super-resolution of images. Usually the success of these methods comes with a cost of millions of parameters due to stacking deep convolutional layers. Moreover, quite a large number of filters are also used for a single convolutional layer, which exaggerates the parameter burden of current methods. Thus, in this paper, we try to reduce the number of parameters of CNNs by learning a basis of the filters in convolutional layers. For the forward pass, the learned basis is used to approximate the original filters and then used as parameters for the convolutional layers. We validate our proposed solution for multiple CNN architectures on image classification and image super-resolution benchmarks and compare favorably to the existing state-of-the-art in terms of reduction of parameters and preservation of accuracy.

研究の動機と目的

  • 深層CNNにおける高いパラメータ数、特に出力チャネル数が少ない狭いネットワークの問題に対処すること。
  • 従来のフィルタ分解手法が入力チャネルパラメータを適切に削減できない、または1×1畳み込みに一般化できないという制限を克服すること。
  • 分解された畳み込みの間でパラメータ分布をバランスさせる統一的で細粒度な圧縮フレームワークを構築すること。
  • 高レベル(例:分類)および低レベル(例:超解像)のビジョンタスクの両方に対して、効率的かつ高精度な圧縮を可能にすること。

提案手法

  • この手法は、3次元畳み込みフィルタを入力チャネル次元に沿って小さな2次元成分に分割し、それぞれを基本的要素として扱う。
  • これらの成分の集合を、共有された学習可能な基本セットの線形結合としてモデル化する。
  • 基本セットと係数(線形結合)を、エンドツーエンドのバックプロパゲーションを用いて同時に最適化する。
  • 推論時、基本セットを組み合わせて元の3次元フィルタを再構築し、パラメータ数を削減した効率的な前向き伝搬を実現する。
  • このアプローチは1×1畳み込みにも自然に一般化可能であり、DenseNet や EDSR などの現代アーキテクチャで一般的に使われる。
  • 従来のネットワークと互換性があり、アーキテクチャの変更なしに最先端モデルに容易に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1学習可能な基本セットが、パラメータ数を削減しながら畳み込み層のフィルタ成分を効果的に表現できるか?
  • RQ2提案手法の基本セット学習法は、従来のフィルタ分解手法と比較して、圧縮比と精度の両面で優れているか?
  • RQ3本手法は、出力チャネル数が少ない狭いネットワークおよび1×1畳み込みに一般化可能か?
  • RQ4本手法は、画像超解像などの低レベルビジョンタスクにおいて、性能を維持または向上できるか?
  • RQ5基本セットのサイズ、分割数、およびモデル精度の間の最適なトレードオフは何か?

主な発見

  • VGG-16では、元のFLOPsの23.5%にまで削減した状態でトップ1誤差率6.23%を達成し、同じFLOPs削減率下ですべてのベースラインを上回る精度を示した。
  • DenseNet-12-40では、331kパラメータで5.32%の最低誤差率を達成し、KSEおよびFactorと比較して精度と圧縮比の両面で優れた性能を示した。
  • ResNet-56では、FLOPsを50%削減した状態でトップ1誤差率6.08%を達成し、同じ計算リソース下でKSEおよび他の手法を著しく上回った。
  • 画像超解像タスクにおいて、SRResNetレベルのモデルサイズにまで圧縮しながら、SRResNetを上回る高い精度を維持した。
  • 1×1畳み込みにも良好に一般化され、DenseNet や EDSR など、こうした層に依存するネットワークにおいても効果的な圧縮を可能にした。
  • アブレーションスタディの結果、DenseBlocksとトランジション層の両方で圧縮をバランスさせる(例:s=6およびs=12の分割)ことで、特定のコンponentでの過剰な圧縮よりも高い精度が得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。