Skip to main content
QUICK REVIEW

[論文レビュー] Neural Network Pruning with Residual-Connections and Limited-Data

Jian-Hao Luo, Jianxin Wu|arXiv (Cornell University)|Nov 19, 2019
Advanced Neural Network Applications参考文献 39被引用数 11
ひとこと要約

本稿では、KLダイバージェンスに基づく基準を用いて、残差接続の内部および外部のチャネルを同時にプルーニングする新しいフィルターレベルのプルーニング手法CURLを提案する。これにより、より効率的な「お札型」のネットワーク構造が実現される。さらに、限られたデータでのプルーニングに向け、知識蒸留とラベル精錬を組み合わせることで、ノイズの多いソフトラベルの影響を軽減し、CUB200 や Pets のような小さなデータセットでのみ学習した場合でも、大規模な事前学習モデルを微調整した場合と同等またはそれ以上の性能を達成する。

ABSTRACT

Filter level pruning is an effective method to accelerate the inference speed of deep CNN models. Although numerous pruning algorithms have been proposed, there are still two open issues. The first problem is how to prune residual connections. We propose to prune both channels inside and outside the residual connections via a KL-divergence based criterion. The second issue is pruning with limited data. We observe an interesting phenomenon: directly pruning on a small dataset is usually worse than fine-tuning a small model which is pruned or trained from scratch on the large dataset. Knowledge distillation is an effective approach to compensate for the weakness of limited data. However, the logits of a teacher model may be noisy. In order to avoid the influence of label noise, we propose a label refinement approach to solve this problem. Experiments have demonstrated the effectiveness of our method (CURL, Compression Using Residual-connections and Limited-data). CURL significantly outperforms previous state-of-the-art methods on ImageNet. More importantly, when pruning on small datasets, CURL achieves comparable or much better performance than fine-tuning a pretrained small model.

研究の動機と目的

  • 深層畳み込みニューラルネットワークにおける残差接続のプルーニングの課題に取り組み、性能を低下させる「時計型」構造を回避すること。
  • 大規模データセットが利用できない現実世界のシナリオにおいて、限られた学習データでモデルの精度を向上させること。
  • 大規模事前学習への依存を減らし、高精度を維持したまま、小規模なターゲットデータセットに対して直接プルーニングを適用できるようにすること。
  • 微調整時に知識蒸留におけるノイズの多いソフトラベルの悪影響を軽減すること。

提案手法

  • KLダイバージェンスに基づく基準により、残差ブランチおよびアイデンティティブランチの両方におけるフィルタの重要度を評価し、残差接続の内部および外部のチャネルを統合的にプルーニング可能にする。
  • プルーニングを残差ステージ内のすべてのブロックに対して同時に適用することで、残差接続の構造的整合性を保つ。
  • データ拡張として mixup を用い、小規模なデータセットを拡張することで、学習の多様性とモデルのロバスト性を向上させる。
  • 知識蒸留中にソフトラベルを更新するラベル精錬戦略を採用し、ノイズの多い教師モデルの予測の影響を低減する。
  • データ拡張とラベル精錬を知識蒸留と組み合わせることで、限られたデータでの学習において性能を向上させる。
  • 本手法はエンドツーエンドで適用可能であり、大規模事前学習データにアクセスせずに、小規模データセットに対して直接プルーニングを実行可能である。

実験結果

リサーチクエスチョン

  • RQ1残差パス内でのみフィルタを削除する従来のプルーニングとは異なり、残差接続の内部および外部のフィルタを統合的にプルーニングすることで、モデルの効率性と精度が向上するか?
  • RQ2小さなデータセットでの微調整において、ノイズの多いソフトラベルの影響を軽減するために、知識蒸留をどのように強化できるか?
  • RQ3データ拡張を知識蒸留とラベル精錬と組み合わせることで、標準的な蒸留手法に比べて、低データ環境下でより優れた性能が得られるか?
  • RQ4小規模データセットに対して直接学習したプルーニングモデルは、大規模データセットで事前学習されたモデルを微調整したモデルと同等の性能を達成できるか?

主な発見

  • ImageNet において、CURL は従来の最先端のプルーニング手法を上回り、お札型の残差ブロック構造を採用することで、優れた精度と効率性を示した。
  • CUB200 において、提案されたKLダイバージェンス基準により、微調整なしで66.33%のトップ-1精度を達成し、ランダム(6.80%)および重み和(8.25%)のベースラインを著しく上回った。
  • ラベル精錬を適用した場合、MobileNetV2 は CUB200 で78.72%のトップ-1精度を達成し、精錬なしの標準的な知識蒸留よりも1.29%の向上を示した。
  • CURL を用いて小規模データセットで微調整した ResNet50 は、CUB200 で83.64%の精度を達成し、標準的な蒸留手法の82.88%を上回った。
  • ラベル精錬手法により、Dogs データセットでは最大0.84%の精度向上が見られ、ラベルノイズの影響低減の有効性が裏付けられた。
  • mixup、知識蒸留、ラベル精錬の組み合わせにより、大規模データセットでの事前学習が不要な状態で、小規模データセットに対する直接的プルーニングが、ImageNet で事前学習したモデルを微調整した場合と同等またはそれ以上の性能を達成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。