Skip to main content
QUICK REVIEW

[論文レビュー] Filter Grafting for Deep Neural Networks

Fan‐Xu Meng, Hao Cheng|arXiv (Cornell University)|Jan 15, 2020
Advanced Neural Network Applications参考文献 27被引用数 9
ひとこと要約

この論文は、他のネットワークからの外部重みを組み込むことで、深層ニューラルネットワーク内の無視されがちなフィルタを再活性化する、フィルターグラフトという新しい学習パラダイムを導入する。アーキテクチャを変更せずに、性能を顕著に向上させる。この手法はエントロピーに基づく基準と適応的重み付けを用い、表現能力を強化し、MobileNetV2ではCIFAR-100で最大7%の精度向上を達成する。

ABSTRACT

This paper proposes a new learning paradigm called filter grafting, which aims to improve the representation capability of Deep Neural Networks (DNNs). The motivation is that DNNs have unimportant (invalid) filters (e.g., l1 norm close to 0). These filters limit the potential of DNNs since they are identified as having little effect on the network. While filter pruning removes these invalid filters for efficiency consideration, filter grafting re-activates them from an accuracy boosting perspective. The activation is processed by grafting external information (weights) into invalid filters. To better perform the grafting process, we develop an entropy-based criterion to measure the information of filters and an adaptive weighting strategy for balancing the grafted information among networks. After the grafting operation, the network has very few invalid filters compared with its untouched state, enpowering the model with more representation capacity. We also perform extensive experiments on the classification and recognition tasks to show the superiority of our method. For example, the grafted MobileNetV2 outperforms the non-grafted MobileNetV2 by about 7 percent on CIFAR-100 dataset. Code is available at https://github.com/fxmeng/filter-grafting.git.

研究の動機と目的

  • 効率性のため通常は pruning されるが、まだ潜在的な表現能力を有する可能性のある、重要度が低い(L1ノルムが小さい)フィルタの活用不足を是正すること。
  • このようなフィルタを外部情報によって再活性化することで、モデル性能を向上させ、単に破棄するのではなく、代替的効果をもたらすかを調査すること。
  • フィルターグラフトを用いて、平行に学習するネットワーク間で知識を転送可能な、ワンステージで自己教師ありの訓練手法を開発すること。
  • アーキテクチャを維持しつつ、グラフトによって有効なフィルタの数を増やすことで、DNNの表現能力を向上させること。
  • 画像分類、物体認識、人物再識別といった多様なタスクにわたるフィルターグラフトの汎用性を実証すること。

提案手法

  • 外部ネットワークからの新しい重みを割り当てることで、重要度が低いフィルタを再活性化する、フィルターグラフトという新しいパラダイムを提唱する。元のアーキテクチャを保持する。
  • フィルタの情報量を測定するため、エントロピーに基づく基準を用い、どれが無視されがちなか、グラフトに適しているかを特定する。
  • 異なる層やネットワークにおけるグラフト情報の寄与度をバランスさせるための適応的重み付け戦略を実装する。
  • 複数のネットワークを並列に学習させ、訓練中に、あるネットワークの意味のあるフィルタを、別のネットワークの無効なフィルタに定期的にグラフトする。
  • 監視なしにグラフト処理を実行し、ネットワークの固有の構造と特徴表現に依存する。
  • グラフト処理において、ソースとターゲットネットワークの層とチャネルの整合性を維持することで、適合性と効果的な情報伝達を確保する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワーク内の無視されがちなフィルタは、pruning されるのではなく、性能向上のため再活性化できるか?
  • RQ2グラフトに最適な情報源は何か—ネットワーク内部の特徴か、外部のネットワークか?
  • RQ3フィルタの情報量を定量的に測定するにはどうすればよいか?グラフトプロセスを導く基準とする。
  • RQ4異なる層やネットワークにおけるグラフト重みの寄与度をバランスさせるにはどのような戦略が効果的か?性能向上を最大化する。
  • RQ5フィルターグラフトは、ImageNet、CIFAR-100、人物再識別といった異なるデータセットやタスクに一般化可能か?

主な発見

  • フィルターグラフトはモデルの精度を顕著に向上させる:MobileNetV2ではCIFAR-100でトップ1精度78.32%を達成し、非グラフトベースラインより7%の向上を示す。
  • ベースラインでは無効なフィルタ(L1ノルム < 1e-3)の割合が約50%であったが、グラフトネットワークでは最小限の割合にまで低下し、効果的な再活性化が確認された。
  • グラフトネットワークは、ベースラインに比べて高い情報エントロピーとより大きな情報ゲインを示しており、表現能力の向上が裏付けられている。
  • グラフトプロセスに参加する並列ネットワークの数が増えるほど性能が向上し、複数モデル間でスケーラビリティと正の相乗効果が確認された。
  • ImageNetでは、ResNet18とResNet34がそれぞれトップ1精度で2.04%および1.98%の向上を達成し、大規模データセットでも有効性が示された。
  • 人物再識別タスクでは、Market1501とDukeMTMC-ReIDの両方でmAPとランク-1精度が向上し、4つのネットワークを用いた場合、Market1501でmAPが最大6.7%向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。