Skip to main content
QUICK REVIEW

[論文レビュー] Sparsifying Neural Network Connections for Face Recognition

Yi Sun, Xiaogang Wang|arXiv (Cornell University)|Dec 7, 2015
Face recognition and analysis参考文献 24被引用数 6
ひとこと要約

本論文では、顔認識のための深層畳み込みニューラルネットワークの反復的・相関に基づくスパース化手法を提案する。まず、密なベースラインを学習し、その後、ニューロンの活性化パターンの相関に基づいて段階的に接続を pruning する。この手法は、LFW で 99.55% の精度を達成し、モデルサイズを元のパラメータのわずか 12% に削減するという、最先端の性能を発揮した。これは、同じ学習データを用いた DeepID2+ よりも優れている。

ABSTRACT

This paper proposes to learn high-performance deep ConvNets with sparse neural connections, referred to as sparse ConvNets, for face recognition. The sparse ConvNets are learned in an iterative way, each time one additional layer is sparsified and the entire model is re-trained given the initial weights learned in previous iterations. One important finding is that directly training the sparse ConvNet from scratch failed to find good solutions for face recognition, while using a previously learned denser model to properly initialize a sparser model is critical to continue learning effective features for face recognition. This paper also proposes a new neural correlation-based weight selection criterion and empirically verifies its effectiveness in selecting informative connections from previously learned models in each iteration. When taking a moderately sparse structure (26%-76% of weights in the dense model), the proposed sparse ConvNet model significantly improves the face recognition performance of the previous state-of-the-art DeepID2+ models given the same training data, while it keeps the performance of the baseline model with only 12% of the original parameters.

研究の動機と目的

  • 制御されたスパarsityを用いたスパースな深層 ConvNet の学習により、顔認識性能を向上させること。
  • 重みの大きさや2階微分と比較して、ニューロンの活性化パターンの相関が、重要な接続を特定する指標として優れているかどうかを調査すること。
  • 事前学習済みの密なモデルからスパースモデルを初期化することで、スパースモデルを初期化から学習するよりも優れた特徴抽出が可能かどうかを検証すること。
  • リソース制約のあるプラットフォームへのデプロイに適した、顕著に小型化されたモデルサイズで高い性能を達成すること。
  • YouTube Faces などの挑戦的なデータセットにおけるスパース ConvNet の一般化性能とロバスト性を評価すること。

提案手法

  • 約 300,000 枚の顔画像を用いて、高性能な密な VGG に類似した ConvNet をベースラインとして学習する。
  • 最後の層から順に1層ずつ反復的にスパース化し、前回のモデルの重みを初期値として使用して、全モデルを再学習する。
  • 接続を保持する基準として、接続されたニューロンの活性化パターン間の相関を利用する。
  • 1つのパラメータでスパarsityを制御し、モデルサイズと性能の間で体系的なトレードオフを可能にする。
  • 多様な顔領域およびスケールで学習された 25 個のモデルのアンサンブルに、同じスパース化プロセスを適用する。
  • アンサンブルからの特徴を統合することで、LFW および YouTube Faces で最終的な最先端の性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1相関に基づくプルーニングを用いた反復的・レイヤーワイズスパース化は、密なモデルと比較して顔認識精度を向上させることができるか?
  • RQ2事前学習済みの密なモデルからスパースモデルを初期化することが、良好な性能を達成するために不可欠であるのか、それとも初期化から学習する場合、局所最適解に陥るために失敗するのか?
  • RQ3重みの大きさや2階微分と比較して、ニューロンの活性化パターンの相関が、接続選択の基準として優れているか?
  • RQ4性能を維持または向上させつつ、どの程度までモデルサイズを削減できるか?
  • RQ5提案手法のスパース ConvNet は、YouTube Faces のようなドメイン外データセットにおいて、どの程度一般化できるか?

主な発見

  • 提案されたスパース ConvNet は、LFW で 99.55% の顔認証精度を達成し、同じ学習データを用いた以前の最先端手法である DeepID2+ アンサンブル(99.47%)を上回った。
  • 元のパラメータのわずか 12% で 98.95% の精度を維持しており、強力な圧縮効率を示した。
  • 全結合層(1/256)にスパース性を導入することで平均精度が 0.18% 向上し、局所結合層(1/128)をスパース化した場合も 0.17% 向上した。
  • 25 個のスパース ConvNet からなるアンサンブルは、YouTube Faces で 93.5% の精度を達成し、より挑戦的なこのデータセットにおいて DeepID2+ アンサンブル(93.2%)を上回った。
  • LFW では閉集合識別精度が 0.962、オープン集合識別精度が 0.864 を達成し、DeepID2+ の 0.950 と 0.807 を上回った。
  • スパースモデルを初期化から直接学習させた場合、収束が良好な解に到達しなかったため、効果的な初期化には密なモデルの事前学習が不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。