Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robust Deep Face Representation

Xiang Wu|arXiv (Cornell University)|Jul 17, 2015
Face recognition and analysis参考文献 12被引用数 9
ひとこと要約

本論文では、ロバストでコン act な顔表現を学習するための、新しいMax-Feature-Map(MFM)活性化関数を備えた浅い深層畳み込みネットワークを提案する。ReLUに代えてMFMを採用することで、非ゼロ応答を保持し、スパース勾配を可能にし、教師なし設定下でLFWベンチマークで97.77%の精度を達成した。これは、単一のネットワークとしてDeepFace、DeepID2、WebFaceを上回った。

ABSTRACT

With the development of convolution neural network, more and more researchers focus their attention on the advantage of CNN for face recognition task. In this paper, we propose a deep convolution network for learning a robust face representation. The deep convolution net is constructed by 4 convolution layers, 4 max pooling layers and 2 fully connected layers, which totally contains about 4M parameters. The Max-Feature-Map activation function is used instead of ReLU because the ReLU might lead to the loss of information due to the sparsity while the Max-Feature-Map can get the compact and discriminative feature vectors. The model is trained on CASIA-WebFace dataset and evaluated on LFW dataset. The result on LFW achieves 97.77% on unsupervised setting for single net.

研究の動機と目的

  • スパースなReLU活性化による情報損失を回避する、よりロバストな深層顔認識表現学習フレームワークの開発。
  • 手動のしきい値設定とハードネガティブマーキングを必要とする、検証ベースの損失関数の限界の解消。
  • LFWでの教師あり微調整に依存せずに、顔認識の汎化性能と性能の向上。
  • 情報のコンパクト性を維持しながら、スパース勾配更新を可能にする代替活性化関数の探索。
  • 単一の浅い畳み込みネットワークで、LFWベンチマークにおいて最先端の性能を達成すること。

提案手法

  • モデルは約400万パラメータの4層畳み込み、4層マックスプーリング、2層全結合層アーキテクチャを採用。
  • Max-Feature-Map(MFM)活性化関数は、ペアド特徴マップ間の最大値を計算する:各空間的位置で $ f = \max(C^k, C^{k+n}) $。
  • MFMの勾配はスパースである:$ \frac{\partial f}{\partial C^k} = 1 $ であれば $ C^k \geq C^{k+n} $、さもなくば0であり、これによりスパース接続が可能になる。
  • MFM関数は各畳み込みブロックの後に適用され、冗長性を低減しながらコンパクトで判別性の高い特徴マップを生成する。
  • データオーグメンテーションには、128×128へのランダムクロップ、水平反転、および全結合層へのドロップアウト(0.7)を含め、過学習を防止。
  • モデルはCaffeを用いてCASIA-WebFace(493,456枚の画像、10,575人の個人)で訓練され、重み減衰(主な層では5e-4、最終層では5e-3)と、1e-3から5e-5に段階的に減少する学習率が使用された。

実験結果

リサーチクエスチョン

  • RQ1コンパクトでスパースでない活性化関数は、ReLUと比較して深層顔認識表現学習を改善できるか?
  • RQ2Max-Feature-Map関数は、複雑な損失関数に依存せずに、顔認識におけるロバスト性と性能を向上させられるか?
  • RQ3教師なし学習下で、浅い単一ネットワークアーキテクチャが、DeepFace や DeepID2 よりもLFWベンチマークで優れた性能を発揮できるか?
  • RQ4トレーニング中の収束速度と最終検証精度という観点から、MFMはReLUと比較してどのように異なるか?
  • RQ5MFMベースのモデルは、LFWでの微調整なしに、未知の個人にどれほど一般化できるか?

主な発見

  • 提案されたMFMベースのモデルは、教師なし設定下でLFWベンチマークで97.77%の精度を達成した。これは単一ネットワークとしての最先端性能である。
  • MFM活性化は収束が遅いものの、検証精度においてReLUを上回り、より良い汎化性能とロバスト性を示した。
  • 単一ネットワークとして、DeepFace(95.92% 教師なし)、DeepID2(97.75% 教師なし)、WebFace(97.73% 無制限)を上回る性能を達成した。
  • MFM関数は、最も活性な特徴マップペアを選択することでコンパクトな表現を可能にし、非ゼロ応答を保持することで、ReLUと比較して情報損失を低減した。
  • 最終全結合層(fc2)に重み減衰(5e-3)を適用することで、パラメータ数が多いための過学習を効果的に抑制した。
  • モデルは個人間で良好に一般化し、LFWデータセットでの教師あり微調整なしに、強力な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。