Skip to main content
QUICK REVIEW

[論文レビュー] DeepFace: Face Generation using Deep Learning

Hardie Cate, Fahim Dalvi|arXiv (Cornell University)|Jan 7, 2017
Face recognition and analysis参考文献 10被引用数 6
ひとこと要約

この論文では、顔の属性分類に微調整された畳み込みニューラルネットワーク(CNN)と、指定された属性から現実的な顔を生成するためのカスタムガウス混合モデル(cGMM)を組み合わせた深層学習フレームワークを提案する。VGG-Faceの活性化特徴量における特徴量の逆投影を活用することで、生成アーキテクチャを越えてCNNのみで一貫性のある顔を生成し、分類精度は82%に達し、ターゲット属性と一致する妥当な顔画像を生成した。

ABSTRACT

We use CNNs to build a system that both classifies images of faces based on a variety of different facial attributes and generates new faces given a set of desired facial characteristics. After introducing the problem and providing context in the first section, we discuss recent work related to image generation in Section 2. In Section 3, we describe the methods used to fine-tune our CNN and generate new images using a novel approach inspired by a Gaussian mixture model. In Section 4, we discuss our working dataset and describe our preprocessing steps and handling of facial attributes. Finally, in Sections 5, 6 and 7, we explain our experiments and results and conclude in the following section. Our classification system has 82\% test accuracy. Furthermore, our generation pipeline successfully creates well-formed faces.

研究の動機と目的

  • 指定された顔の属性(髪の色、人種、アクセサリーなど)に基づいて現実的な顔を生成するシステムを開発すること。
  • 微調整されたVGG-Face CNNを用いて、73の顔の特徴に関する高い精度で顔の属性を分類すること。
  • cGMMに基づく新しいアプローチを用いて、特徴量の活性化を逆投影することで、ランダムノイズから新しい、整合性のある顔を生成すること。
  • 生成敵対ネットワークや変分オートエンコーダーを必要としないCNNベースのシステムが、妥当な顔を生成できることを示すこと。
  • テストセット内の実画像との類似度を測る類似度指標を用いて、生成された顔の品質を評価すること。

提案手法

  • 200万枚の有名人顔のデータセット上で事前学習済みのVGG-Face CNNを微調整し、fc-7層に73の顔の特徴に関する42個のマルチラベルソフトマックスヘッドを接続する。
  • ドロップアウトと5e-6の初期学習率を用い、50エポックにわたり微調整プロセスを正則化し、過学習を防ぐ。
  • CNN内の特徴量活性化の分布を、カスタムガウス混合モデル(cGMM)としてモデル化し、各属性の活性化が正規分布に従い、互いに独立していると仮定する。
  • cGMMの平均推定値を用いて、ターゲット属性の活性化をランダムノイズから画像空間に逆投影することで特徴量の逆投影を実行する。
  • 計算効率を最優先するために、ガウス分布の平均の重み付き和を用いて画像を再構築し、生成出力の分散を犠牲にしてもよい。
  • 生成された顔の品質を定量的に評価するために、PicTriev類似度指標を用い、テストセット内の正解画像と比較する。

実験結果

リサーチクエスチョン

  • RQ1微調整されたCNNは、髪の色、人種、アクセサリーなど多様な顔の属性を高い精度で分類できるか?
  • RQ2カスタムガウス混合モデルは、CNNの特徴量活性化を効果的に逆投影し、ランダムノイズから一貫性があり現実的な顔を生成できるか?
  • RQ3生成された顔は、実画像との間でどの程度の知覚的類似度を示すか?
  • RQ4cGMMアプローチには、特に顕著でない属性に対して、特徴量の識別性を保持する上での限界があるか?
  • RQ5訓練データに属性の多様性がさらに高ければ、この手法は多様で平均中心でない顔を生成できるか?

主な発見

  • 分類システムは平均82%のテスト精度を達成し、ほとんどの個々の属性が0.8以上、多くの属性が0.9を超えた。
  • cGMMに基づく生成パイプラインは、ランダムノイズから整合性があり一貫性のある顔を効果的に生成し、特徴量の逆投影の可能性を示した。
  • 生成された顔は実画像と中程度の類似度を示し、PicTriev指標では、ミッキー・ロークで22%、ジェレッド・レトで52%のスコアを記録した。
  • 照明や写真タイプなどの属性は、特徴空間での識別性が低いため、分類精度がやや低く(約55–60%)なった可能性がある。
  • 生成された顔は一貫して訓練データの平均画像に近く、ガウス分布の平均の平均化により、変動が限定的であることが示唆された。
  • この手法の性能は、特徴量活性化が独立で正規分布に従うという仮定に依存しており、相関のある属性間の区別がぼやける可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。