Skip to main content
QUICK REVIEW

[論文レビュー] MorphGAN: One-Shot Face Synthesis GAN for Detecting Recognition Bias

Nataniel Ruiz, Barry-John Theobald|arXiv (Cornell University)|Dec 9, 2020
Face recognition and analysis参考文献 45被引用数 7
ひとこと要約

MorphGAN は、1枚の参照画像と 3D モーファブルモデルを用いて、顔のアイデンティティを保持したまま、制御された頭部ポーズおよび顔の表情の変化を伴う高精細な顔画像を生成する条件付き GAN である。この手法は顔認識システムにおけるバイアス検出を可能にし、小規模データセットにおけるデータ拡張に用いることで、認識精度を最大 9% 向上させる。

ABSTRACT

To detect bias in face recognition networks, it can be useful to probe a network under test using samples in which only specific attributes vary in some controlled way. However, capturing a sufficiently large dataset with specific control over the attributes of interest is difficult. In this work, we describe a simulator that applies specific head pose and facial expression adjustments to images of previously unseen people. The simulator first fits a 3D morphable model to a provided image, applies the desired head pose and facial expression controls, then renders the model into an image. Next, a conditional Generative Adversarial Network (GAN) conditioned on the original image and the rendered morphable model is used to produce the image of the original person with the new facial expression and head pose. We call this conditional GAN -- MorphGAN. Images generated using MorphGAN conserve the identity of the person in the original image, and the provided control over head pose and facial expression allows test sets to be created to identify robustness issues of a facial recognition deep network with respect to pose and expression. Images generated by MorphGAN can also serve as data augmentation when training data are scarce. We show that by augmenting small datasets of faces with new poses and expressions improves the recognition performance by up to 9% depending on the augmentation and data scarcity.

研究の動機と目的

  • トレーニングデータの多様性が限られていること、特にポーズや表情の観点から顔認識モデルにおける認識バイアスを検出する課題に対処すること。
  • 1枚の参照画像から、ポーズおよび表情の変化を制御できるが、アイデンティティを保持したリアルな顔画像を生成する手法を開発すること。
  • 1つの属性(ポーズまたは表情)のみを変化させたテストセットを生成することで、顔認識モデルの感度テストを可能にすること。
  • 合成された多様なポーズと表情を用いたデータ拡張により、小規模データセットに対する顔認識システムの頑健性を向上させること。
  • 3D モーファブルモデルと条件付き GAN を組み合わせ、複数枚の参照画像を必要とせずに高精細で制御可能な顔合成を実現すること。

提案手法

  • 3D モーファブルモデルのフィッティングを用いて、1枚の入力画像から FLAME 3D 顔モデルのパラメータ(形状、ポーズ、表情)を推定する。
  • 推定された 3D モデルのパラメータを調整して、望ましい頭部ポーズおよび顔の表情の変更を加え、新しい 3D 顔画像をレンダリングする。
  • 元の画像とレンダリングされた 3D モデルを入力として受け取り、新しいポーズおよび表情を持つ同一アイデンティティのリアルな画像を生成する条件付き GAN(MorphGAN)を訓練する。
  • 本物または偽物の画像、形状レンダリング、スタイルベクトルを入力とするグローバルディスクラミネーターを用いて、リアルさと一貫性を強制する。
  • 局所的な画像のリアルさを評価するパッチディスクラミネーターを採用し、細部の質を向上させ、アーティファクトを低減する。
  • ポーズ差分のバッチをバランスさせる手法を用いて、大規模なポーズ変化の範囲で一般化性能を向上させ、アーティファクトを低減する。

実験結果

リサーチクエスチョン

  • RQ1条件付き GAN は、1枚の参照画像から、ポーズおよび表情の変化を制御しながらアイデンティティを保持した写真のような顔画像を生成できるか?
  • RQ2MorphGAN が生成する画像は、ポーズおよび顔の表情に関連する顔認識モデルのバイアスをどの程度効果的に検出できるか?
  • RQ3MorphGAN は、小規模データセットにおける顔認識性能の向上を図るためのデータ拡張手法としてどの程度有効か?
  • RQ4MorphGAN は、既存の GAN に基づく顔合成手法と比較して、アイデンティティ保持性および属性制御性において優れているか?
  • RQ53D モーファブルモデルと条件付き GAN を組み合わせることで、限られた監視情報のもとで、エンドツーエンド GAN よりも高精細な結果が得られるか?

主な発見

  • MorphGAN は、定性的な比較によって検証されたように、ポーズおよび顔の表情の変化を正確に制御しながら、アイデンティティを保持した高精細な顔画像を効果的に生成した。
  • 1つの属性(ポーズまたは表情)のみを変化させた制御されたテストセットを生成することで、顔認識モデルの感度テストが効果的に可能になった。
  • データ拡張に用いた場合、MorphGAN は小規模データセットにおいて顔認識精度を最大 9% 向上させた。この向上幅は、拡張戦略やデータ不足の度合いに依存する。
  • ポーズ差分のバッチをバランスさせる手法により、特に大規模なポーズ変化において、ポーズの正確性が向上し、アーティファクトが顕著に低減された。
  • 1枚の参照画像のみを用いても、Zakharov ら [50] や X2Face [49] といったベースライン手法よりも、アイデンティティ保持性および視覚的品質で優れた性能を示した。
  • グローバルディスクラミネーターとパッチディスクラミネーターの両方を用いることで、顔のテクスチャーや幾何学的形状の面で、リアルさと一貫性の高い画像生成が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。