Skip to main content
QUICK REVIEW

[論文レビュー] SD-GAN: Structural and Denoising GAN reveals facial parts under occlusion

Samik Banerjee, Sukhendu Das|arXiv (Cornell University)|Feb 19, 2020
Face recognition and analysis参考文献 33被引用数 5
ひとこと要約

本稿では、構造的およびノイズ除去GANを組み合わせ、二様な学習戦略と新しい構造的損失(SSIM + パッチ単位のMSE)を用いて、遮蔽された顔の部分を再構築する新しい生成的対抗的ネットワークSD-GANを提案する。この手法は、GFC や TPG-GAN よりも高速な収束と優れた画像品質を実現し、遮蔽されたデータセットにおける顔認識性能で最先端の結果を達成した。

ABSTRACT

Certain facial parts are salient (unique) in appearance, which substantially contribute to the holistic recognition of a subject. Occlusion of these salient parts deteriorates the performance of face recognition algorithms. In this paper, we propose a generative model to reconstruct the missing parts of the face which are under occlusion. The proposed generative model (SD-GAN) reconstructs a face preserving the illumination variation and identity of the face. A novel adversarial training algorithm has been designed for a bimodal mutually exclusive Generative Adversarial Network (GAN) model, for faster convergence. A novel adversarial "structural" loss function is also proposed, comprising of two components: a holistic and a local loss, characterized by SSIM and patch-wise MSE. Ablation studies on real and synthetically occluded face datasets reveal that our proposed technique outperforms the competing methods by a considerable margin, even for boosting the performance of Face Recognition.

研究の動機と目的

  • 顔認識の課題に取り組むこと、特に顕著な顔の特徴がマスキングされている状況での顔認識を改善すること。
  • 後処理を必要としないエンドツーエンドの生成モデルを構築すること。
  • 二様な学習戦略を導入することで、顔のインpaintingにおける収束速度と画像品質を向上させること。
  • SSIMとPMSEを組み合わせた新しい構造的損失関数を用いて、全体的および局所的な顔の構造の保存を向上させること。
  • SD-GANが遮蔽下の顔認識システムにおける前処理モジュールとして有効であることを実証すること。

提案手法

  • SD-GANは二様な学習プロセスを採用する:Mode-Iは環境イルミネーションを考慮した顔画像を生成し、Mode-IIはノイズ除去自己符号化器ベースのジェネレータを用いて出力をノイズ除去する。
  • 構造的類似性(SSIM)による全体的顔構造の保持と、パッチ単位の平均二乗誤差(PMSE)による局所画素レベルの忠実度を組み合わせた、新しい対抗的構造的損失が導入された。
  • ジェネレータはミニマックスゲームにおいてディスクライマをだませる一方で、構造的損失を最小化するように訓練され、現実的でアイデンティティを保持した顔再構築を促進する。
  • 2番目のモードでノイズ除去自己符号化器アーキテクチャを活用することで、ナッシュ均衡への収束が高速化されるように訓練アルゴリズムが設計された。
  • 本モデルは、AR、CelebA、Multi-PIEを含む、実際の顔データセットおよび合成的遮蔽顔データセット上でエンドツーエンドで訓練された。
  • 本フレームワークは顔認識の前処理ステップとして評価され、性能向上を評価するためにVGGを分類器として用いた。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、アイデンティティとイルミネーション変動を保持したまま、遮蔽された顔の部分を再構築できるか?
  • RQ2提案された二様な学習戦略は、顔のインpaintingに用いられる既存のGANと比較して、より高速な収束をもたらすか?
  • RQ3新しい構造的損失(SSIM + PMSE)は、再構築された顔における全体的顔構造と局所的テクスチャ忠実度の両方を向上させられるか?
  • RQ4GFC や TPG-GAN と比較して、SD-GAN は遮蔽されたデータセットにおける顔認識精度で優れているか?
  • RQ5SD-GAN は、後処理を必要とせず、顔認識システムの前処理モジュールとして効果的に使用できるか?

主な発見

  • ARデータベースでは、VGG+SD-GANはAR1でランク1認識率96.82%、AR2で92.64%を達成し、ISV(45.13% および 39.81%)やLDA-IR(62.59% および 57.44%)を大きく上回った。
  • ARデータベースでは、SD-GANは550エポックで収束し、1エポックあたり3分を要した。一方、GFCは30,000エポック、1エポックあたり8分を要したため、学習時間の大幅な短縮が確認された。
  • 90°のポーズ変動を伴うMulti-PIEデータセットでは、SD-GANはランク1認識率65.19%を達成し、TPG-GANの64.03%を上回った。
  • SD-GANのPSNRとSSIM値はそれぞれ19.84および0.66であり、TPG-GANの12.26および0.59と比較して、画像品質が優れていた。
  • 定性的な結果から、SD-GANは正しいイルミネーションと対称性を保持しており、TPG-GANで見られる鏡のように歪んだ歪みや不審な特徴(例:イヤリング)を回避していることが確認された。
  • アブレーションスタディの結果、構造的損失におけるSSIMとPMSEの組み合わせが再構築品質および認識性能を顕著に向上させたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。