Skip to main content
QUICK REVIEW

[論文レビュー] DCFace: Synthetic Face Generation with Dual Condition Diffusion Model

Minchul Kim, Feng Liu|arXiv (Cornell University)|Apr 14, 2023
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、顔のアイデンティティ(ID)とスタイル(例:ポーズ、照明、表情)を別々に制御することで、高精細な合成顔画像を生成する二重条件拡散モデル、DCFceを提案する。これにより、複数のスタイルで同一被写体の一貫性のある画像を生成できる。DCFceで生成されたデータで訓練された顔認識モデルは、5つのベンチマークデータセットのうち4つで、先行手法よりも平均で6.11%高い精度を達成し、実データで訓練した場合との性能差を顕著に縮小した。

ABSTRACT

Generating synthetic datasets for training face recognition models is challenging because dataset generation entails more than creating high fidelity images. It involves generating multiple images of same subjects under different factors ( extit{e.g.}, variations in pose, illumination, expression, aging and occlusion) which follows the real image conditional distribution. Previous works have studied the generation of synthetic datasets using GAN or 3D models. In this work, we approach the problem from the aspect of combining subject appearance (ID) and external factor (style) conditions. These two conditions provide a direct way to control the inter-class and intra-class variations. To this end, we propose a Dual Condition Face Generator (DCFace) based on a diffusion model. Our novel Patch-wise style extractor and Time-step dependent ID loss enables DCFace to consistently produce face images of the same subject under different styles with precise control. Face recognition models trained on synthetic images from the proposed DCFace provide higher verification accuracies compared to previous works by $6.11\%$ on average in $4$ out of $5$ test datasets, LFW, CFP-FP, CPLFW, AgeDB and CALFW. Code is available at https://github.com/mk-minchul/dcface

研究の動機と目的

  • 顔認識モデルの学習に適した大規模でラベル整合性があり、多様な合成顔データセットを生成する課題に対処すること。
  • GAN や 3D モデルに基づく従来手法を改善し、画像生成においてアイデンティティとスタイル要因を統合的に制御すること。
  • プライバシーを侵害する可能性のあるウェブクロールドデータセットに依存することを減らし、合成データのみで高い顔認識性能を達成すること。
  • 合成データにおいて、クラス間の変動(多様なアイデンティティ)、クラス内変動(1人の被写体に対する複数のスタイル)、ラベル整合性のバランスを取ること。
  • 顔認識ベンチマークにおいて、合成データと実データの性能差を縮小すること。

提案手法

  • 2段階の生成フレームワーク:まず、拡散モデルを用いて高品質なID固有の顔画像を生成し、次に、その画像をスタイルバンクから得たスタイル画像と二重条件ジェネレータを介して混合する。
  • 局所的なパッチ単位のスタイル抽出器を導入し、アイデンティティからスタイル情報(ポーズ、照明、表情)を分離することで、細かいスタイル制御を可能にする。
  • 時間ステップに依存するID損失を提案し、拡散サンプリングの各ステップでアイデンティティの一貫性を保つ。これにより、生成画像が元の被写体のアイデンティティを維持する。
  • 交差条件トリプレット(三つ組)の必要性を回避するため、同一被写体の実際の(ID, スタイル)ペアのみを用いて二重条件ジェネレータを訓練する。
  • 多様なスタイル画像を含むスタイルバンクを活用し、アイデンティティの忠実度を保ちながら大規模なスタイル変動を実現する。
  • 合成データのラベル整合性が低いことを補うために、トレーニング中にラベルオーバースマピングを適用し、モデルの一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルを用いて、アイデンティティとスタイルの両方に条件付けた場合、多様でアイデンティティ一貫性のある顔画像を効果的に生成できるか?
  • RQ2アイデンティティとスタイルを別々に制御することで、従来のGAN や 3D ベースの手法と比較して、合成顔データセットの品質と多様性がどのように向上するか?
  • RQ3合成データのみで訓練された顔認識モデルが、実データで訓練されたモデルの性能にどの程度まで近づけるか?
  • RQ4提案された二重条件生成フレームワークは、合成データと実データの性能差をどのように縮小するか?
  • RQ5合成顔生成において、ラベル整合性、スタイル多様性、アイデンティティ忠実度の間にはどのようなトレードオフが存在するか?

主な発見

  • DCFceで生成された合成データセットは、LFW、CFP-FP、CPLFW、AgeDB、CALFWという5つのベンチマークデータセットのうち4つで、先行の最先端手法と比較して平均で6.11%高い認証精度を達成した。
  • 0.5M画像設定では、DCFceは前回のSoTAと比較して、実データとの性能差を57%縮小し、合成データ対実データの精度差を4.14%にまで低減した。
  • 1.2M画像設定では、差はさらに3.74%にまで低下し、前回の手法(9.55%の差)と比較して60.9%の改善を達成した。
  • 本モデルは20,000体の独自アイデンティティを有する100万枚以上の画像を生成し、各被写体に対して50種類の多様なスタイルバリエーションを提供しており、スケーラビリティと多様性の高さを示している。
  • 時間ステップに依存するID損失とパッチ単位のスタイル抽出器は、アブレーションスタディでアイデンティティの一貫性とスタイル分離の向上が明確に確認された。
  • トレーニング中にラベルオーバースマピングを適用することで、ランダムサンプリングと比較して性能が0.52%向上し、合成データの低いラベル整合性を補う有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。