Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Visual Quality Assessment of GAN-Generated Face Images

Yu Tian, Zhangkai Ni|arXiv (Cornell University)|Jan 28, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、畳み込みブロック注意(CBA)と顔の属性に基づく分析(ABA)を活用して、人間の知覚と整合する特徴を抽出することで、GANによって生成された顔画像(GFI)の一般化された視覚的品質評価のためのメタラーニングベースのモデル、AttGF-IQAを提案する。未学習のGANモデルに対して77.28%のSRCCおよび77.91%のPLCCを達成し、優れた一般化性能と人間の知覚の一貫性を示している。

ABSTRACT

Recent years have witnessed the dramatically increased interest in face generation with generative adversarial networks (GANs). A number of successful GAN algorithms have been developed to produce vivid face images towards different application scenarios. However, little work has been dedicated to automatic quality assessment of such GAN-generated face images (GFIs), even less have been devoted to generalized and robust quality assessment of GFIs generated with unseen GAN model. Herein, we make the first attempt to study the subjective and objective quality towards generalized quality assessment of GFIs. More specifically, we establish a large-scale database consisting of GFIs from four GAN algorithms, the pseudo labels from image quality assessment (IQA) measures, as well as the human opinion scores via subjective testing. Subsequently, we develop a quality assessment model that is able to deliver accurate quality predictions for GFIs from both available and unseen GAN algorithms based on meta-learning. In particular, to learn shared knowledge from GFIs pairs that are born of limited GAN algorithms, we develop the convolutional block attention (CBA) and facial attributes-based analysis (ABA) modules, ensuring that the learned knowledge tends to be consistent with human visual perception. Extensive experiments exhibit that the proposed model achieves better performance compared with the state-of-the-art IQA models, and is capable of retaining the effectiveness when evaluating GFIs from the unseen GAN algorithms.

研究の動機と目的

  • 未学習のGANモデルを含め、一般化可能で頑健かつ知覚と整合するGANによって生成された顔画像(GFI)の品質評価が不足しているという問題に対処すること。
  • 4つのGANから得られるGFI、品質順位付けのペア、および人間の評価スコアを含む大規模かつ多様なデータベース(GFID)を構築すること。
  • 異なるドメイン間で共有される、知覚に関連する特徴を学習することで、未学習のGANアーキテクチャからのGFIに対して効果的に一般化できる目的のIQAモデルを開発すること。
  • メタラーニングによるドメイン不変特徴学習と、専用モジュール(CBAおよびABA)を統合することで、人間の視覚的知覚との予測精度と一貫性を向上させること。

提案手法

  • 20万枚のトレーニング画像ペア(品質順にランク付け済み)と2,000枚のテスト画像(人間の平均評価スコア(MOS)でアノテーション済み)を含む大規模なGFIDデータベースを構築する。
  • 各ソースGANSからのGFIにおける品質関連の空間的特徴に注目するため、畳み込みブロック注意(CBA)を用いた新しいAttGF-IQAモデルを設計する。
  • 品質予測に役立つ知覚的に重要な属性(例:目、皮膚、対称性)を抽出・分析するため、顔の属性に基づく分析(ABA)モジュールを統合する。
  • 異なるGANSからのGFI間で共有されるドメイン不変の表現を学習するため、メタラーニング最適化戦略を採用し、未学習のドメインへの一般化を強化する。
  • 各エピソードで異なるGANSソースからのデータをサンプリングする少数ショット学習パラダイムを用いてモデルを訓練し、推論時に新しいGANSアーキテクチャへの適応を可能にする。
  • 検証段階で未学習のGANによって生成された画像の予測誤差を最小化するメタ最適化目的関数を用いてモデルを最適化し、ゼロショット一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、複数の未学習のGANアーキテクチャにわたって、GANによって生成された顔画像の一般化された品質評価を達成できるか?
  • RQ2CBAおよびABAモジュールは、GFIにおける知覚的に関連する歪みを検出する能力を向上させる上で、どのように寄与しているか?
  • RQ3標準的な最適化手法と比較して、メタラーニングは、未学習のGANによって生成された顔画像に対するIQAモデルの一般化性能をどの程度向上させるか?
  • RQ4提案されたAttGF-IQAモデルは、既存の最先端のIQA手法と比較して、人間の視覚的知覚とどの程度相関しているか?

主な発見

  • 提案されたAttGF-IQAモデルは、未学習のGANモデル(例:ProGAN、PENNet)に対して、スピアマン順位相関係数(SRCC)が0.7728、ピアソン線形相関係数(PLCC)が0.7791を達成し、ベースライン手法を顕著に上回っている。
  • メタラーニング戦略を用いたモデルは、未学習ドメイン全体でベースライン(メタラーニングなし)と比較して、SRCCが平均5.4%、PLCCが5.6%向上し、優れた一般化性能を示している。
  • CBAまたはABAモジュールを削除すると性能が低下し、SRCCは0.7396(CBAなし)および0.6923(ABAなし)に低下する。これにより、これらのモジュールが特徴学習において重要な役割を果たしていることが確認された。
  • AttGF-IQAモデルは、未学習のStyleGANに対して73.26%のSRCCおよび75.38%のPLCCを達成し、人間の知覚と強い整合性と頑健性を示している。
  • モデルは、さまざまなGANSアーキテクチャ(例:StyleGAN、StarGAN、ProGAN、PENNet)においても高い性能を維持しており、効果的なドメイン一般化を実証している。
  • アブレーションスタディにより、メタラーニングが一般化にとって不可欠であることが確認された。メタラーニングなしで訓練されたモデルは、未学習ドメインで顕著な性能低下を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。