Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Visual Quality Assessment of GAN-Generated Face Images

Yu Tian, Zhangkai Ni|arXiv (Cornell University)|2022. 01. 28.
Face recognition and analysis인용 수 5
한 줄 요약

이 논문은 GAN으로 생성된 얼굴 이미지(GFIs)에 대한 일반화된 시각적 품질 평가를 위한 메타학습 기반 모델인 AttGF-IQA를 제안한다. 이는 순환 블록 주의(CBA)와 얼굴 속성 기반 분석(ABA)을 활용하여 인지에 부합하는 특징을 추출한다. 제안된 모델는 미리 보지 않은 GAN 모델에서 77.28%의 SRCC와 77.91%의 PLCC를 기록하여 최신 기술 수준의 성능을 달성하며, 강력한 일반화 능력과 인간의 인지 일치성을 입증한다.

ABSTRACT

Recent years have witnessed the dramatically increased interest in face generation with generative adversarial networks (GANs). A number of successful GAN algorithms have been developed to produce vivid face images towards different application scenarios. However, little work has been dedicated to automatic quality assessment of such GAN-generated face images (GFIs), even less have been devoted to generalized and robust quality assessment of GFIs generated with unseen GAN model. Herein, we make the first attempt to study the subjective and objective quality towards generalized quality assessment of GFIs. More specifically, we establish a large-scale database consisting of GFIs from four GAN algorithms, the pseudo labels from image quality assessment (IQA) measures, as well as the human opinion scores via subjective testing. Subsequently, we develop a quality assessment model that is able to deliver accurate quality predictions for GFIs from both available and unseen GAN algorithms based on meta-learning. In particular, to learn shared knowledge from GFIs pairs that are born of limited GAN algorithms, we develop the convolutional block attention (CBA) and facial attributes-based analysis (ABA) modules, ensuring that the learned knowledge tends to be consistent with human visual perception. Extensive experiments exhibit that the proposed model achieves better performance compared with the state-of-the-art IQA models, and is capable of retaining the effectiveness when evaluating GFIs from the unseen GAN algorithms.

연구 동기 및 목표

  • 특히 미리 보지 않은 GAN 모델에 대해 일반화되고 강건하며 인지에 부합하는 GAN 생성 얼굴 이미지(GFIs)의 품질 평가가 부족한 문제를 해결하기 위해.
  • 네 가지 GAN에서 생성된 GFIs, 품질 순위 매겨진 데이터, 인간 평가 점수를 포함하는 대규모이고 다양한 데이터베이스(GFID)를 구축하기 위해.
  • 다양한 도메인 간 공유되는, 인지적으로 관련 있는 특징을 학습하여, 새로운 GAN 아키텍처에서 생성된 GFIs에 대해 효과적으로 일반화되는 객관적 IQA 모델을 개발하기 위해.
  • 메타학습과 전용 모듈(CBA 및 ABA)을 통한 도메인 불변 특징 학습을 통합하여 인간의 시각적 인지와의 일치도를 향상시키고 예측 정확도를 높이기 위해.

제안 방법

  • 20만 개의 훈련 이미지 쌍(품질 순으로 랭킹됨)과 인간 평균 평가 점수(MOS)로 주석 처리된 2,000개의 테스트 이미지를 포함하는 대규모 GFID 데이터베이스를 구축한다.
  • 각 소스 GAN에서 온 GFIs의 품질 관련 공간적 특징을 강조하기 위해 순환 블록 주의(CBA)를 활용하는 새로운 AttGF-IQA 모델을 설계한다.
  • 품질 예측을 위해 인지적으로 중요한 속성(예: 눈, 피부, 대칭성 등)을 추출하고 분석하기 위해 얼굴 속성 기반 분석(ABA) 모듈을 통합한다.
  • 다른 GAN들에서 온 GFIs 간의 공통 도메인 불변 표현을 학습하여, 새로운 도메인으로의 일반화 능력을 향상시키기 위해 메타학습 최적화 전략을 적용한다.
  • 각 에피소드에서 다른 GAN 소스에서 데이터를 샘플링하는 소수 학습 파рад림을 사용하여, 추론 시 새로운 GAN 아키텍처에 적응할 수 있도록 모델을 훈련한다.
  • 검증 단계에서 새로운 GAN으로 생성된 이미지의 예측 오차를 최소화하는 메타최적화 목표를 사용하여 모델을 최적화함으로써 제로샷 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 여러 개의 새로운 GAN 아키텍처에서 생성된 GAN 생성 얼굴 이미지에 대해 일반화된 품질 평가를 달성할 수 있는가?
  • RQ2CBA 및 ABA 모듈은 GFIs의 인지적으로 관련 있는 왜곡을 탐지하는 데 모델의 능력에 어떻게 기여하는가?
  • RQ3표준 최적화 방법에 비해 메타학습은 새로운 GAN 생성 얼굴 이미지에 대한 IQA 모델의 일반화 성능을 얼마나 향상시키는가?
  • RQ4기존 최신 기술 수준의 IQA 방법에 비해 제안된 AttGF-IQA 모델은 인간의 시각적 인지와 얼마나 잘 일치하는가?

주요 결과

  • 제안된 AttGF-IQA 모델은 새로운 GAN 모델(예: ProGAN, PENNet)에서 스피어만 순서상관계수(SRCC) 0.7728과 피어슨 선형상관계수(PLCC) 0.7791을 기록하여 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 메타학습 전략을 적용한 모델는 새로운 도메인에서 기준 모델(메타학습 없음) 대비 평균적으로 SRCC 5.4% 향상 및 PLCC 5.6% 향상하여 강력한 일반화 능력을 입증했다.
  • CBA 또는 ABA 모듈을 제거할 경우 성능 저하가 발생하여, SRCC는 0.7396(CBA 없음)로 떨어지고, 0.6923(ABA 없음)로 감소하여 이들이 특징 학습에서 핵심적인 역할을 한다는 것을 확인했다.
  • AttGF-IQA 모델은 새로운 StyleGAN에서 73.26%의 SRCC와 75.38%의 PLCC를 기록하여 강력한 내구성과 인간 인지와의 일치성을 입증했다.
  • 모델는 다양한 GAN 아키텍처(예: StyleGAN, StarGAN, ProGAN, PENNet)에서 높은 성능을 유지하여 효과적인 도메인 일반화 능력을 입증했다.
  • 제거 실험 결과, 메타학습이 일반화에 필수적임을 확인하였으며, 이를 훈련하지 않은 모델은 새로운 도메인에서 성능 저하가 심각하게 발생했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.