Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Oracle Attention for High-fidelity Face Completion

Tong Zhou, Changxing Ding|arXiv (Cornell University)|2020. 03. 31.
Face recognition and analysis참고 문헌 38인용 수 4
한 줄 요약

이 논문은 고해상도 이미지 생성을 향상시키기 위해 오라클 감시와 다중 판별자 학습을 통한 이중 공간 주의(DSA) 모듈을 사용하는 새로운 얼굴 보완 프레임워크를 제안한다. 정확한 주의 점수를 강제로 적용하고 적대적 학습을 핵심 얼굴 구성 요소에 집중시킴으로써, CelebA-HQ 및 Flickr-Faces-HQ에서 최신 기술 수준의 성능을 달성하여 잡음과 질감의 현실감 및 대칭성을 크게 향상시킨다.

ABSTRACT

High-fidelity face completion is a challenging task due to the rich and subtle facial textures involved. What makes it more complicated is the correlations between different facial components, for example, the symmetry in texture and structure between both eyes. While recent works adopted the attention mechanism to learn the contextual relations among elements of the face, they have largely overlooked the disastrous impacts of inaccurate attention scores; in addition, they fail to pay sufficient attention to key facial components, the completion results of which largely determine the authenticity of a face image. Accordingly, in this paper, we design a comprehensive framework for face completion based on the U-Net structure. Specifically, we propose a dual spatial attention module to efficiently learn the correlations between facial textures at multiple scales; moreover, we provide an oracle supervision signal to the attention module to ensure that the obtained attention scores are reasonable. Furthermore, we take the location of the facial components as prior knowledge and impose a multi-discriminator on these regions, with which the fidelity of facial components is significantly promoted. Extensive experiments on two high-resolution face datasets including CelebA-HQ and Flickr-Faces-HQ demonstrate that the proposed approach outperforms state-of-the-art methods by large margins.

연구 동기 및 목표

  • 복잡한 얼굴 질감과 구조적 상관관계로 인해 발생하는 고해상도 얼굴 보완의 과제를 해결한다.
  • 기존 주의 기반 방법에서 발생하는 부정확한 주의 점수로 인한 잡음과 의미적 일관성 없는 문제를 해결한다.
  • 지표점 사전 지식과 타겟팅된 판별자를 활용해 눈, 코, 입과 같은 핵심 얼굴 구성 요소의 정밀도를 향상시킨다.
  • 오라클 감시를 통해 주의 메커니즘의 신뢰성을 확보하여 보완 과정에서 특징 선택을 안내한다.
  • 고해상도 데이터셋에서 최신 기술 수준의 방법들과 비교해 뛰어난 시각적 품질과 정량적 성능을 달성한다.

제안 방법

  • 다중 스케일에서 픽셀 수준의 상관관계를 모델링하기 위해 전경 자기 주의와 전경-배경 상호 주의를 결합한 이중 공간 주의(DSA) 모듈을 제안한다.
  • 주의 점수를 제약하여 의미적으로 유의미하고 생성된 질감에서 환각 현상을 줄이는 오라클 감시 신호를 도입한다.
  • 실제 이미지의 얼굴 지표점을 사전 지식으로 활용해 네 가지 핵심 얼굴 구성 요소를 식별하고 국소화하여 타겟팅된 정밀 조정을 수행한다.
  • 네 가지 얼굴 구성 요소 각각에 대해 별도의 판별자를 배치하여 적대적 학습을 통해 고해상도 질감 생성을 강화한다.
  • DSA 모듈과 다중 판별자를 U-Net 기반 생성자에 통합하며, 추론 시에는 판별자를 제거하여 효율성을 유지한다.
  • 주의 맵에 특별히 감시를 적용하여 신뢰성 향상을 도모하고, 인지적 손실과 적대적 손실을 사용해 모델을 종합적으로 훈련시킨다.

실험 결과

연구 질문

  • RQ1오라클 감시 주의 학습은 부정확한 주의 점수로 인한 잡음을 줄이기 위해 특징 선택의 신뢰성을 향상시키는가?
  • RQ2눈, 코, 입과 같은 핵심 얼굴 구성 요소에 집중한 적대적 학습은 전반적 또는 국소적 판별자만을 사용하는 것보다 더 높은 질감 정밀도를 달성하는가?
  • RQ3픽셀 수준의 상관관계 모델링을 수행하는 이중 공간 주의는 패치 기반 주의 메커니즘보다 얼굴 대칭성과 세부 정보를 더 잘 유지하는가?
  • RQ4지표점 기반 사전 지식의 통합은 생성된 얼굴 구성 요소의 공간 정렬성과 현실감을 어떻게 향상시키는가?
  • RQ5다중 판별자 전략은 추론 속도를 저하시키지 않으면서도 고주파 질감 세부 정보를 향상시키는가?

주요 결과

  • 제안된 방법은 CelebA-HQ 및 Flickr-Faces-HQ에서 최신 기술 수준의 성능을 달성하여 정량적·정성적 평가에서 이전 방법들을 능가한다.
  • 오라클 감시를 통한 DSA 모듈은 눈 사이의 색조 불일치나 코 및 입 부위의 질감 왜곡과 같은 잡음을 감소시킨다.
  • 정량적 결과에서, 주의 맵에 감시를 적용한 경우 CelebA-HQ에서 PSNR는 26.23에서 26.36으로 향상되었고, SSIM은 0.9062에서 0.9107로 상승하였으며, LPIPS는 0.0706(감시) 대비 0.0726(비감시)로 낮아져 더 나은 인지적 품질을 나타낸다.
  • 다중 판별자 설정은 특히 얼굴 구성 요소에서 질감의 선명도와 현실감을 크게 향상시키며, 시각적 비교 및 확대 분석을 통해 이를 입증한다.
  • 추론 시 판별자를 제거함으로써 추론 효율성을 유지하여 성능 오버헤드 없이 작동한다.
  • 절단 실험 결과, 주의에 대한 오라클 감시와 구성 요소별 전용 판별자가 고해상도 결과를 달성하는 데 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.