Skip to main content
QUICK REVIEW

[논문 리뷰] FaceFormer: Scale-aware Blind Face Restoration with Transformers

Aijin Li, Gen Li|arXiv (Cornell University)|2022. 07. 20.
Face recognition and analysis인용 수 4
한 줄 요약

FaceFormer는 새로운 얼굴 특징 업샘플링(FFUP) 모듈과 계층적 트랜스포머 기반 얼굴 특징 임베딩(FFE) 모듈을 사용하여 다양한 입력 스케일에서 고해상도이자 현실적이며 대칭적인 얼굴 복원을 가능하게 하는 스케일 인식형 블라인드 얼굴 복원 프레임워크를 제안한다. 합성 데이터로 훈련된 FaceFormer는 기존 최고 수준의 방법들보다 실제 저품질 이미지에 더 잘 일반화된다.

ABSTRACT

Blind face restoration usually encounters with diverse scale face inputs, especially in the real world. However, most of the current works support specific scale faces, which limits its application ability in real-world scenarios. In this work, we propose a novel scale-aware blind face restoration framework, named FaceFormer, which formulates facial feature restoration as scale-aware transformation. The proposed Facial Feature Up-sampling (FFUP) module dynamically generates upsampling filters based on the original scale-factor priors, which facilitate our network to adapt to arbitrary face scales. Moreover, we further propose the facial feature embedding (FFE) module which leverages transformer to hierarchically extract diversity and robustness of facial latent. Thus, our FaceFormer achieves fidelity and robustness restored faces, which possess realistic and symmetrical details of facial components. Extensive experiments demonstrate that our proposed method trained with synthetic dataset generalizes better to a natural low quality images than current state-of-the-arts.

연구 동기 및 목표

  • 기존 얼굴 복원 방법들이 특정 입력 스케일에 국한되어 있어, 특히 다양한 왜곡을 겪은 실제 시나리오에서의 적용에 한계가 있다는 점을 해결하기 위해.
  • 스케일 인식 특징 학습과 계층적 어텐션 메커니즘을 활용하여 복원 정확도와 강건성을 향상시키기 위해.
  • 지상 진짜 왜곡 사전 지식에 의존하지 않고도 합성 훈련 데이터에서 실제 저품질 얼굴 이미지로의 일반화를 가능하게 하기 위해.
  • 극도의 확대나 심각한 왜곡 조건에서도 정체성 일관성과 눈동자, 눈썹, 속눈썹과 같은 현실적인 얼굴 세부 사항을 유지하기 위해.

제안 방법

  • 얼굴 특징 업샘플링(FFUP) 모듈은 입력 스케일 요소 사전 지식에 기반해 스케일 인식형 업샘플링 필터를 동적으로 생성하여 고정된 해상도 제약 없이 임의의 스케일에서 얼굴 복원을 가능하게 한다.
  • 얼굴 특징 임베딩(FFE) 모듈은 겹치지 않는 국소 창문과 창문 간 연결을 갖춘 계층적 트랜스포머 아키텍처를 사용하여 다양한 임베딩 특징을 추출한다.
  • 이 프레임워크는 FFUP과 FFE를 통합한 유일한 얼굴 복원 파이프라인 내에서 스케일 인식 특징 정련과 어텐션 기반 특징 향상을 결합한다.
  • 스케일 인식 특징을 향상시키기 위해 분수 샘플러를 갖춘 초해상도 백본을 활용하여 FFE 및 생성기 모듈에 입력하기 전에 특징를 정제한다.
  • FFE 모듈은 계층적으로 다중 헤드 자기어텐션을 통해 장거리 의존성과 국소 얼굴 구성 요소의 구조를 모델링함으로써 특징 표현을 향상시킨다.
  • 전체 프레임워크는 합성 데이터셋에서 엔드 투 엔드로 훈련되며, 미세조정 없이도 실제 저품질 이미지로 효과적으로 일반화된다.

실험 결과

연구 질문

  • RQ1고정된 해상도 입력이 필요하지 않은 채로, 블라인드 얼굴 복원 모델이 다양한 입력 스케일에서 효과적으로 일반화될 수 있는가?
  • RQ2스케일 인식 업샘플링 메커니즘이 극도의 확대 조건에서 복원 품질을 향상시키고 잡음과 기하학적 왜곡을 줄이는 데 어떤 기여를 하는가?
  • RQ3계층적 트랜스포머 기반 특징 임베딩 모듈이 복원된 얼굴 구성 요소의 정확도와 현실감을 어느 정도 향상시키는가?
  • RQ4합성 데이터로 훈련되었음에도 불구하고, 실제 저품질 얼굴 이미지에서 최고 수준의 방법들을 능가하는가?

주요 결과

  • FaceFormer는 LFW-test 및 CelebChild와 같은 실제 데이터셋에서 최고 성능을 기록했으며, CelebA-Test에서 FID는 13.17, LPIPS는 0.3237을 기록하여 이전 방법들을 능가했다.
  • 제거 실험 결과, FFUP 모듈을 제거할 경우 LPIPS는 0.0265 증가하고 FID는 4.65 증가하여, 인지적 품질과 정체성 유지 측면에서 심각한 성능 저하가 발생함을 확인했다.
  • FFE 모듈을 제거할 경우 FID는 42.62로 급격히 증가하고 LPIPS는 0.3646으로 상승하여 얼굴의 구조와 세부 사항의 정확도를 유지하는 데 핵심적인 역할을 함을 입증했다.
  • 극도의 확대 비율(×6.0 및 ×8.0) 조건에서 FaceFormer는 GFP-GAN보다 더 뛰어난 인지적 성능을 보였으며, 눈썹이 더 선명하고 피부 질감이 더 현실적으로 구현되었다.
  • 정성 있는 결과의 4행을 보면, 눈동자 색상이 일관되게 유지됨을 확인할 수 있어 강력한 정체성 일관성을 보여준다.
  • 시각적 비교 결과, FaceFormer는 HiFaceGAN 및 Wan 등 일부 방법에서 흔히 발생하는 투명한 잡음과 흐림 현상을 피했으며, 특히 눈과 입 부위에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.