Skip to main content
QUICK REVIEW

[논문 리뷰] VQFR: Blind Face Restoration with Vector-Quantized Dictionary and Parallel Decoder

Yuchao Gu, Xintao Wang|arXiv (Cornell University)|2022. 05. 13.
Face recognition and analysis인용 수 7
한 줄 요약

VQFR는 고품질의 얼굴 세부 정보 사전으로 사용되는 벡터 양자화(VQ) 코드북과 정렬된 디코더, 텍스처 왜곡 모듈을 활용하여 신뢰성 있는 신원과 얼굴의 정밀도를 유지하는 빈도 없는 얼굴 복원 방법을 제안한다. 입력 특징을 오염 없이 융합하고 종합적인 저수준 특징 베이스를 엔드 투 엔드로 학습함으로써, VQFR는 합성 및 실제 환경 기준에서 얼굴 세부 정보의 현실성과 정밀도 측면에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Although generative facial prior and geometric prior have recently demonstrated high-quality results for blind face restoration, producing fine-grained facial details faithful to inputs remains a challenging problem. Motivated by the classical dictionary-based methods and the recent vector quantization (VQ) technique, we propose a VQ-based face restoration method - VQFR. VQFR takes advantage of high-quality low-level feature banks extracted from high-quality faces and can thus help recover realistic facial details. However, the simple application of the VQ codebook cannot achieve good results with faithful details and identity preservation. Therefore, we further introduce two special network designs. 1). We first investigate the compression patch size in the VQ codebook and find that the VQ codebook designed with a proper compression patch size is crucial to balance the quality and fidelity. 2). To further fuse low-level features from inputs while not "contaminating" the realistic details generated from the VQ codebook, we proposed a parallel decoder consisting of a texture decoder and a main decoder. Those two decoders then interact with a texture warping module with deformable convolution. Equipped with the VQ codebook as a facial detail dictionary and the parallel decoder design, the proposed VQFR can largely enhance the restored quality of facial details while keeping the fidelity to previous methods.

연구 동기 및 목표

  • 알 수 없는 열화 조건 하에서 빈도 없는 얼굴 복원에서 미세한 얼굴 세부 정보를 복원하는 데 도전한다.
  • 기존 방법이 특히 털과 섬세한 얼굴 구성 요소에서 신원을 유지하지 못하고 현실적인 텍스처를 생성하지 못하는 한계를 극복한다.
  • 고립된 구성 요소가 아닌 모든 얼굴 영역의 종합적인 저수준 특징을 포괄하는 VQ 기반의 얼굴 세부 정보 사전을 개발한다.
  • 입력 특징과 VQ로 생성된 텍스처를 손상 없이 융합하는 병렬 디코더 아키텍처와 텍스처 왜곡 모듈을 설계한다.
  • 실제 복잡한 열화 조건에서 시각적 품질과 신원 유지 간의 균형을 달성한다.

제안 방법

  • 압축 패치 크기 f=32를 사용하여 최적의 품질-정밀도 균형을 확보하기 위해, 고해상도 얼굴 이미지에서 고품질 얼굴 세부 정보 사전을 엔드 투 엔드로 학습하는 VQ 코드북을 구축한다.
  • 주 디코더와 텍스처 디코더로 구성된 병렬 디코더 아키텍처를 도입하여 입력 특징과 VQ로 생성된 특징을 별도로 처리한 후 융합한다.
  • 이완형 컨볼루션을 사용하여 VQ 코드북의 고주파 세부 정보를 열화된 입력의 공간적 구조와 동적으로 정렬하는 텍스처 왜곡 모듈을 설계한다.
  • 다양한 디코더 단계에서 열화된 이미지의 입력 특징과 VQ로 생성된 특징을 융합하여 신원과 표정 정확도를 유지한다.
  • 실제성과 세부 정보 정밀도를 향상시키기 위해 시각적, 적대적, 재구성 손실의 조합으로 모델을 훈련한다.
  • VQ 코드북은 이산 잠재 공간에서 얼굴 패치를 표현하도록 최적화되어 있어, 세부 정보 복원을 위한 효율적이고 강력한 특징 검색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드로 학습된 벡터 양자화 코드북이 구성 요소별 사전을 초월해 효과적인 얼굴 세부 정보 사전으로 기능할 수 있는가?
  • RQ2VQ 코드북의 압축 패치 크기 선택이 시각적 품질과 신원 정밀도 간의 균형에 미치는 영향은 어떠한가?
  • RQ3병렬 디코더 아키텍처가 저수준 입력 특징과 고품질 VQ로 생성된 특징을 손상 없이 효과적으로 융합할 수 있는가?
  • RQ4이완형 컨볼루션을 활용한 텍스처 왜곡 모듈이 심각한 열화 조건에서도 복원된 세부 정보와 입력 기하학적 구조 간의 정렬을 향상시키는가?
  • RQ5VQFR는 복잡하고 알려지지 않은 열화 조건을 가진 실제 데이터셋에 대해 얼마나 잘 일반화되며, 고정밀도 시각적 품질과 신원 유지 능력을 유지할 수 있는가?

주요 결과

  • VQFR는 CelebA-Test에서 FID 41.28을 기록하여 GFP-GAN과 DFDNet을 모두 초월하는 시각적 품질과 신원 정밀도를 확보한다.
  • 특징점 거리가 2.43으로 감소하여 표정과 얼굴 구조의 강력한 유지 능력을 보이며, GFP-GAN과 유사한 성능을 기록한다.
  • 병렬 디코더와 텍스처 왜곡 모듈을 통해 NIQE가 3.693으로 감소하여 기준 모델 대비 고주파 세부 정보 복원 능력이 뛰어나다.
  • 실제 세계 데이터셋(LFW-Test, CelebChild-Test, WebPhoto-Test)에서 VQFR는 시각적 품질과 현실성 측면에서 뚜렷한 성능 향상을 보이며, 정밀도에서 PULSE와 GFP-GAN을 모두 능가한다.
  • 절단 실험 결과, 입력 특징과 병렬 디코더가 핵심 요소임을 확인: 이를 제거할 경우 특징점 거리가 10% 증가하고 세부 정보 손실이 발생한다.
  • f=32로 설정된 VQ 코드북이 현실성과 정밀도 사이의 최적 균형을 달성한다. 더 큰 패치 크기일수록 시각적 품질은 향상되지만 신원 유지 능력은 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.