[논문 리뷰] Progressive Semantic-Aware Style Transformation for Blind Face Restoration
이 논문은 다중 해상도의 저품질(LQ) 이미지와 파싱 맵을 활용하여 근본적으로 복원되지 않은 얼굴 이미지를 군집에서 세분화된 방식으로 고품질(HQ) 얼굴으로 복원하는 프로그레시브 세밀도 인식 스타일 변환 프레임워크인 PSFR-GAN을 제안한다. 세밀도 인식 스타일 손실과 사전 훈련된 얼굴 파싱 네트워크를 통합함으로써, 실제 저품질 이미지에 대해 최신 기술 수준의 일반화 성능을 달성하여 세부 사항 복원과 잡음 감소에서 이전 방법들을 능가한다.
Face restoration is important in face image processing, and has been widely studied in recent years. However, previous works often fail to generate plausible high quality (HQ) results for real-world low quality (LQ) face images. In this paper, we propose a new progressive semantic-aware style transformation framework, named PSFR-GAN, for face restoration. Specifically, instead of using an encoder-decoder framework as previous methods, we formulate the restoration of LQ face images as a multi-scale progressive restoration procedure through semantic-aware style transformation. Given a pair of LQ face image and its corresponding parsing map, we first generate a multi-scale pyramid of the inputs, and then progressively modulate different scale features from coarse-to-fine in a semantic-aware style transfer way. Compared with previous networks, the proposed PSFR-GAN makes full use of the semantic (parsing maps) and pixel (LQ images) space information from different scales of input pairs. In addition, we further introduce a semantic aware style loss which calculates the feature style loss for each semantic region individually to improve the details of face textures. Finally, we pretrain a face parsing network which can generate decent parsing maps from real-world LQ face images. Experiment results show that our model trained with synthetic data can not only produce more realistic high-resolution results for synthetic LQ inputs and but also generalize better to natural LQ face images compared with state-of-the-art methods. Codes are available at https://github.com/chaofengc/PSFRGAN.
연구 동기 및 목표
- 이면이 알려져 있지 않고 다양한 종류의 열화가 발생하는 실제 환경에서의 블라인드 얼굴 복원 문제를 해결하기 위해.
- 다중 해상도에서 세밀도(파싱 맵)와 픽셀 수준(LQ 이미지) 정보를 모두 활용하여 저품질 입력에서 고품질 얼굴 생성을 향상시키기 위해.
- 고품질 기준 이미지가 필요 없이 자연스럽고 실제 저품질 얼굴 이미지에 대해 잘 일반화되는 실용적인 프레임워크를 개발하기 위해.
- 새로운 손실 함수를 통해 복원된 얼굴 영역의 잡음 감소와 질감의 현실감 향상을 위해.
제안 방법
- 모델은 학습된 일정 잠재 코드에서 시작하여 점진적으로 증폭되는 특징을 통해 다중 해상도 아키텍처를 사용한다.
- 각 해상도에서 세밀도 인식 스타일 조절을 적용하며, 스타일 벡터는 다중 해상도의 LQ 이미지와 파싱 맵으로부터 생성되어 특징 정제를 조절한다.
- 세밀도 인식 스타일 손실은 얼굴의 각 세밀도 영역별로 독립적으로 그램 행렬 손실을 계산하여 질감의 현실감을 향상시키고 잡음을 감소시킨다.
- 모델은 합성 데이터에서 훈련되며, 사전 훈련된 얼굴 파싱 네트워크(FPN)의 사용 덕분에 실제 저품질 이미지로 효과적으로 일반화된다.
- FPN은 실제 저품질 얼굴 이미지에서 파싱 맵을 예측하도록 훈련되어, 테스트 시 고유의 LQ 입력만으로도 엔드 투 엔드 추론이 가능하다.
- 전체 프레임워크는 점진적인 특징 조절과 영역별 스타일 손실을 결합하여 구조적 일致성과 질감 충실도를 향상시킨다.
실험 결과
연구 질문
- RQ1점진적이고 다중 해상도의 스타일 변환 프레임워크는 종단 간 인코더-디코더 모델을 초월하여 블라인드 얼굴 복원을 향상시킬 수 있는가?
- RQ2파싱 맵을 세밀도 가이드로 통합할 경우 복원된 얼굴 이미지의 품질과 현실감에 어떤 영향을 미치는가?
- RQ3영역별 세밀도 인식 스타일 손실은 다양한 얼굴 영역에서 질감 세부 사항 향상과 잡음 감소에 어느 정도 기여하는가?
- RQ4합성 데이터에서 훈련된 모델은 고품질 기준 이미지 없이도 실제 저품질 얼굴 이미지에 효과적으로 일반화될 수 있는가?
주요 결과
- PSFR-GAN은 PSFR-RealTest 벤치마크에서 FID 30.39를 기록하여 기준 모델(FID 47.48)과 다른 변종들보다 뛰어난 성능을 보였다.
- 절단 실험 결과, 파싱 맵 가이드와 세밀도 인식 스타일 손실을 결합하면 가장 우수한 성능을 내며 기준 모델 대비 FID를 17.11점 감소시켰다.
- 시각적 결과에서는 파싱 맵이 없는 모델은 특히 LQ 입력이 흐릿한 경우 명확한 얼굴 윤곽을 복원하지 못하는 것으로 나타났다.
- 세밀도 인식 스타일 손실이 없는 모델은 눈 부위에서 뚜렷한 잡음을 유발하는 반면, PSFR-GAN은 이러한 왜곡을 효과적으로 억제했다.
- 프레임워크는 최대 ×16의 확대 비율까지 강건하게 일반화되며, 고도의 열화 수준에서도 시각적으로 타당한 결과를 제공했다.
- 사전 훈련된 얼굴 파싱 네트워크(FPN)는 실제 저품질 이미지에서 강력한 강건성을 보이며, 고유의 LQ 입력만으로도 실용적인 구현을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.