[논문 리뷰] Universal Face Restoration With Memorized Modulation
이 논문은 잡음과 비지도 웨이블릿 메모리에서 유도된 적응형 주의 메커니즘을 사용하여 다양한 저품질 얼굴 이미지를 복원하는 새로운 유니버설 얼굴 복원 프레임워크인 Memorized Modulation을 제안한다(RMM). 학습 가능한 잡음 사전, 웨이블릿 기반 고주파 수복 텍스처 메모리, 다중 수준 정규화 지도(AdaAO, AdaALN, AdaAIN)를 통합함으로써 RMM는 합성 및 실제 세계의 복잡한 복원 패턴에서 최고 성능을 달성하며, 만화, 유화, NIR 이미지 등 이질적인 도메인 간에도 강력한 일반화 능력을 보여준다.
Blind face restoration (BFR) is a challenging problem because of the uncertainty of the degradation patterns. This paper proposes a Restoration with Memorized Modulation (RMM) framework for universal BFR in diverse degraded scenes and heterogeneous domains. We apply random noise as well as unsupervised wavelet memory to adaptively modulate the face-enhancement generator, considering attentional denormalization in both layer and instance levels. Specifically, in the training stage, the low-level spatial feature embedding, the wavelet memory embedding obtained by wavelet transformation of the high-resolution image, as well as the disentangled high-level noise embeddings are integrated, with the guidance of attentional maps generated from layer normalization, instance normalization, and the original feature map. These three embeddings are respectively associated with the spatial content, high-frequency texture details, and a learnable universal prior against other blind image degradation patterns. We store the spatial feature of the low-resolution image and the corresponding wavelet style code as key and value in the memory unit, respectively. In the test stage, the wavelet memory value whose corresponding spatial key is the most matching with that of the inferred image is retrieved to modulate the generator. Moreover, the universal prior learned from the random noise has been memorized by training the modulation network. Experimental results show the superiority of the proposed method compared with the state-of-the-art methods, and a good generalization in the wild.
연구 동기 및 목표
- 흐림, 잡음, 압축 등 알려지지 않은 다양한 복잡한 복원 패턴에서 빌드인 얼굴 복원(BFR) 문제를 해결한다.
- 고품질 레퍼런스나 외부 모델에 의존하는 기존 방법의 한계를 극복하기 위해 추론 시 고품질 레퍼런스나 외부 모델을 필요로 하지 않는다.
- 실제 세계, 만화, 예술적 얼굴 이미지 등 이질적인 도메인 전반에 걸쳐 일반화 가능한 통합 프레임워크를 개발한다.
- 웨이블릿 변환된 특징에서 고주파 수복 텍스처 세부 정보를 저장하고 검색하는 메모리 증강 메커니즘을 도입한다.
- 주의 지도 기반 특징 조절을 통해 공간적 콘텐츠, 텍스처 세부 정보, 유니버설 잡음 사전를 동시에 모델링하여 복원 정밀도를 향상시킨다.
제안 방법
- 원본 특징, 레이어 정규화 특징, 인스턴스 정규화 특징에서 유도된 세 가지 적응형 주의 맵(AdaAO, AdaALN, AdaAIN)을 사용하는 RMM 모듈(RM³)을 제안하여 특징 조절을 이끌어낸다.
- 다중 수준 복원 제어를 위해 저수준 공간적 특징(콘텐츠), 고주파 웨이블릿 계수(텍스처), 분리된 잡음 임bedding(유니버설 사전)의 세 가지 임베딩을 통합한다.
- 저해상도 공간적 특징을 키로, 웨이블릿 스타일 코드를 값으로 저장하는 웨이블릿 메모리 모듈(WMM)을 구현하여 추론 시 일치하는 고주파 세부 정보를 검색할 수 있도록 한다.
- 고정된 잠재 크기의 랜덤 잡음을 사용하여 해상도에 의존하지 않는 유니버설 사전를 정의하고, 이를 끝에서 끝까지 학습 가능한 조절 네트워크를 통해 생성자에 조절하게 한다.
- 주의 맵을 사용하여 복원기의 여러 디코더 단계에서 적응형 특징 조절을 적용하여 구조적 무결성과 텍스처 세부 정보 복원 간의 균형을 동적으로 조절한다.
- 추론 중 공간적 특징 유사도 기반으로 메모리 검색을 수행하며, 적대적 손실과 인지적 손실을 사용해 모델을 엔드 투 엔드로 훈련시킨다.
실험 결과
연구 질문
- RQ1고품질 레퍼런스 이미지를 필요로 하지 않고도 다양한 알려지지 않은 복원 패턴에서 뛰어난 성능을 달성할 수 있는 통합 얼굴 복원 프레임워크가 가능한가?
- RQ2비지도 웨이블릿 메모리는 빌드인 얼굴 복원 과정에서 고주파 텍스처 세부 정보를 얼마나 효과적으로 유지하는가?
- RQ3학습 가능한 해상도에 의존하지 않는 잡음 사전는 빌드인 얼굴 복원에서 일반화 능력을 얼마나 향상시키는가?
- RQ4원본, 레이어 정규화, 인스턴스 정규화에서 유도된 다중 수준 주의 맵은 구조적 복원과 텍스처 복원 간의 균형을 어떻게 기여하는가?
- RQ5제안된 메모리화된 조절 메커니즘은 만화, 연필 스케치, NIR 이미지 등 이질적인 도메인으로 일반화 가능한가?
주요 결과
- FF-HQ 데이터셋에서 RMM는 모든 변형 중에서 가장 낮은 FID(100.61), KID(8.24), NIQE(4.54) 점수를 기록하며 최고의 성능을 보였다. 이는 깊은 VGG 레이어에서의 웨이블릿 분해를 사용한 모델보다 뛰어난 성능을 의미한다.
- 입력 이미지에 웨이블릿 패킷 분해를 적용한 변형(RMM)이 NIQE(4.54)는 가장 낮고 FID(100.61)는 가장 낮아, 더 뛰어난 인지적 품질과 정밀도를 보였다.
- 얕은 레이어 특징(예: conv1_1)을 사용한 웨이블릿 분해는 NIQE(4.29)는 가장 우수하지만 FID(109.41)와 KID(9.29)는 열악하여, 인지적 품질과 구조적 정확도 사이의 상충 관계를 보여준다.
- 깊은 레이어(예: ResNet18 레이어 0, 2, 4, 6)에서 유도된 쿼리 벡터는 RMM보다 높은 FID와 KID 점수(106.9–107.33)를 기록하여 얕은 레이어 쿼리가 공간적 특징 매칭에 덜 효과적임을 시사한다.
- 절단 실험 결과, 잡음 조절($w/o ext{ }Z_N$)과 웨이블릿 메모리($w/o ext{ }Z_W$) 모두 성능 저하를 야기함을 확인하여, 둘 다 훈련 및 추론에서 필수적인 역할을 한다는 것을 입증한다.
- 만화 얼굴가 실제 얼굴과 유사한 눈 크기를 가진 경우나 극단적인 메이크업이 있는 경우, 스타일러드 특징 손실이나 얼굴 구성 요소 복원의 비일치가 발생하는 실패 케이스가 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.