[논문 리뷰] Old Photo Restoration via Deep Latent Space Translation
이 논문은 실사 이미지, 합성 쌍, 청소년 기준 이미지를 활용하여 심각하게 열악한 상태로 손상된 오래된 사진을 복원하기 위한 딥 랜덤 스페이스 번역 프레임워크를 제안한다. 변동형 오토인코더를 사용하여 랜덤 스페이스 내에서 도메인을 정렬하고, 구조적인 결함을 위해 부분적 비국소 블록을 적용하며, 고해상도 초상화를 위한 코arse-to-fine 얼굴 정밀화 네트워크를 사용하여 최신 기술 수준의 인지적 품질을 달성한다.
We propose to restore old photos that suffer from severe degradation through a deep learning approach. Unlike conventional restoration tasks that can be solved through supervised learning, the degradation in real photos is complex and the domain gap between synthetic images and real old photos makes the network fail to generalize. Therefore, we propose a novel triplet domain translation network by leveraging real photos along with massive synthetic image pairs. Specifically, we train two variational autoencoders (VAEs) to respectively transform old photos and clean photos into two latent spaces. And the translation between these two latent spaces is learned with synthetic paired data. This translation generalizes well to real photos because the domain gap is closed in the compact latent space. Besides, to address multiple degradations mixed in one old photo, we design a global branch with apartial nonlocal block targeting to the structured defects, such as scratches and dust spots, and a local branch targeting to the unstructured defects, such as noises and blurriness. Two branches are fused in the latent space, leading to improved capability to restore old photos from multiple defects. Furthermore, we apply another face refinement network to recover fine details of faces in the old photos, thus ultimately generating photos with enhanced perceptual quality. With comprehensive experiments, the proposed pipeline demonstrates superior performance over state-of-the-art methods as well as existing commercial tools in terms of visual quality for old photos restoration.
연구 동기 및 목표
- 스크래치, 먼지, 흐림, 색상 퇄어짐 등의 복합적이고 혼합된 열악한 상태로 인한 오래된 사진 복원 문제를 해결하기 위해.
- 기존 방법에서 일반화를 제한하는 합성 훈련 데이터와 실제 오래된 사진 사이의 도메인 갭을 극복하기 위해.
- 인지적 품질에 매우 중요하지만 기존 방법에서 자주 잘 보존되지 않는 얼굴 세부 정보의 복원을 향상시키기 위해.
- 특화된 네트워크 브랜치를 통해 비정형(예: 노이즈) 및 구조적(예: 스크래치) 결함을 동시에 처리할 수 있는 통합 프레임워크를 개발하기 위해.
- 실세계의 실제 오래된 사진에서 최신 기술 수준의 방법과 상용 도구보다 뛰어난 시각적 품질을 달성하기 위해.
제안 방법
- 실제 오래된 사진, 합성된 열악한 이미지, 해당하는 청소년 기준 이미지 세 가지를 사용하는 트리플릿 도메인 번역 프레임워크를 도입한다.
- 실제 오래된 사진과 청소년 이미지를 공유 랜덤 스페이스로 매핑하기 위해 두 개의 변동형 오토인코더(VAE)를 훈련시킨다. 이는 도메인 이동을 줄이는 데 기여한다.
- 합성 이미지 간 번역 네트워크를 통해 열악한 이미지와 청소년 이미지의 랜덤 스페이스 간 매핑을 학습시켜 실제 데이터로의 일반화를 가능하게 한다.
- 스크래치나 먼지와 같은 구조적 결함의 효과적인 복원을 위해 랜덤 스페이스 내에서 장거리 의존성을 캡처하기 위해 부분적 비국소 블록을 설계한다.
- 계층적 공간 적응 조건부를 갖춘 별도의 코어스-투-파인 생성기로 얼굴 영역을 정밀하게 보정하여 정체성과 텍스처를 유지한다.
- 얼굴 정밀화 네트워크를 주 복원 파이프라인과 함께 공동 훈련시켜 분포 편향을 줄이고 현실감을 향상시킨다.
실험 결과
연구 질문
- RQ1랜덤 스페이스 번역 프레임워크는 복잡한 열악한 상태를 가진 실세계 오래된 사진으로의 일반화를 합성 데이터에서 효과적으로 수행할 수 있는가?
- RQ2모델은 오래된 사진에서 비정형(예: 노이즈)과 구조적(예: 스크래치) 열악한 상태를 동시에 어떻게 처리할 수 있는가?
- RQ3특화된 얼굴 정밀화 네트워크는 원래 구조나 정체성을 손상시키지 않으면서도 인지적 품질을 향상시킬 수 있는가?
- RQ4생성기에서 계층적 공간 주입 방식은 단일 스케일 조건부보다 더 나은 얼굴 재구성 성능을 낼 수 있는가?
- RQ5공유 VAE를 통한 도메인 정렬은 직접 픽셀 수준 번역 방식보다 성능을 어떻게 향상시키는가?
주요 결과
- 제안된 방법은 최신 기술 수준의 방법과 상용 도구에 비해 실제 오래된 사진에서 뛰어난 시각적 품질을 달성하며, 특히 얼굴 세부 정보 복원에서 뛰어난 성능을 보인다.
- 공유 VAE를 통한 도메인 정렬을 사용함으로써 일반화 성능이 크게 향상되어 합성 데이터에서 실세계 데이터로의 번역에서 흔히 발생하는 도메인 이동 문제를 줄였다.
- 부분적 비국소 블록은 전반적인 맥락을 활용하여 구조적 결함을 효과적으로 복원하여 더 구조적으로 일관된 복원을 가능하게 했다.
- 계층적 공간 주입을 갖춘 코어스-투-파인 얼굴 정밀화는 단일 스케일 주입이나 기준 GAN에 비해 더 현실적이며 정체성을 유지하는 얼굴을 생성했다.
- 합성 데이터셋에서의 정량적 평가 결과, 계층적 주입 방식이 FID, LPIPS, PSNR, SSIM 점수 모두에서 단일 스케일 기준보다 뛰어난 성능을 보였다.
- 복잡한 조명 효과나 그림자 아티팩트를 다루는 데에는 한계가 있으며, 이는 더 다양한 데이터 또는 조명 효과에 대한 명시적 모델링이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.