Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Diverse Structure for Image Inpainting With Hierarchical VQ-VAE

Jialun Peng, Dong Liu|arXiv (Cornell University)|2021. 03. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 41인용 수 9
한 줄 요약

이 논문은 계층적 VQ-VAE를 사용하여 다양한 고품질 이미지 보완을 생성하는 이단계 이미지 보완 방법을 제안한다. 먼저 이산 잠재 코드의 순차적 모델링을 통해 하나의 입력에서 다수의 서로 다른 구조를 생성하고, 그 다음 각 구조를 구조적 어텐션 모듈과 두 가지 전용 특징 손실을 사용한 텍스처 생성기로 정밀하게 보완함으로써, CelebA-HQ, Places2 및 ImageNet에서 최신 기준을 충족하는 다양성과 품질을 달성한다.

ABSTRACT

Given an incomplete image without additional constraint, image inpainting natively allows for multiple solutions as long as they appear plausible. Recently, multiplesolution inpainting methods have been proposed and shown the potential of generating diverse results. However, these methods have difficulty in ensuring the quality of each solution, e.g. they produce distorted structure and/or blurry texture. We propose a two-stage model for diverse inpainting, where the first stage generates multiple coarse results each of which has a different structure, and the second stage refines each coarse result separately by augmenting texture. The proposed model is inspired by the hierarchical vector quantized variational auto-encoder (VQ-VAE), whose hierarchical architecture isentangles structural and textural information. In addition, the vector quantization in VQVAE enables autoregressive modeling of the discrete distribution over the structural information. Sampling from the distribution can easily generate diverse and high-quality structures, making up the first stage of our model. In the second stage, we propose a structural attention module inside the texture generation network, where the module utilizes the structural information to capture distant correlations. We further reuse the VQ-VAE to calculate two feature losses, which help improve structure coherence and texture realism, respectively. Experimental results on CelebA-HQ, Places2, and ImageNet datasets show that our method not only enhances the diversity of the inpainting solutions but also improves the visual quality of the generated multiple images. Code and models are available at: https://github.com/USTC-JialunPeng/Diverse-Structure-Inpainting.

연구 동기 및 목표

  • 기존의 다중 솔루션 보완 방법이 구조 왜곡과 흐릿한 텍스처로 인해 저품질 결과를 낼 수 있는 한계를 해결하기 위해.
  • 암묵적인 잠재 공간 샘플링에 의존하지 않고 명시적으로 다양한 이미지 구조를 생성하기 위해.
  • 계층적 VQ-VAE에서 분리된 구조적 및 텍스처적 특징을 활용하여 텍스처의 현실감과 구조 일관성을 향상시키기 위해.
  • 구조적 생성과 목표 지향적 특징 손실을 통해 다양성을 향상시키면서도 높은 시각적 품질을 유지하기 위해.
  • 구조적 정보가 다양한 고도로 현실적인 이미지 보완을 이끄는 데 효과적인지 입증하기 위해.

제안 방법

  • 이미지 콘텐츠의 이산 표현을 가능하게 하기 위해 잠재 공간에서 구조적 및 텍스처적 특징을 분리하기 위해 계층적 VQ-VAE를 사용한다.
  • 단일 입력에서 다수의 다채로운 구조적 특징을 생성하기 위해 이산 잠재 코드에 대한 순차적 모델링을 수행한다.
  • 구조적 특징을 전체적으로 어텐션하여 공간 일관성을 확보하기 위해 텍스처 생성기에서 구조적 어텐션 모듈을 적용한다.
  • 구조적 특징 손실($\mathcal{L}_{sf}$)과 텍스처적 특징 손실($\mathcal{L}_{tf}$)을 도입하여 형태 일관성을 유지하고 텍스처의 현실감을 향상시킨다.
  • 정밀도와 다양성을 동시에 최적화하기 위해 L1, adversarial 및 두 가지 특징 손실을 사용하여 모델을 훈련시킨다.
  • 이단계 파이프라인을 사용한다: 먼저 다양한 구조를 생성하고, 그 다음 각 구조를 완성되고 현실적인 이미지로 보완한다.

실험 결과

연구 질문

  • RQ1계층적 VQ-VAE에서 이산 잠재 코드의 순차적 모델링이 보완을 위한 다양한 구조적 이미지 구조를 생성할 수 있는가?
  • RQ2텍스처 생성 네트워크에서 구조적 특징을 어텐션 컨텍스트로 사용할 경우, 구조와 텍스처 간의 일관성이 향상되는가?
  • RQ3구조 및 텍스처에 전용 특징 손실을 도입하면 표준 인지적 손실 및 스타일 손실을 초월해 시각적 품질을 향상시킬 수 있는가?
  • RQ4기존의 다중 솔루션 보완 방법과 비교해 본다면, 제안된 방법은 다양성과 품질 측면에서 어떻게 성능을 내는가?
  • RQ5계층적 VQ-VAE는 구조적 및 텍스처적 정보의 분리에 얼마나 효과적으로 기여하여 보완 성능을 향상시키는가?

주요 결과

  • 제안된 방법은 CelebA-HQ에서 Fréchet Inception Distance (FID) 9.670을 기록하여 베이스라인 방법들을 능가하며 뛰어난 이미지 품질을 입증한다.
  • LPIPS 메트릭을 사용한 다양성 점수는 0.029로, PIC 및 UCTGAN과 같은 최신 기준 방법들과 유사하여 강력한 구조적 다양성을 보여준다.
  • 절단 실험 결과, $\mathcal{L}_{sf}$와 $\mathcal{L}_{tf}$ 손실을 모두 사용할 경우 SSIM(0.8676), IS(3.467), FID(9.670)가 최고로 나타나 두 손실의 효과를 확인한다.
  • 구조적 어텐션 모듈은 텍스처 일관성을 크게 향상시켜 대칭적인 눈과 눈썹 등의 현실적인 특징을 가능하게 하였다. 정성적 비교에서 이를 확인할 수 있었다.
  • 인지적 손실과 스타일 손실을 제안된 특징 손실로 대체함으로써 아티팩트가 감소하고 구조-텍스처 정렬이 향상됨을 시각적 및 정량적 결과로 입증하였다.
  • CelebA-HQ, Places2 및 ImageNet을 포함한 다양한 데이터셋에서 높은 성능을 유지함으로써 일반화 능력이 뛰어남을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.