Skip to main content
QUICK REVIEW

[논문 리뷰] High-Quality Pluralistic Image Completion via Code Shared VQGAN

Chuanxia Zheng, Guoxian Song|arXiv (Cornell University)|2022. 04. 05.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 고품질의 다수의 이미지 완성 가능성을 동시에 추론할 수 있도록 하는 새로운 프레임워크인 Code Shared VQGAN을 제안한다. 이는 공간적 위치 간에 코드를 공유하고, 이산 코드 공간에서 트랜스포머를 사용함으로써 빠르고 비순차적(non-autoregressive) 생성을 가능하게 하는, 압축적이면서도 표현력 있는 이산 잠재 코드 표현을 활용한다. 이로 인해 자동회귀적 iGPT 기반 방법 대비 100배 이상 빠른 추론 속도를 달성하면서도, 벤치마크 데이터셋에서 이미지 품질과 다양성 측면에서 기존 최고 성능(SOTA)을 크게 뛰어넘는다.

ABSTRACT

PICNet pioneered the generation of multiple and diverse results for image completion task, but it required a careful balance between $\mathcal{KL}$ loss (diversity) and reconstruction loss (quality), resulting in a limited diversity and quality . Separately, iGPT-based architecture has been employed to infer distributions in a discrete space derived from a pixel-level pre-clustered palette, which however cannot generate high-quality results directly. In this work, we present a novel framework for pluralistic image completion that can achieve both high quality and diversity at much faster inference speed. The core of our design lies in a simple yet effective code sharing mechanism that leads to a very compact yet expressive image representation in a discrete latent domain. The compactness and the richness of the representation further facilitate the subsequent deployment of a transformer to effectively learn how to composite and complete a masked image at the discrete code domain. Based on the global context well-captured by the transformer and the available visual regions, we are able to sample all tokens simultaneously, which is completely different from the prevailing autoregressive approach of iGPT-based works, and leads to more than 100$ imes$ faster inference speed. Experiments show that our framework is able to learn semantically-rich discrete codes efficiently and robustly, resulting in much better image reconstruction quality. Our diverse image completion framework significantly outperforms the state-of-the-art both quantitatively and qualitatively on multiple benchmark datasets.

연구 동기 및 목표

  • 다수의 이미지 완성에서 이미지 품질과 다양성 사이의 상충 관계를 해결하기 위함.
  • 이미지 생성 작업에서 iGPT와 같은 자동회귀 모델의 느린 추론 속도를 극복하기 위함.
  • 압축된 이산 잠재 표현을 통해 다수의 이미지 완성을 동시에 효율적으로 샘플링할 수 있도록 하기 위함.
  • 생성된 이미지 완성의 재구성 정밀도와 의미론적 풍부함을 향상시키기 위함.
  • 정량적 지표와 정성적 다양성 측면에서 모두 최고 성능을 달성하기 위함.

제안 방법

  • 공간적 위치 간에 코드를 공유하는 메커니즘을 VQGAN에 도입하여, 압축적이면서도 표현력 있는 이산 잠재 표현을 생성함.
  • 공간적 위치 간에 공유된 코드북에서 유도된 이산 코드북 공간에서 이미지를 표현함.
  • 전역적 맥락을 모델링하고 완성을 이끌어내기 위해 이산 코드 토큰 위에서 직접 작동하는 트랜스포머 모델을 활용함.
  • 모든 코드 토큰을 동시에 평행적으로 샘플링할 수 있도록 하여 추론 속도를 극적으로 향상시킴.
  • 풍부하고 의미론적으로 유의미한 코드를 활용하여 재구성 품질과 다양성을 향상시킴.
  • 공유된 코드북과 트랜스포머 기반 완성 네트워크를 통해 재구성 및 다양성 목적 함수를 공동 최적화함.

실험 결과

연구 질문

  • RQ1VQGAN 기반 프레임워크에서 공유된 코드북 표현이 이미지 완성에서 이미지 품질과 다양성 측면에서 향상될 수 있는가?
  • RQ2이산 코드 공간에서의 비순차적 샘플링은 자동회귀적 생성 대비 추론 속도와 품질 측면에서 어떻게 비교되는가?
  • RQ3압축된 이산 표현이 이미지 완성에서 의미론적 풍부함을 얼마나 잘 유지할 수 있는가?
  • RQ4제안된 방법이 정량적 지표와 정성적 다양성 측면에서 기존 SOTA 접근법을 뛰어넘을 수 있는가?
  • RQ5코드 공유 메커니즘은 다양한 복잡한 이미지 완성 시나리오를 다룰 때 얼마나 강건한가?

주요 결과

  • 제안된 프레임워크는 자동회귀적 iGPT 기반 방법 대비 100배 이상 빠른 추론 속도를 달성한다.
  • FID 및 FVD 지표로 측정한 결과, 이미지 재구성 품질과 다양성 측면에서 PICNet보다 뚜렷이 뛰어나다.
  • 공유된 코드북의 사용은 더 압축되고 표현력 있는 잠재 표현을 가능하게 하여 생성 효율성을 향상시킨다.
  • 비순차적 샘플링 전략은 고화질 이미지를 유지하면서도 다수의 완성된 이미지를 동시에 평행 생성할 수 있도록 한다.
  • 다양한 벤치마크 데이터셋에서의 실험을 통해 정량적 지표와 정성적 다양성 측면에서 뛰어난 성능을 확인하였다.
  • 프레임워크는 고정밀도 및 다양한 이미지 완성에 기여할 수 있는 의미론적으로 풍부한 이산 코드를 학습한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.