Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Semantic Inpainting with Pixel Constrained CNNs

Emilien Dupont, Suhas Suresha|arXiv (Cornell University)|2018. 10. 08.
Generative Adversarial Networks and Image Synthesis참고 문헌 33인용 수 10
한 줄 요약

이 논문은 가시 픽셀에 조건부로 이미지 분포를 모델링하는 수정된 PixelCNN 기반의 확률적 의미 보정 방법인 Pixel Constrained CNNs를 제안한다. 이는 가능성 추정과 함께 다양한, 현실적인 이미지 보정을 가능하게 하며, MNIST와 CelebA에서의 실험 결과, MNIST에서는 높은 샘플 다양성과 강한 인간 인식 상관관계를 보였지만, CelebA에서는 복잡한 얼굴에 대해 가능성 추정이 덜 신뢰할 수 있었다.

ABSTRACT

Semantic inpainting is the task of inferring missing pixels in an image given surrounding pixels and high level image semantics. Most semantic inpainting algorithms are deterministic: given an image with missing regions, a single inpainted image is generated. However, there are often several plausible inpaintings for a given missing region. In this paper, we propose a method to perform probabilistic semantic inpainting by building a model, based on PixelCNNs, that learns a distribution of images conditioned on a subset of visible pixels. Experiments on the MNIST and CelebA datasets show that our method produces diverse and realistic inpaintings.

연구 동기 및 목표

  • 이미지 보정의 본질적 불확실성을 다루기 위해 단일 결정론적 출력이 아닌 다수의 타당한 보정을 생성하는 것.
  • 가시 픽셀을 조건으로 하여 이미지의 조건부 분포를 학습하는 모델을 개발하여 현실적인 보정의 분포에서 샘플링할 수 있도록 하는 것.
  • 생성된 보정의 가능성 추정을 수행하여 타당성에 따라 샘플을 순위 매길 수 있도록 하는 것.
  • 결정론적 GAN 기반 또는 최적화 기반 방법에 비해 샘플 다양성을 향상시키는 것.
  • 모델가 추정한 가능성과 인간이 인식하는 이미지 타당성 간의 상관관계를 평가하는 것.

제안 방법

  • PixelCNN을 일반적인 위와 왼쪽 픽셀이 아닌, 임의의 가시 픽셀 집합에 조건부로 적용하여, 비정규형 또는 비직사각형 마스크에 대해서도 보정이 가능하도록 확장한다.
  • 자기회귀적 모델링을 사용하여 이전에 생성된 픽셀과 가시 픽셀 제약 조건을 바탕으로 각 픽셀의 분포를 예측한다.
  • 가시 픽셀을 인코딩하고 자기회귀적 생성 과정에 통합하는 조건부 입력 메커니즘을 도입한다.
  • 픽셀 단위의 교차 엔트로피와 가시 픽셀과의 일致성을 유지하기 위한 정규화 항을 조합한 수정된 손실 함수를 사용한다.
  • 자기회귀적 구조를 활용하여 생성된 이미지의 정확한 가능성 추정을 계산함으로써 모델 평가 및 샘플 순위 매기기가 가능해진다.
  • 다중 척도 아키텍처를 적용하여 모델링 능력을 향상시키고 국소적 및 전반적인 이미지 구조를 모두 포착한다.

실험 결과

연구 질문

  • RQ1비정규형 또는 비직사각형 마스크에 대해서도, 가시 픽셀에 조건부로 다양한, 현실적인 이미지 보정을 생성할 수 있는 확률적 모델은 가능한가?
  • RQ2모델가 추정한 가능성은 인간의 이미지 타당성 인식과 상관관계가 있는가?
  • RQ3다양성과 현실성 측면에서 최신의 결정론적 보정 방법과 비교해 모델 성능은 어떠한가?
  • RQ4왜 복잡한 데이터셋인 CelebA에서는 가능성 추정이 인간 인식과 상관관계가 떨어지는가?
  • RQ5자기회귀적 생성 과정을 통해 불확실성이 효과적으로 전파되는가? 이를 통해 픽셀 가능성 지ap이 변화하는가?

주요 결과

  • 모델은 MNIST와 CelebA 양쪽 모두에서 다양한, 현실적인 보정을 생성하며, 시각적 및 정량적 분석을 통해 높은 샘플 다양성이 확인되었다.
  • MNIST에서는 사용자 응답의 49.7%가 모델의 가능성 순위와 일치하여 인간이 인식하는 타당성과 강한 상관관계를 보였다.
  • CelebA에서는 사용자 응답의 56.6%가 모델의 가능성 추정과 일치하지 않아, 모델의 가능성 추정이 복잡한 얼굴 데이터에 대해 덜 신뢰할 수 있음을 시사했다.
  • 모델의 픽셀 가능성 지도는 생성 과정 동안 변화하며, 더 많은 픽셀이 샘플링될수록 확신이 증가하고, 타당한 보정 쪽으로 올바르게 편향됨을 보였다.
  • 실패 사례에서는 마스크 경계 근처에서 비현실적인 보정이나 일치하지 않는 픽셀을 생성하는 경우가 있었으며, 이는 마스크 구조와 모델 수렴도에 민감함을 시사했다.
  • 자기회귀적 생성으로 인해 가능성 추정이 계산적으로 비용이 많이 들며, 이미지의 픽셀 수와 동일한 수의 전방 전파가 필요로 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.