Skip to main content
QUICK REVIEW

[논문 리뷰] Image Inpainting via Iteratively Decoupled Probabilistic Modeling

Wenbo Li, Xin Yu|arXiv (Cornell University)|2022. 12. 06.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 분리된 확률 모델링을 사용해 예측을 반복적으로 개선함으로써 대규모 누락 영역에 대한 고품질이고 효율적인 이미지 복원을 위한 픽셀 확산 모델(Pixel Spread Model, PSM)을 제안한다. 이 방법은 빠르고 정확한 평균 예측을 위해 적대적 훈련을 결합하고, 명시적인 가우시안 정규화를 통해 불확실성 맵을 생성함으로써 신뢰할 수 있는 픽셀의 선택적 개선을 가능하게 한다. 결과적으로, LDM 대비 1.1 FID 향상, 10배 빠른 추론 속도, 그리고 파라미터 수의 20%만으로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Generative adversarial networks (GANs) have made great success in image inpainting yet still have difficulties tackling large missing regions. In contrast, iterative probabilistic algorithms, such as autoregressive and denoising diffusion models, have to be deployed with massive computing resources for decent effect. To achieve high-quality results with low computational cost, we present a novel pixel spread model (PSM) that iteratively employs decoupled probabilistic modeling, combining the optimization efficiency of GANs with the prediction tractability of probabilistic models. As a result, our model selectively spreads informative pixels throughout the image in a few iterations, largely enhancing the completion quality and efficiency. On multiple benchmarks, we achieve new state-of-the-art performance. Code is released at https://github.com/fenglinglwb/PSM.

연구 동기 및 목표

  • 대규모 누락 영역에 대한 고품질이고 효율적인 이미지 복원 문제를 해결하기 위해, GAN은 안정성 문제를 겪고 디퓨전 모델은 높은 계산 비용을 유발한다는 점을 고려한다.
  • GAN의 최적화 효율성과 확률 모델의 취급 용이성 및 불확실성 추정 능력을 결합한 방법을 개발한다.
  • 고품질 생성을 위해 필요한 반복 단계 수를 줄이면서도 사진 수준의 현실감과 다양성을 유지한다.
  • 거대한 계산 자원이나 대규모 사전 훈련에 의존하지 않고도 고해상도 이미지(예: 512×512)에 대해 효율적이고 확장 가능한 추론을 가능하게 한다.

제안 방법

  • 모델은 반복적으로 분리된 확률 모델링을 사용하며, 각 반복 단계에서 평균(이미지 복원 결과)과 분산(불확실성 맵)을 동시에 예측한다.
  • 평균 항은 암묵적인 적대적 훈련을 통해 최적화되어 빠른 수렴과 적은 반복 수로 고품질 생성을 가능하게 한다.
  • 분산 항은 명시적인 가우시안 정규화를 통해 모델링되어 신뢰할 수 있는 불확실성 맵을 생성하며, 이는 개선 대상 픽셀 선별에 활용된다.
  • 낮은 불확실성을 가진 픽셀만 유지되고 다음 단계로 전달되며, 이는 점차 신뢰할 수 있는 콘텐츠로 누락 영역을 채우는 '픽셀 확산' 메커니즘을 가능하게 한다.
  • 장거리 맥락 모델링을 향상시키기 위해 불확실성 유도 주의 메커니즘을 도입하여 구조적 일관성과 세부 사항 품질을 향상시킨다.
  • 모든 반복 단계에서의 훈련 안정성을 향상시키기 위해 균일한 마스크 스케줄 전략을 사용하여 일반화 능력과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1적대적 훈련과 명시적 불확실성 모델링을 융합한 하이브리드 접근 방식이, 자동재귀적 또는 디퓨전 모델보다 더 적은 반복 수로 고품질 이미지 복원을 달성할 수 있는가?
  • RQ2명시적 불확실성 추정이 표준 GAN에 비해 반복적 이미지 보완의 신뢰성과 품질에 어떤 영향을 미치는가?
  • RQ3강력한 디퓨전 모델의 파라미터 수의 20%에 불과한 경량 모델이 대구멍 복원에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4불확실성 유도 주의 메커니즘이 고해상도 이미지 복원에서 구조적 일관성과 세부 사항 생성을 향상시키는가?

주요 결과

  • Places2 벤치마크에서 PSM은 강력한 노이즈 제거 디퓨전 모델인 LDM 대비 1.1 FID 향상, 파라미터 수 20% 감소, 추론 속도 10배 향상으로 성과를 냈다.
  • 모델은 약 250ms 내로 512×512 이미지를 생성하며, LDM의 약 3초에 비해 뚜렷한 성능 우월성을 보였다.
  • 단지 2000만 장의 훈련 이미지로도 LDM보다 5000만 장의 이미지로 훈련된 CoModGAN을 초월하는 성능을 보였으며, 데이터 효율성도 입증했다.
  • 불확실성 맵 덕분에 신뢰할 수 있는 예측을 효과적으로 선별할 수 있었고, GAN의 아티팩트를 줄이고 시각적 품질을 향상시켰다. 이는 정성적 비교를 통해 확인되었다.
  • 제거 실험 결과, 균일한 마스크 스케줄링 전략이 가장 낮은 FID 성능을 보였으며, 이는 반복 단계 간의 훈련 안정성이 향상되었음을 시사한다.
  • 모델은 다수의 생성 결과를 지원하며, 특히 실내 레이아웃이나 건물과 같은 복잡한 장면에서 더 현실적인 질감과 구조를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.