Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Inception Generative Network for Cognitive Image Inpainting

Qingguo Xiao, Guangyao Li|arXiv (Cornell University)|2018. 12. 01.
Generative Adversarial Networks and Image Synthesis참고 문헌 32인용 수 8
한 줄 요약

이 논문은 다중 수용성장치 인셉션 모듈을 활용하여 고수준 특징 표현을 향상시키고 잡음 요소를 줄이며 인지적 이미지 복원을 향상시키는 딥 인셉션 생성 네트워크를 제안한다. 다양한 무작위 마스크 생성 방법과 맞춤형 마스크 데이터셋을 도입함으로써, ImageNet, Places2, CelebA-HQ에서 정규, 비정규, 자유형 마스크 복원 작업 전반에서 최신 기술 수준(SOTA)의 성능을 달성하며, 이전 방법들보다 더 자연스럽고 맥락적으로 일관된 결과를 생성한다.

ABSTRACT

Recent advances in deep learning have shown exciting promise in filling large holes and lead to another orientation for image inpainting. However, existing learning-based methods often create artifacts and fallacious textures because of insufficient cognition understanding. Previous generative networks are limited with single receptive type and give up pooling in consideration of detail sharpness. Human cognition is constant regardless of the target attribute. As multiple receptive fields improve the ability of abstract image characterization and pooling can keep feature invariant, specifically, deep inception learning is adopted to promote high-level feature representation and enhance model learning capacity for local patches. Moreover, approaches for generating diverse mask images are introduced and a random mask dataset is created. We benchmark our methods on ImageNet, Places2 dataset, and CelebA-HQ. Experiments for regular, irregular, and custom regions completion are all performed and free-style image inpainting is also presented. Quantitative comparisons with previous state-of-the-art methods show that ours obtain much more natural image completions.

연구 동기 및 목표

  • 단일 수용성장치 아키텍처로 인해 장거리 맥락적 의존성을 모델링하지 못하고 잡음 요소를 생성하는 기존 딥 러닝 기반 이미지 복원 방법의 한계를 해결하기 위해.
  • 다중 척도 특징 추상화와 모델의 강건성을 향상시켜 이미지 복원에서 인지적 이해를 향상시키기 위해 딥 인셉션 학습을 도입하기 위해.
  • 정규, 비정규, 손그림 마스크를 포함한 임의의 형태의 마스크를 포함한 다양한 랜덤 마스크 데이터셋을 구축하여 자유형 복원을 가능하게 하기 위해.
  • ImageNet, Places2, CelebA-HQ를 포함한 여러 벤치마크 데이터셋에서 우수한 일반화 능력과 시각적 품질을 입증하기 위해.

제안 방법

  • 제안된 네트워크는 한 층 내에서 다중 수용성장치를 통합하여 특징 추상화를 향상시키고 장거리 의존성을 모델링한다.
  • 공간 불변성과 특징 일반화를 향상시키기 위해 아키텍처에 풀링 층을 유지하며, 일반적으로 세부 정보 유지 목적으로 풀링 층을 제거하는 관행에 대비하여 대응한다.
  • 다양한 랜덤 마스크 생성을 위한 두 가지 신규 방법을 도입한다: 하나는 크기, 회전, 위치를 무작위로 설정한 직사각형, 원, 타원 등의 기하학적 도형을 사용하는 방법이고, 另一个是 시드 포인트에서 시작하여 점 기반 확장(dilation)을 통해 영역을 확장하는 방법이다.
  • GitHub에 공개된 맞춤형 랜덤 마스크 데이터셋을 구축하여, 임의의 형태의 구멍이 있는 훈련 및 평가를 지원한다.
  • 모델은 생성적 적대 신경망(GAN) 프레임워크를 사용하여 적대적 손실과 인지적 손실을 최적화함으로써 현실감과 구조적 일관성을 동시에 향상시킨다.
  • 정량적 평가와 최신 기술 수준의 방법들과의 정성적 비교를 통해 ImageNet, Places2, CelebA-HQ 세 가지 데이터셋에서 네트워크를 평가한다.

실험 결과

연구 질문

  • RQ1단일 수용성장치 CNN에 비해 다중 수용성장치 인셉션 모듈이 이미지 복원에서 고수준 특징 표현을 향상시키고 잡음 요소를 줄일 수 있는가?
  • RQ2다양하고 임의의 형태의 마스크가 모델의 일반화 능력을 얼마나 향상시키며, 자유형 복원을 얼마나 잘 가능하게 하는가?
  • RQ3GL, GntIpt, Pconv와 같은 최신 기술 수준의 방법들과 비교해 복원 성능을 정량적·정성적으로 평가했을 때, 정규, 비정규, 사용자 정의 마스크 영역에서 어떤 차이를 보이는가?
  • RQ4복원을 위한 생성 네트워크에 풀링 층을 통합함으로써 세부 정보의 날카움을 유지하면서 맥락 이해 능력을 향상시킬 수 있는가?

주요 결과

  • 제안된 딥 인셉션 생성 네트워크는 GL, GntIpt, Pconv보다 더 낮은 잡음 요소와 더 일관된 질감을 보이며, 정규, 비정규, 자유형 복원 작업에서 뛰어난 시각적 품질을 달성한다.
  • 특히 큰 구멍 복원 시 Pconv 및 기타 기준 방법들에 비해 체스기저 패atters(체스기저 잡음)와 구조적 왜곡을 크게 줄였다.
  • CelebA-HQ 데이터셋에서의 결과는 복잡한 손그림 마스크 조건에서도 더 자연스럽고 맥락적으로 일관된 얼굴을 생성함을 보여준다.
  • 맞춤형 랜덤 마스크 데이터셋은 예측되지 않은 마스크 형태로의 일반화 능력을 강화하여 제안된 마스크 생성 기법의 효과성을 입증한다.
  • 정량적 비교 결과, 모든 데이터셋에서 구조적 유사도(SSIM) 및 인지적 품질 지표에서 이전 최신 기술 수준의 접근법을 초월하는 성능을 보였다.
  • 제거 실험(ablation study) 결과, 다중 척도 수용성장치를 가진 인셉션 모듈과 유지된 풀링 층이 특징 추상화와 복원 정확도를 크게 향상시킨다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.