Skip to main content
QUICK REVIEW

[논문 리뷰] Shape-guided Object Inpainting

Yu Zeng, Zhe Lin|arXiv (Cornell University)|2022. 04. 16.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 모델이 형상과 맥락적 환경을 바탕으로 구멍을 메우기 위해 완전하고 의미적으로 일관된 객체를 생성하는 새로운 작업인 형태 유도 객체 보정을 소개한다. 저자들은 예측 클래스 임베딩과 상향식 객체 생성을 갖춘 이중 스트림 생성 네트워크인 CogNet을 제안하여 Places2에서 FID 점수가 최소 3.801, COCO에서 4.700에 이르는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Previous works on image inpainting mainly focus on inpainting background or partially missing objects, while the problem of inpainting an entire missing object remains unexplored. This work studies a new image inpainting task, i.e. shape-guided object inpainting. Given an incomplete input image, the goal is to fill in the hole by generating an object based on the context and implicit guidance given by the hole shape. Since previous methods for image inpainting are mainly designed for background inpainting, they are not suitable for this task. Therefore, we propose a new data preparation method and a novel Contextual Object Generator (CogNet) for the object inpainting task. On the data side, we incorporate object priors into training data by using object instances as holes. The CogNet has a two-stream architecture that combines the standard bottom-up image completion process with a top-down object generation process. A predictive class embedding module bridges the two streams by predicting the class of the missing object from the bottom-up features, from which a semantic object map is derived as the input of the top-down stream. Experiments demonstrate that the proposed method can generate realistic objects that fit the context in terms of both visual appearance and semantic meanings. Code can be found at the project page \url{https://zengxianyu.github.io/objpaint}

연구 동기 및 목표

  • 이미지 보정 연구에서 배경이나 부분적 객체 메우기에 집중한 데 비해 전체 객체 재생성에 대한 격차를 메우기 위해.
  • 기존 보정 모델이 배경 생성에 대한 내재된 편향을 줄이기 위해 훈련 데이터에 객체 사전 지식을 통합하기 위해.
  • 하향식 의미적 객체 생성과 상향식 맥락 전파를 조합한 깊이 있는 생성 모델을 설계하여 시각적 및 의미적 일관성을 향상시키기 위해.
  • 조명, 색상, 스타일이 주변 환경와 일치하는 맥락 인식형, 의미적으로 유의미한 객체 생성을 가능하게 하기 위해.

제안 방법

  • 훈련 중에 구멍으로서 객체 인스턴스를 사용하는 새로운 데이터 준비 방법을 제안하여 무작위 마스킹을 대체함으로써 객체 사전 지식을 통합한다.
  • 하향식 맥락 기반 이미지 보정을 위한 하향식 스트림과 의미적 객체 생성을 위한 상향식 스트림을 갖춘 이중 스트림 아키텍처를 설계한다.
  • 하향식 특징에서 누락된 객체의 클래스를 추론하여 상향식 생성을 지도하는 예측 클래스 임베딩(PCE) 모듈을 도입한다.
  • 예측된 클래스와 구멍 마스크에서 유도된 의미적 객체 맵을 상향식 스트림의 입력으로 사용하여 공간적 및 의미적 일관성을 강화한다.
  • 모델을 엔드 투 엔드로 훈련시키기 위해 적대적 손실과 인지적 손실을 사용하여 현실적인 외관과 고수준의 의미적 일치를 확보한다.
  • 상향식 스트림에서 잠재 노이즈 벡터를 활용하여 동일한 입력에 대해 다양한 실현 가능한 객체 변형을 생성한다.

실험 결과

연구 질문

  • RQ1이미지 보정 모델은 배경이나 부분적 객체가 아니라 전체 객체를 생성하도록 어떻게 적응시킬 수 있는가?
  • RQ2기존 모델이 배경 생성에 편향되는 것을 줄이기 위해 훈련 데이터를 어떻게 재구성할 수 있는가?
  • RQ3생성된 객체의 시각적 현실성과 의미적 일관성을 보장하기 위해 필요한 아키텍처 구성 요소는 무엇인가?
  • RQ4순수하게 하향식 맥락 모델링에 비해 상향식 의미 지도가 객체 보정에 얼마나 향상되는가?
  • RQ5다양한 잠재 코드를 사용하여 동일한 입력에 대해 일반화되어 다양한 맥락에 부합하는 객체를 생성할 수 있는가?

주요 결과

  • 제안된 방법은 COCO, Places2, Cityscapes에서 최신 기술 수준의 성능을 달성하였으며, FID 점수는 각각 4.700, 3.801, 7.411을 기록했다.
  • 제거 실험 결과에서 예측 클래스 임베딩 또는 상향식 스트림을 제거할 경우 FID 점수가 1.0점 이상 증가함을 확인하여 이들의 핵심적 역할을 입증하였다.
  • 객체 사전 지식이 포함된 훈련 데이터 없이 사용할 경우 모델은 객체를 생성하지 못하고 오히려 배경 유사 텍스처로 구멍을 메운다.
  • 다양한 무작위 잠재 코드를 사용한 결과, 그림 7에 나타나 있듯이 모델은 다수의 다양한 맥락에 부합하는 객체 인스턴스를 생성한다.
  • 정량적 결과에서 제안된 방법은 CoModGAN, DeepFillV2, RFR를 모두 초월하며, 특히 FID와 LPIPS 측정치에서 뛰어난 성능을 보였다.
  • 정성적 결과는 생성된 객체가 시각적으로 현실적이며 의미적으로 타당하고, 조명 및 스타일 측면에서 환경 맥락과 잘 맞춰져 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.