Skip to main content
QUICK REVIEW

[논문 리뷰] Semantically Multi-modal Image Synthesis

Zhen Zhu, Zhiliang Xu|arXiv (Cornell University)|2020. 03. 28.
Generative Adversarial Networks and Image Synthesis참고 문헌 59인용 수 4
한 줄 요약

이 논문은 군집 컨볼루션을 사용하여 디코더에서 그룹 수를 점진적으로 감소시켜 의미적 레이블에서 다양하고 세밀하게 제어 가능한 이미지를 생성할 수 있도록 하는 새로운 생성기 아키텍처인 GroupDNet을 제안한다. 이 방법은 DeepFashion 및 Cityscapes에서 최고 수준의 이미지 품질을 달성하며, 특히 ADE20K와 같은 대규모 클래스 데이터셋에서 높은 품질을 유지하면서도 의미적 부분에 대한 뛰어난 제어성을 확보한다.

ABSTRACT

In this paper, we focus on semantically multi-modal image synthesis (SMIS) task, namely, generating multi-modal images at the semantic level. Previous work seeks to use multiple class-specific generators, constraining its usage in datasets with a small number of classes. We instead propose a novel Group Decreasing Network (GroupDNet) that leverages group convolutions in the generator and progressively decreases the group numbers of the convolutions in the decoder. Consequently, GroupDNet is armed with much more controllability on translating semantic labels to natural images and has plausible high-quality yields for datasets with many classes. Experiments on several challenging datasets demonstrate the superiority of GroupDNet on performing the SMIS task. We also show that GroupDNet is capable of performing a wide range of interesting synthesis applications. Codes and models are available at: https://github.com/Seanseattle/SMIS.

연구 동기 및 목표

  • 의미적 레이블에서 다양하고 제어 가능한 이미지를 생성하는 데 있어 기존 방법의 한계, 특히 다수의 클래스가 포함된 경우의 문제를 해결하기 위해.
  • 다중 모odal 이미지 합성에서 다수의 클래스별 생성기로 인한 비효율성과 확장성 문제를 해결하기 위해.
  • 이미지 품질과 일관성을 유지하면서도 한 부분만 변경하여 다른 부분에 영향을 주지 않고도 사용자 제어가 가능한 의미 수준의 편집을 가능하게 하기 위해.
  • ADE20K와 같이 많은 수의 의미 클래스를 포함한 데이터셋에 대해 모델의 효율성과 확장성을 향상시키기 위해.
  • 외관 혼합, 의미적 조작, 스타일 모핑과 같은 다양한 응용을 지원하는 통합 생성 모델을 개발하기 위해.

제안 방법

  • 모든 표준 컨볼루션을 군집 컨볼루션으로 대체하여 클래스별 특징 학습과 제어를 가능하게 한다.
  • 디코더 컨볼루션에서 그룹 수를 점진적으로 감소시켜 상호 클래스 상관관계(예: 풀과 잎사귀 사이의 색상 일관성)를 모델링한다.
  • 추론 시 서로 다른 의미적 부분에 대해 독립적으로 제어할 수 있도록 군집 컨볼루션 레이어를 사용하는 통합 생성기 구현.
  • 실제 이미지에서 스타일 코드를 추출하기 위해 인코더를 활용하여 스타일 전이 및 모핑 응용을 가능하게 한다.
  • 실제감과 충실도를 확보하기 위해 적대적 손실, L1 손실, 인지적 손실을 포함한 GAN 기반 프레임워크로 모델을 훈련시킨다.
  • SPADE와 유사한 조건부 이미지 합성 파이프라인에 GroupDNet 생성기를 통합하여 일관된 훈련 및 평가를 수행한다.

실험 결과

연구 질문

  • RQ1군집 컨볼루션과 감소하는 그룹 수를 갖는 통합 생성기가 다수의 클래스별 생성기보다 다중 모달 이미지 합성에서 더 뛰어난 제어성을 달성할 수 있는가?
  • RQ2디코더에서 그룹 수를 점진적으로 감소시키는 것이 상호 클래스 상관관계 모델링과 이미지 품질에 어떤 영향을 미치는가?
  • RQ3GroupDNet이 개별 이미지 부분에 대해 세밀하고 의미 수준의 제어를 가능하게 하면서도 높은 이미지 품질을 유지할 수 있는 정도는 어느 정도인가?
  • RQ4GroupDNet은 외관 혼합, 의미적 조작, 스타일 모핑와 같은 다양한 응용에 일반화될 수 있는가?
  • RQ5ADE20K와 같은 대규모 데이터셋에서 FID, mIoU, 정확도 측면에서 GroupDNet은 최고 수준의 기존 방법들과 비교해 어떻게 성능을 내는가?

주요 결과

  • GroupDNet은 DeepFashion(9.50)과 Cityscapes(49.81)에서 최고 수준의 FID 점수를 기록하며, SPADE 및 기타 최고 수준의 방법들과 경쟁하거나 이를 초월한다.
  • ADE20K 데이터셋에서 GroupDNet은 mIoU 30.4와 정확도 77.1을 기록하여 높은 클래스 수에도 불구하고 모든 베이스라인을 능가한다.
  • 모델은 뛰어난 제어성을 보이며, 예를 들어 옷과 같은 하나의 의미적 부분만 변경해도 다른 부분에 영향을 주지 않음을 정성적 결과로 검증하였다.
  • GroupDNet은 외관 혼합(단일 마스크에서 수천 개의 고유한 인물 이미지 생성), 의미적 조작(예: 침대 삽입), 스타일 모핑 등의 새로운 응용을 가능하게 한다.
  • 다중 생성기 접근 방식에 비해 훈련 및 추론 비용을 감소시켰으며, 추론 속도는 다중 생성기 베이스라인의 약 두 배에 가까운 성능을 보였다.
  • 제안된 mCSD 및 mOCD 지표는 GroupDNet이 목표 클래스에서는 높은 다양성을 생성하면서도 다른 클래스에서는 낮은 다양성을 유지함을 확인하여 정밀한 제어를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.