Skip to main content
QUICK REVIEW

[논문 리뷰] Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs

Min Zhou, Chenchen Xu|arXiv (Cornell University)|2022. 04. 30.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 공간적 및 의미적 이미지 구성 요소를 모델링함으로써 고품질의 시각-문자 포스터 레이아웃을 생성하기 위한 구성 인식 GAN인 CGL-GAN을 제안한다. 이는 마스크 처리된 훈련 데이터와 실제 테스트 이미지 사이의 도메인 갭을 해소하기 위해 도메인 정합 모듈(DAM)을 도입하여, 쌍화된 이미지-레이아웃 애너테이션 없이도 효과적인 레이아웃 생성을 가능하게 한다. 새로운 대규모 광고 포스터 데이터셋에서 구성 인식 메트릭스를 사용하여 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In this paper, we study the graphic layout generation problem of producing high-quality visual-textual presentation designs for given images. We note that image compositions, which contain not only global semantics but also spatial information, would largely affect layout results. Hence, we propose a deep generative model, dubbed as composition-aware graphic layout GAN (CGL-GAN), to synthesize layouts based on the global and spatial visual contents of input images. To obtain training images from images that already contain manually designed graphic layout data, previous work suggests masking design elements (e.g., texts and embellishments) as model inputs, which inevitably leaves hint of the ground truth. We study the misalignment between the training inputs (with hint masks) and test inputs (without masks), and design a novel domain alignment module (DAM) to narrow this gap. For training, we built a large-scale layout dataset which consists of 60,548 advertising posters with annotated layout information. To evaluate the generated layouts, we propose three novel metrics according to aesthetic intuitions. Through both quantitative and qualitative evaluations, we demonstrate that the proposed model can synthesize high-quality graphic layouts according to image compositions.

연구 동기 및 목표

  • 시각적 구성, 즉 공간적 및 의미적 콘텐츠를 고려한 고품질의 시각-문자 포스터 레이아웃을 생성하는 데 도전하는 것.
  • 마스크 처리된 그래픽 요소를 포함한 훈련 데이터와 마스크가 없는 실제 테스트 이미지 사이의 도메인 갭을 해소하여 레이아웃 품질이 떨어지는 문제를 해결하는 것.
  • 쌍화된 이미지-레이아웃 애너테이션을 요구하지 않고도 레이아웃을 생성하는 방법을 개발하는 것. 단지 포스터 애너테이션 데이터만을 사용한다.
  • 기존의 그래픽 요소 간 관계 중심 메트릭스가 아닌, 구성에 중점을 둔 새로운 메트릭스를 사용하여 레이아웃 품질을 평가하는 것.
  • 부분적으로 제공된 사용자 레이아웃이 모델의 출력을 안내하는 제약 조건이 있는 레이아웃 생성을 가능하게 하는 것.

제안 방법

  • 마스크 처리된 훈련 포스터를 더 현실적이고 구성 보존 능력이 뛰어난 입력으로 변환하기 위해, 인painting 서브넷과 시각적 중요도 탐지 서브넷을 갖춘 도메인 정합 모듈(DAM)을 설계하였다.
  • 이미지 구성과 그래픽 요소 간의 장거리 의존성과 공간적 관계를 모델링하기 위해 다중 스케일 CNN과 트랜스포머를 조합한 생성자 사용.
  • 실제와 생성된 이미지-레이아웃 쌍을 구분하기 위해 구조적으로 대칭적인 판별자 사용으로 현실적인 레이아웃 합성 강화.
  • 레이아웃의 정확성과 현실성 향상을 위해 복원 손실과 적대적 손실을 함께 사용하여 모델을 훈련.
  • 부분적으로 제공된 사용자 레이아웃에 조건을 줌으로써 제약 조건이 있는 레이아웃 생성을 지원.
  • 훈련 및 평가를 위한 60,548개의 애너테이션된 포스터로 구성된 대규모 광고 포스터 데이터셋을 구축.

실험 결과

연구 질문

  • RQ1쌍화된 이미지-레이아웃 데이터가 없는 상황에서 GAN 기반 모델이 미적이고 구성 인식 능력을 갖춘 시각-문자 포스터 레이아웃을 생성할 수 있는가?
  • RQ2도메인 정합 모듈이 마스크 처리된 훈련 데이터와 실제 테스트 이미지 간의 분포 차이를 얼마나 효과적으로 줄일 수 있는가?
  • RQ3전통적인 그래픽 관계 메트릭스와 비교했을 때, 구성 인식 메트릭스는 레이아웃 품질 평가에 얼마나 더 나은 성능을 보이는가?
  • RQ4모델은 다양한 입력 이미지에 대해 일반화되어 있으며, 주요 이미지 영역(예: 얼굴이나 제품)을 가리키지 않고 주제의 무결성을 유지하는가?
  • RQ5부분적으로 지정된 레이아웃과 같은 사용자 제약 조건 하에서 모델의 성능은 어떠한가?

주요 결과

  • 제안된 CGL-GAN 모델은 왜곡되지 않은 메트릭스에서 최고의 사용자 스터디 점수(0.941)를 기록했으며, 구성 관련 메트릭스에서도 뛰어난 성능을 유지하였다.
  • 도메인 정합 모듈(DAM)은 레이아웃 품질을 크게 향상시켰으며, DAM 출력을 사용할 경우 99.7%의 가림 메트릭스 점수를 기록한 반면, 마스크 처리된 입력을 사용할 경우 단지 2.5%에 그쳤다.
  • 다중 스케일 CNN과 트랜스포머 설계를 가진 생성자는 DAM를 사용한 ContentGAN보다 뛰어난 성능을 보였으며, 구성 메트릭스에서 34.01점, 주제 메트릭스에서 0.816점을 기록하였다.
  • 이미지가 확대되거나 재배치되더라도 주요 이미지 영역(예: 인간의 얼굴)을 가리키지 않고 구성 이해 능력이 뛰어나게 작동하였다.
  • 부분적인 사용자 입력에 기반해 다양한 실현 가능성을 가진 레이아웃을 생성함으로써 제약 조건이 있는 레이아웃 생성에 잘 일반화되었다.
  • 제거 실험 결과, DAM과 다중 스케일 생성자 설계 둘 다 필수적임을 확인하였으며, 둘 중 하나를 제거할 경우 성능이 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.