Skip to main content
QUICK REVIEW

[論文レビュー] Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs

Min Zhou, Chenchen Xu|arXiv (Cornell University)|Apr 30, 2022
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、空間的および意味的画像構成をモデル化することで、高品質なビジュアル・テキストポスターのレイアウトを生成する、構成に配慮した GAN である CGL-GAN を提案する。ドメインアライメントモジュール(DAM)を導入し、マスク処理されたトレーニングデータと実際のテスト画像とのギャップを埋めることで、ペaired画像-レイアウトアノテーションを必要とせずに効果的なレイアウト生成を可能にする。本手法は、新しい大規模広告ポスターデータセットにおいて、構成に配慮した新しい指標を用いて最先端の性能を達成した。

ABSTRACT

In this paper, we study the graphic layout generation problem of producing high-quality visual-textual presentation designs for given images. We note that image compositions, which contain not only global semantics but also spatial information, would largely affect layout results. Hence, we propose a deep generative model, dubbed as composition-aware graphic layout GAN (CGL-GAN), to synthesize layouts based on the global and spatial visual contents of input images. To obtain training images from images that already contain manually designed graphic layout data, previous work suggests masking design elements (e.g., texts and embellishments) as model inputs, which inevitably leaves hint of the ground truth. We study the misalignment between the training inputs (with hint masks) and test inputs (without masks), and design a novel domain alignment module (DAM) to narrow this gap. For training, we built a large-scale layout dataset which consists of 60,548 advertising posters with annotated layout information. To evaluate the generated layouts, we propose three novel metrics according to aesthetic intuitions. Through both quantitative and qualitative evaluations, we demonstrate that the proposed model can synthesize high-quality graphic layouts according to image compositions.

研究の動機と目的

  • ビジュアル・テキストポスターのレイアウトを生成する際、空間的および意味的コンテンツを尊重する高品質なレイアウト生成の課題に対処すること。
  • マスク処理されたグラフィック要素を含むトレーニングデータと、マスクのないテストデータとの間のドメインギャップを解消すること。このギャップはレイアウト品質を低下させる。
  • ペアド画像-レイアウトアノテーションを必要とせず、ポスターのアノテーションデータのみを用いてレイアウトを生成する手法を開発すること。
  • 従来のグラフィック要因関係の指標ではなく、構成に配慮した指標に焦点を当てたレイアウト品質の評価を実施すること。
  • 部分的に提供されたユーザーのレイアウトによってモデルの出力をガイドする制約付きレイアウト生成を可能にすること。

提案手法

  • マスク処理されたトレーニングポスターをより現実的で構成を保持する入力に変換するため、インpaintingサブネットとサリエンシー検出サブネットを備えたドメインアライメントモジュール(DAM)を設計した。
  • 画像構成とグラフィック要素間の長距離依存関係および空間的関係をモデル化するため、マルチスケール CNN とトランスフォーマーを組み合わせた生成器を採用した。
  • 実際の画像-レイアウトペアと生成されたペアを区別する構造的に対称な識別器を用い、現実的なレイアウト合成を強制した。
  • レイアウトの忠実性と現実性を向上させるために、再構成損失と adversarial 損失を用いてモデルを訓練した。
  • 部分的なユーザー提供レイアウトに条件づけることで、制約付きレイアウト生成をサポートした。
  • トレーニングおよび評価用に、60,548 枚のアノテート済みポスターから構成される大規模広告ポスターデータセットを構築した。

実験結果

リサーチクエスチョン

  • RQ1ペアド画像-レイアウトデータを必要とせずに、視覚的に魅力的で構成に配慮したレイアウトを GAN ベースのモデルが生成できるか。
  • RQ2ドメインアライメントモジュールは、マスク処理されたトレーニングデータと実際のテスト画像との間の分布シフトをどの程度効果的に低減できるか。
  • RQ3従来のグラフィック要因関係の指標と比較して、構成に配慮した指標はレイアウト品質の評価をどの程度改善するか。
  • RQ4本モデルは、多様な入力画像に対して一般化可能で、被写体の完全性(例:顔や製品を覆わない)を保つことができるか。
  • RQ5部分的に指定されたレイアウトなどのユーザー制約下で、モデルの性能はどの程度高いか。

主な発見

  • 提案された CGL-GAN モデルは、歪みのない指標で最高のユーザースタディスコア(0.941)を達成し、構成関連の指標でも高い性能を維持した。
  • ドメインアライメントモジュール(DAM)はレイアウト品質を顕著に向上させ、DAM の出力を用いることで、閉塞率がマスク入力時(2.5%)と比較して 99.7% まで上昇した。
  • マルチスケール CNN とトランスフォーマーを組み合わせた生成器は、DAM を備えた ContentGAN よりも優れており、構成指標で 34.01、被写体指標で 0.816 を達成した。
  • 画像のスケーリングや再配置でさえも、重要な画像領域(例:人の顔)を覆うのを回避し、強固な構成理解を示した。
  • 制約付きレイアウト生成においても、部分的なユーザー入力に基づいて多様で妥当なレイアウトを効果的に生成でき、一般化性能が優れたことが示された。
  • アブレーションスタディーにより、DAM とマルチスケール生成器設計の両方が不可欠であることが確認され、いずれかを削除すると性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。