[论文解读] Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs
本文提出CGL-GAN,一种用于生成高质量视觉-文本海报布局的组合感知生成对抗网络,通过建模图像的空间与语义组合关系实现。它引入一个领域对齐模块(DAM),弥合掩码训练数据与真实测试图像之间的差距,从而在无需成对图像-布局标注的情况下实现有效布局生成。该方法在包含新型组合感知指标的新大规模广告海报数据集上达到最先进性能。
In this paper, we study the graphic layout generation problem of producing high-quality visual-textual presentation designs for given images. We note that image compositions, which contain not only global semantics but also spatial information, would largely affect layout results. Hence, we propose a deep generative model, dubbed as composition-aware graphic layout GAN (CGL-GAN), to synthesize layouts based on the global and spatial visual contents of input images. To obtain training images from images that already contain manually designed graphic layout data, previous work suggests masking design elements (e.g., texts and embellishments) as model inputs, which inevitably leaves hint of the ground truth. We study the misalignment between the training inputs (with hint masks) and test inputs (without masks), and design a novel domain alignment module (DAM) to narrow this gap. For training, we built a large-scale layout dataset which consists of 60,548 advertising posters with annotated layout information. To evaluate the generated layouts, we propose three novel metrics according to aesthetic intuitions. Through both quantitative and qualitative evaluations, we demonstrate that the proposed model can synthesize high-quality graphic layouts according to image compositions.
研究动机与目标
- 为解决生成尊重图像组合关系(包括空间与语义内容)的高质量视觉-文本海报布局的挑战。
- 弥合训练数据(含掩码图形元素)与测试数据(无掩码)之间的领域差距,后者会降低布局质量。
- 开发一种无需成对图像-布局标注即可生成布局的方法,仅依赖海报标注数据。
- 使用聚焦于组合关系而非仅图形元素关系的新指标评估布局质量。
- 实现受约束的布局生成,即通过用户提供的部分布局引导模型输出。
提出的方法
- 设计一个领域对齐模块(DAM),包含图像修复子网和显著性检测子网,将掩码训练海报转换为更真实、保留组合结构的输入。
- 生成器结合多尺度CNN与Transformer,以建模图像组合与图形元素之间的长距离依赖与空间关系。
- 使用结构对称的判别器区分真实与生成的图像-布局对,以强化真实布局的合成。
- 通过重建损失与对抗损失联合训练模型,以提升布局保真度与真实感。
- 通过基于部分用户提供的布局进行条件输入,支持受约束的布局生成。
- 构建了一个包含60,548张标注海报的大规模广告海报数据集,用于训练与评估。
实验结果
研究问题
- RQ1基于GAN的模型能否在无需成对图像-布局数据的情况下,生成视觉上悦目且具有组合感知能力的视觉-文本海报布局?
- RQ2领域对齐模块在多大程度上能减少掩码训练数据与真实测试图像之间的分布偏移?
- RQ3与传统图形关系指标相比,组合感知指标在多大程度上提升了布局质量的评估效果?
- RQ4该模型能否泛化到多样化的输入图像,并保持主体完整性(例如避免遮挡人脸或产品)?
- RQ5在用户约束条件下(如部分指定的布局),模型表现如何?
主要发现
- 所提出的CGL-GAN模型在无失真指标上的用户研究得分最高(0.941),并在与组合相关的指标上保持强劲表现。
- 领域对齐模块(DAM)显著提升了布局质量,使用DAM输出时,遮挡指标得分达99.7%,而使用掩码输入时仅为2.5%。
- 采用多尺度CNN与Transformer设计的生成器优于ContentGAN(带DAM),在组合指标上得分达34.01,在主体指标上得分为0.816。
- 即使在图像缩放或重新定位的情况下,模型仍能有效避免遮挡关键图像区域(如人脸),展现出鲁棒的组合理解能力。
- 模型在受约束的布局生成中表现出良好泛化能力,能基于部分用户输入生成多样且合理的布局。
- 消融实验证实,DAM与多尺度生成器设计均至关重要,移除任一组件均导致性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。