[论文解读] Dual Pyramid Generative Adversarial Networks for Semantic Image Synthesis
该论文提出了一种新型生成对抗网络——双金字塔生成对抗网络(DP-GAN),用于语义图像合成。该网络采用双编码器架构,自适应地调节多尺度下的归一化模块,从而更好地生成小尺寸和大尺寸物体。通过在特征匹配和对抗损失中统一多尺度监督,DP-GAN 实现了最先进性能,在 FID 上降低 3.6 分,在 mIoU 上提升 4.7 分,优于先前方法。
The goal of semantic image synthesis is to generate photo-realistic images from semantic label maps. It is highly relevant for tasks like content generation and image editing. Current state-of-the-art approaches, however, still struggle to generate realistic objects in images at various scales. In particular, small objects tend to fade away and large objects are often generated as collages of patches. In order to address this issue, we propose a Dual Pyramid Generative Adversarial Network (DP-GAN) that learns the conditioning of spatially-adaptive normalization blocks at all scales jointly, such that scale information is bi-directionally used, and it unifies supervision at different scales. Our qualitative and quantitative results show that the proposed approach generates images where small and large objects look more realistic compared to images generated by state-of-the-art methods.
研究动机与目标
- 解决从语义标签图生成具有高度一致性与真实感的小型和大型物体的挑战。
- 克服现有 GAN 模型因缺乏尺度感知条件控制而导致的图像出现斑驳或褪色物体的问题。
- 在生成器与判别器中统一多尺度监督,以实现与输入布局更好的对齐。
- 提升物体级别的真实感,特别是细小或结构简单的物体(如交通标志、护栏等)。
- 在保持精确语义对齐的同时,提升图像生成的泛化能力与多样性。
提出的方法
- 提出一种双金字塔生成器,通过两个并行的特征金字塔——一个用于语义上下文,一个用于空间自适应——学习对归一化模块进行尺度自适应条件控制。
- 采用基于分割的判别器,通过多尺度对抗损失($\mathcal{L}_{ms}$)和多尺度特征匹配损失($\mathcal{L}_{fm}$)实现多尺度监督。
- 采用双路径架构,使生成器的归一化层同时基于原始标签图与尺度感知的特征金字塔进行条件控制,从而提升尺度泛化能力。
- 将特征匹配损失($\mathcal{L}_{fm}$)专门应用于判别器的解码分支,以改善与真实图像在特征层面的对齐。
- 通过在多个分辨率下结合像素级语义分割监督、对抗损失与特征匹配损失,实现跨尺度的统一监督。
- 通过输入随机噪声向量 $z$ 实现多样化输出,使每个标签图可生成多个逼真的图像样本。
实验结果
研究问题
- RQ1双金字塔架构是否能通过将归一化条件控制适配至物体尺度,从而改善语义图像合成中小尺寸与大尺寸物体的生成?
- RQ2在生成器与判别器中均引入多尺度监督,是否能实现与输入语义布局更好的对齐并提升图像真实感?
- RQ3在基于分割的 GAN 中,特征匹配损失($\mathcal{L}_{fm}$)的位置如何影响模型性能?
- RQ4统一的多尺度训练框架是否能在 FID 与 mIoU 指标上超越现有最先进方法?
- RQ5与 SPADE 和 OASIS 相比,所提方法在减少斑驳或褪色物体等伪影方面改善程度如何?
主要发现
- DP-GAN 的 FID 达到 44.1,相比 OASIS(47.7)降低 3.6 分,表明图像质量显著提升。
- mIoU 得分为 73.6,相比 OASIS(69.3)提升 4.7 分,证明与真实标签的语义对齐能力更强。
- 物体级别的 mIoU 提升 5.9 分(从 61.5 提升至 67.4),表明在物体细节与真实感方面有显著改进。
- 将多尺度对抗损失($\mathcal{L}_{ms}$)加入判别器编码器分支时性能最佳,进一步提升了 FID 与 mIoU。
- 当将特征匹配损失($\mathcal{L}_{fm}$)应用于解码器时,mIoU 提升 3.7 分;但若应用于编码器则导致性能下降。
- 消融实验证实,所提生成器与判别器的组合至关重要,单独使用任一模块均无法达到最优结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。