Skip to main content
QUICK REVIEW

[论文解读] Attentive Normalization for Conditional Image Generation

Yi Wang, Ying-Cong Chen|arXiv (Cornell University)|Apr 8, 2020
Generative Adversarial Networks and Image Synthesis参考文献 57被引用 5
一句话总结

本文提出了一种新型归一化模块——注意力归一化(Attentive Normalization, AN),通过从特征图中学习语义布局并在语义一致区域内应用实例归一化,增强了条件图像生成中的长距离依赖建模能力。AN 在 ImageNet(128×128)类别条件生成任务上实现了 17.84 的 SOTA FID 分数,优于自注意力 GAN(18.65),且计算成本显著更低。

ABSTRACT

Traditional convolution-based generative adversarial networks synthesize images based on hierarchical local operations, where long-range dependency relation is implicitly modeled with a Markov chain. It is still not sufficient for categories with complicated structures. In this paper, we characterize long-range dependence with attentive normalization (AN), which is an extension to traditional instance normalization. Specifically, the input feature map is softly divided into several regions based on its internal semantic similarity, which are respectively normalized. It enhances consistency between distant regions with semantic correspondence. Compared with self-attention GAN, our attentive normalization does not need to measure the correlation of all locations, and thus can be directly applied to large-size feature maps without much computational burden. Extensive experiments on class-conditional image generation and semantic inpainting verify the efficacy of our proposed module.

研究动机与目标

  • 解决卷积网络在复杂结构化图像中建模长距离空间依赖关系的局限性。
  • 克服自注意力机制在图像生成过程中大尺寸特征图上带来的高计算成本。
  • 通过显式建模远距离区域之间的语义对应关系,提升生成图像的语义一致性和结构连贯性。
  • 开发一种归一化技术,在减少标准实例归一化带来的空间退化的同时,保留并增强高层语义信息。
  • 实现高效、可扩展的长距离建模,适用于大规模图像生成与图像修复任务。

提出的方法

  • 提出注意力归一化(AN),首先利用基于语义实体聚类的可学习模块从输入特征图中预测语义布局。
  • 采用自采样正则化(SSR)防止语义布局预测趋于平凡,确保有意义的区域划分。
  • 在每个语义区域内独立应用实例归一化,以压缩特征分布并增强区域间的语义一致性。
  • 将 AN 作为即插即用模块集成到现有 GAN 架构中,替代或补充标准归一化层。
  • 通过语义实体数量 $ n $ 控制区域划分的精细程度,选择 $ n=16 $ 作为性能与效率之间的平衡点。
  • 通过避免完整的成对注意力计算,转而依赖局部化、基于区域的归一化,确保计算效率。

实验结果

研究问题

  • RQ1可学习的语义布局预测是否能提升条件图像生成中长距离特征依赖建模能力?
  • RQ2基于语义相似性的区域实例归一化是否能增强生成图像的结构连贯性和语义对应关系?
  • RQ3AN 是否能在显著降低计算成本的前提下,实现与自注意力 GAN 相当或更优的性能?
  • RQ4语义实体数量 $ n $ 如何影响生成图像的质量与效率?
  • RQ5自采样正则化在多大程度上提升了学习到的语义布局质量及下游生成结果?

主要发现

  • 在 ImageNet(128×128)类别条件图像生成任务上,注意力归一化实现了 17.84 的 Fréchet Inception 距离(FID),优于自注意力 GAN(18.65)和无长距离建模基线模型(22.96)。
  • 在相同模型容量与训练设置下,当 $ n=16 $ 时,AN 将 Inception Score(IS)提升至 46.57,FID 降低至 17.84,表明图像质量与多样性更优。
  • 消融实验证实自采样正则化(SSR)至关重要:移除 SSR 后 FID 上升至 23.58,几乎与标准实例归一化性能相当。
  • AN 展现出卓越的计算效率:在 1024×1024 分辨率下,AN 耗时 37.68ms,而自注意力因 GPU 内存溢出无法测量,AN 的计算时间呈线性增长,而自注意力呈二次方增长。
  • 在巴黎街景图像修复任务中,AN 实现 PSNR 25.09、SSIM 0.8541 和 MAE 0.0334,优于 CA 基线,在视觉质量与定量指标上均表现更优。
  • 消融分析表明,实例归一化(IN)在区域归一化中优于批量归一化(BN),FID 分别为 17.84(IN)与 19.59(BN),证实 IN 更适合本任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。