[论文解读] PMC-GANs: Generating Multi-Scale High-Quality Pedestrian with Multimodal Cascaded GANs
本文提出PMC-GANs,一种多模态级联生成对抗网络框架,通过使用多尺度和注意力残差块的残差U-Net生成器,生成高质量、多样化、多尺度的行人图像。通过采用实例级掩码和从粗到精的级联结构,PMC-GANs显著提升了真实感和分辨率,在FID分数上达到最先进水平,并在数据增强中有效提升了行人检测性能。
Recently, generative adversarial networks (GANs) have shown great advantages in synthesizing images, leading to a boost of explorations of using faked images to augment data. This paper proposes a multimodal cascaded generative adversarial networks (PMC-GANs) to generate realistic and diversified pedestrian images and augment pedestrian detection data. The generator of our model applies a residual U-net structure, with multi-scale residual blocks to encode features, and attention residual blocks to help decode and rebuild pedestrian images. The model constructs in a coarse-to-fine fashion and adopts cascade structure, which is beneficial to produce high-resolution pedestrians. PMC-GANs outperforms baselines, and when used for data augmentation, it improves pedestrian detection results.
研究动机与目标
- 为解决行人检测中数据增强所面临的缺乏真实感、多样化和高分辨率行人图像的问题。
- 克服现有基于生成对抗网络方法的局限性,如由于使用矩形掩码和一一映射导致的人工融合边缘和细节质量差的问题。
- 以从粗到精的方式生成多尺度行人图像(64×64、128×128、256×256),以提升真实感和分辨率。
- 通过注入掩码潜在代码并使用实例级掩码替代边界框掩码,增强生成行人图像的多样性与真实感。
- 通过数据增强验证生成图像在提升行人检测模型性能方面的有效性。
提出的方法
- 生成器采用带有编码器中多尺度残差块以捕捉多尺度特征,以及解码器中注意力残差块以在重建过程中强调关键特征的残差U-Net架构。
- 使用实例级行人掩码作为条件输入,替代矩形掩码,以提升真实感并改善融合与遮挡处理能力。
- 在编码器的每个中间块中注入掩码潜在代码,以鼓励生成行人图像的多样性。
- 模型采用三阶段级联架构,每个阶段逐步提升生成图像的分辨率(64×64、128×128、256×256),较高阶段以较低阶段的输出作为输入。
- 判别器与生成器进行最小最大博弈训练,以区分真实与生成图像,推动生成器学习真实数据分布。
- 在数据增强中,通过基于语义标签指导的像素级替换策略,将合成行人图像融合到真实背景图像中,以准确放置于人行道和道路上。
实验结果
研究问题
- RQ1具有多尺度和注意力机制的级联生成对抗网络架构是否能比现有方法生成更真实、更多样化的行人图像?
- RQ2使用实例级掩码而非矩形掩码是否能提升生成行人图像的真实感和融合质量?
- RQ3注入掩码潜在代码在多大程度上增强了生成行人样本的多样性?
- RQ4PMC-GANs能否有效生成高达256×256的高分辨率行人图像,具备精细细节和一致光照?
- RQ5使用PMC-GANs生成的图像进行数据增强,是否能提升行人检测模型在真实世界基准上的性能?
主要发现
- PMC-GANs在64×64时达到10.08的SOTA FID分数,在128×128时为16.71,在256×256时为22.48,显著优于PS-GAN和Pix2Pix等基线模型。
- 在CityPersons数据集上,该模型将行人检测的平均错误率(MR)降低至×1时为12.4,×1.3时为11.2,×1.5时为10.5;当与GAN增强数据结合时,进一步提升至12.4、11.2和10.5。
- 使用实例级掩码可减少人工融合边缘,显著提升生成质量,尤其在遮挡条件下表现更优。
- 级联架构支持渐进式优化,256×256阶段在该分辨率下所有对比模型中取得最佳FID分数。
- 由于注入了掩码潜在代码,模型能生成姿态和外观多样的行人图像,有效避免模式崩溃。
- 尽管性能有所提升,生成行人与背景之间仍存在光照不一致的问题,表明未来工作需进一步关注光照一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。