[论文解读] Pixel Level Data Augmentation for Semantic Image Segmentation using Generative Adversarial Networks
本文提出了一种基于 GAN 的像素级数据增强方法,用于语义图像分割,通过从合成的语义标签图生成逼真的图像,以平衡类别分布并提高分割精度。通过训练 Pix2PixHD GAN 将标签图转换为照片级真实感图像,该方法将平均 IoU 提升了最高 2.1%,并将低资源类别的准确率提升了最高 5.5%,优于传统的和基于风格迁移的增强方法。
Semantic segmentation is one of the basic topics in computer vision, it aims to assign semantic labels to every pixel of an image. Unbalanced semantic label distribution could have a negative influence on segmentation accuracy. In this paper, we investigate using data augmentation approach to balance the semantic label distribution in order to improve segmentation performance. We propose using generative adversarial networks (GANs) to generate realistic images for improving the performance of semantic segmentation networks. Experimental results show that the proposed method can not only improve segmentation performance on those classes with low accuracy, but also obtain 1.3% to 2.1% increase in average segmentation accuracy. It shows that this augmentation method can boost accuracy and be easily applicable to any other segmentation models.
研究动机与目标
- 为解决语义分割数据集中语义标签分布不均衡的问题,该问题会限制模型在罕见类别上的表现。
- 通过深度生成建模生成多样化且逼真的训练样本,提升分割精度,特别是对代表性不足类别的表现。
- 开发一种可扩展、即插即用的数据增强流水线,兼容任何现有的语义分割模型。
- 研究不同增强策略(单标签叠加、多标签叠加、重建)以及补充数据比例对分割性能的影响。
提出的方法
- 在真实图像及其对应语义标签图的配对数据上训练 Pix2PixHD 条件 GAN,以学习从标签图到照片级真实感图像的映射关系。
- 生成器网络以语义标签图为输入,生成逼真图像;判别器则通过最小最大损失目标区分真实图像与 GAN 生成的图像。
- 通过重建标签图来合成新训练数据:首先创建一个基础标签图(例如,天空、道路、建筑物),然后通过叠加额外的语义类别(例如,墙、围栏、灯柱)进行增强。
- 利用训练好的 GAN 从这些重建的标签图生成补充图像,从而增加数据多样性并平衡类别表示。
- 最终的训练集将原始图像与 GAN 生成的补充图像以不同比例(30%–70%)组合,以评估泛化能力和鲁棒性。
- 在增强后的数据集上微调分割模型,并使用平均交并比(mIoU)评估性能。
实验结果
研究问题
- RQ1基于 GAN 的像素级数据增强是否能有效提升代表性不足语义类别的分割精度?
- RQ2增强策略的选择(单标签叠加、多标签叠加或标签图重建)如何影响分割性能?
- RQ3为最大化分割精度,补充数据与原始数据的最佳比例是多少?
- RQ4与传统数据增强技术相比,GAN 生成的数据是否能同时提升类别特定和整体的平均 IoU?
主要发现
- 所提出的基于重建的增强方法实现了最高的平均 IoU(79.41%),相比基线模型提升了 2.1%。
- 在原始标签图中添加单一类别(例如,墙)使平均 IoU 提升 1.3%,并使该类别的 IoU 提升 5.0%。
- 添加多个类别(墙、围栏、灯柱、交通灯、火车)使平均 IoU 提升 1.5%,并使特定类别的准确率最高提升 5.5%。
- 训练的最优补充数据比例为 30% 至 70%,超过此范围后性能下降,原因可能是过拟合或分布偏移。
- 基于 GAN 的方法优于传统增强方法(如旋转、缩放)以及最先进的基于风格迁移的增强方法,实现了 2.1% 的 mIoU 提升。
- 基于重建的增强方法效果最佳,原因在于增强后的训练集中语义标签分布具有更高的多样性与更好的平衡性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。