[论文解读] Repaint: Improving the Generalization of Down-Stream Visual Tasks by Generating Multiple Instances of Training Examples
本文提出 Repaint,一种数据增强方法,通过模拟不同光照、季节或颜色,生成多样化且纹理多变的训练图像版本,同时保持物体形状和结构不变。该方法在多种网络架构和数据规模下,均能提升图像分类和目标检测等下游任务的泛化能力。
Convolutional Neural Networks (CNNs) for visual tasks are believed to learn both the low-level textures and high-level object attributes, throughout the network depth. This paper further investigates the `texture bias' in CNNs. To this end, we regenerate multiple instances of training examples from each original image, through a process we call `repainting'. The repainted examples preserve the shape and structure of the regions and objects within the scenes, but diversify their texture and color. Our method can regenerate a same image at different daylight, season, or weather conditions, can have colorization or de-colorization effects, or even bring back some texture information from blacked-out areas. The in-place repaint allows us to further use these repainted examples for improving the generalization of CNNs. Through an extensive set of experiments, we demonstrate the usefulness of the repainted examples in training, for the tasks of image classification (ImageNet) and object detection (COCO), over several state-of-the-art network architectures at different capacities, and across different data availability regimes.
研究动机与目标
- 研究卷积神经网络中的纹理偏差,即模型在视觉识别中更依赖纹理而非形状。
- 通过引入一种新颖的数据增强策略,缓解深度神经网络的过拟合与泛化能力差的问题。
- 开发一种生成语义一致、视觉多样但不改变物体结构的训练样本的方法。
- 提升模型在图像分类和目标检测任务中的鲁棒性与性能,适用于多种网络架构和数据规模。
- 证明经重绘的数据可作为通用、正交的数据增强技术,与现有训练流程兼容。
提出的方法
- 使用轻量级、可训练的生成模型(基于 GAN)执行‘重绘’——在保持物体形状和空间布局的前提下,替换输入图像的纹理和颜色。
- 利用弱监督或无监督的实例分割掩码(如 DeepLab-v2 或 Felzenszwalb-Huttenlocher)指导区域特定的重绘。
- 端到端训练生成模块,联合下游任务(如分类或检测)以优化与任务相关的纹理多样性。
- 将重绘后的图像作为增强训练数据,有效提升数据集多样性,且无需新增标注。
- 采用变分生成过程,为每张原始图像生成多个不同的重绘版本,增强数据增强能力。
- 将重绘模块作为可微分、原位增强层集成,支持与分类和检测模型的兼容。
实验结果
研究问题
- RQ1在保持形状不变的前提下,通过多样化纹理和颜色重绘图像,是否能提升下游视觉任务的泛化能力?
- RQ2与标准数据增强方法相比,该方法在不同网络架构下的性能增益如何?
- RQ3在低数据场景下(如 ImageNet 或 COCO 的 1% 或 10% 数据),该方法是否带来更大提升?
- RQ4性能增益对重绘过程中使用的分割掩码质量是否敏感?
- RQ5该方法是否无需架构修改即可有效应用于图像分类和目标检测任务?
主要发现
- 在 ImageNet 上,Repaint 在不同模型(从 MobileNetv2 到 ResNet-50)上均将 Top-1 准确率提升 +0.58% 至 +0.99%,使用 DeepLab-v2 掩码的平均提升达 +0.77%。
- 在 COCO 目标检测任务中,Repaint 在 EfficientDet 模型上将 mAP@0.50:0.95 提升 +1.10% 至 +1.59%,使用 DeepLab-v2 掩码的平均提升为 +1.22%。
- 该方法在低数据场景下提升最大:在仅使用 1% 训练数据时,ImageNet 上 Top-1 准确率提升 +4.09%,COCO 上 mAP 提升 +4.14%。
- 即使使用低质量分割掩码(如 FH),性能提升依然稳健,ImageNet 上平均提升 +0.64%,COCO 上平均提升 +0.96%。
- 计算开销可控,分类任务训练时间增加约 66%,检测任务增加约 53%,可通过模型压缩或选择性应用进一步降低。
- 重绘样本使模型能学习到更鲁棒的特征,表现为在分布偏移下的泛化能力提升,且过拟合现象减少,尤其在低数据设置中表现显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。