[论文解读] SnapMix: Semantically Proportional Mixing for Augmenting Fine-grained Data
SnapMix 提出了一种用于细粒度图像识别的新颖数据增强方法,通过使用类激活图(CAMs)估计语义构成来减少标签噪声。与基于像素的混合方法不同,它根据语义相关性而非面积比例来计算标签比例,从而在多个数据集和网络深度(包括 ResNet 和 DenseNet 架构)上持续优于现有方法。
Data mixing augmentation has proved effective in training deep models. Recent methods mix labels mainly based on the mixture proportion of image pixels. As the main discriminative information of a fine-grained image usually resides in subtle regions, methods along this line are prone to heavy label noise in fine-grained recognition. We propose in this paper a novel scheme, termed as Semantically Proportional Mixing (SnapMix), which exploits class activation map (CAM) to lessen the label noise in augmenting fine-grained data. SnapMix generates the target label for a mixed image by estimating its intrinsic semantic composition, and allows for asymmetric mixing operations and ensures semantic correspondence between synthetic images and target labels. Experiments show that our method consistently outperforms existing mixed-based approaches on various datasets and under different network depths. Furthermore, by incorporating the mid-level features, the proposed SnapMix achieves top-level performance, demonstrating its potential to serve as a solid baseline for fine-grained recognition. Our code is available at https://github.com/Shaoli-Huang/SnapMix.git.
研究动机与目标
- 解决现有数据混合方法在应用于细粒度识别时出现的严重标签噪声问题。
- 通过确保合成图像与其标签之间的语义一致性,提升数据增强的有效性。
- 实现非对称混合操作,以在保持标签一致性的同时增加数据多样性。
- 开发一种鲁棒且通用的细粒度识别基线方法,即使在浅层网络上也能表现良好。
提出的方法
- 使用类激活图(CAMs)估计每个像素对其预测类别语义相关性的程度。
- 将 CAMs 归一化为语义百分比图(SPM),其中每个像素的值表示其对类别的相对贡献。
- 通过求和区域内 SPM 值来计算图像区域的语义比例,以确定其内在语义构成。
- 基于语义比例而非像素面积比例生成混合图像标签,确保与实际语义内容更好地对齐。
- 通过解耦图像混合与标签混合,支持非对称的剪切-粘贴混合操作,从而实现多样化增强。
- 采用超参数 α 的 Beta 分布来采样随机补丁用于混合,实验表明对 α 的变化具有鲁棒性。
实验结果
研究问题
- RQ1通过 CAMs 估计语义构成是否能减少细粒度识别中混合数据的标签噪声?
- RQ2与基于面积的混合相比,基于语义比例的混合是否在模型准确率和泛化能力上表现更优?
- RQ3非对称混合操作是否能在不降低标签一致性的情况下提升数据多样性?
- RQ4当从零开始训练且不使用 ImageNet 预训练时,SnapMix 的表现如何?
- RQ5该方法在不同 CNN 架构和超参数设置下是否具有鲁棒性?
主要发现
- 在 CUB 数据集上,SnapMix 在使用 ResNet-18 从零开始训练时达到 70.31% 的 top-1 准确率,优于 CutMix(60.03%)和 MixUp(67.63%)。
- 在 CUB 数据集上,SnapMix 将 ResNet-50 的准确率从基线的 66.92% 提升至 72.39%,超过 CutMix 和 MixUp。
- 在 InceptionV3 上,SnapMix 达到 85.54% 的准确率,超过 CutMix(84.31%)和 MixUp(83.83%)。
- 在 DenseNet121 上,SnapMix 达到 87.42% 的准确率,显著优于 CutMix(86.11%)和 MixUp(86.65%)。
- 该方法对超参数 α 具有鲁棒性,准确率在测试的 α 值范围内仅在 87.37% 附近波动 ±0.5%。
- 消融研究显示,基于语义比例的标签混合对性能提升贡献最大,而非对称混合则带来微小但稳定的改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。