Skip to main content
QUICK REVIEW

[论文解读] Learning Visual Representations for Transfer Learning by Suppressing Texture

Shlok Mishra, Anshul Shah|arXiv (Cornell University)|Nov 3, 2020
Domain Adaptation and Few-Shot Learning参考文献 41被引用 4
一句话总结

本文提出通过各向异性扩散抑制 ImageNet 图像中的纹理,作为数据增强技术,以促使 CNN 学习更高层次的、基于形状的表征,而非依赖纹理偏差。该方法在 12 个多样化数据集上的迁移学习性能得到提升,Sketch-ImageNet 上准确率最高提升 11.49%,Synthetic-DTD 上提升 10.41%,表明对低层次线索的依赖性降低。

ABSTRACT

Recent literature has shown that features obtained from supervised training of CNNs may over-emphasize texture rather than encoding high-level information. In self-supervised learning in particular, texture as a low-level cue may provide shortcuts that prevent the network from learning higher level representations. To address these problems we propose to use classic methods based on anisotropic diffusion to augment training using images with suppressed texture. This simple method helps retain important edge information and suppress texture at the same time. We empirically show that our method achieves state-of-the-art results on object detection and image classification with eight diverse datasets in either supervised or self-supervised learning tasks such as MoCoV2 and Jigsaw. Our method is particularly effective for transfer learning tasks and we observed improved performance on five standard transfer learning datasets. The large improvements (up to 11.49\%) on the Sketch-ImageNet dataset, DTD dataset and additional visual analyses with saliency maps suggest that our approach helps in learning better representations that better transfer.

研究动机与目标

  • 为解决 CNN 过度依赖纹理和低层次特征的问题,这会阻碍其在不同领域间的泛化能力。
  • 通过鼓励模型关注高层次、基于形状的表征而非纹理,提升迁移学习性能。
  • 开发一种简单而有效的数据增强方法,以抑制纹理同时保留结构边缘。
  • 在监督学习和自监督学习设置下,优于现有的方法(如高斯模糊和 Stylized-ImageNet)。

提出的方法

  • 对 ImageNet 图像应用各向异性扩散,以抑制纹理同时保留边缘和结构边界。
  • 使用 Perona-Malik 和鲁棒各向异性扩散框架生成纹理抑制图像,用于数据增强。
  • 将增强后的数据集整合到预训练中,适用于监督学习和自监督学习(如 MoCoV2、Dense-CL)。
  • 与基线方法(包括高斯模糊和 Stylized-ImageNet)进行比较,使用相同的训练协议。
  • 在增强数据集上训练模型,并在多样化的基准测试集上评估下游迁移学习任务的表现。
  • 使用 Pix2Pix 学习条件图像到图像的转换以实现纹理抑制,性能优于风格迁移或模糊化方法。

实验结果

研究问题

  • RQ1在 ImageNet 图像中抑制纹理是否能提升预训练 CNN 在下游迁移学习任务中的泛化能力?
  • RQ2基于各向异性扩散的数据增强是否能生成对纹理依赖性更低、更关注形状和结构的表征?
  • RQ3在多种数据集上,纹理抑制与高斯模糊和风格迁移相比,在性能和鲁棒性方面如何?
  • RQ4所提出的方法在多大程度上减少了 CNN 对高频纹理线索的依赖?
  • RQ5该方法是否能提升在纹理为虚假线索的数据集(如 Synthetic-DTD 和 GST)上的性能?

主要发现

  • 该方法在 Sketch-ImageNet 上实现了 11.49% 的准确率提升,表明对高层次、基于形状的表征学习能力更强。
  • 在 Synthetic-DTD 数据集上,模型性能提升了 10.41%,证实了对纹理的依赖性降低并改善了泛化能力。
  • 在多个迁移学习基准测试中(包括 VOC、DTD、Cars 和 Aircraft),该方法优于高斯模糊和 Stylized-ImageNet。
  • 显著性图的定性分析表明,模型对高频纹理信息的依赖性降低,更关注结构特征。
  • 使用简单的 Perona-Malik 各向异性扩散方法取得了最佳性能,而增加迭代次数因分布偏移导致性能下降。
  • 在 GST 数据集上,模型在基于形状的分类任务中提升了 1.02%,表明纹理偏差减少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。