Skip to main content
QUICK REVIEW

[论文解读] Time for a Background Check! Uncovering the impact of Background Features on Deep Neural Networks

Vikash Sehwag, Rajvardhan Oak|arXiv (Cornell University)|Jun 24, 2020
Advanced Image and Video Retrieval Techniques参考文献 32被引用 12
一句话总结

本文研究了背景特征如何影响深度神经网络(DNN)在图像分类任务中的表现。通过遮蔽前景内容或将背景替换为随机纹理,作者发现,随着模型容量的增加,最先进的DNN越来越依赖背景相关性以实现准确预测——然而,当背景被改变时,这些模型仍能保持较强的性能,表明其在背景依赖性与不变性之间存在复杂的权衡。

ABSTRACT

With increasing expressive power, deep neural networks have significantly improved the state-of-the-art on image classification datasets, such as ImageNet. In this paper, we investigate to what extent the increasing performance of deep neural networks is impacted by background features? In particular, we focus on background invariance, i.e., accuracy unaffected by switching background features and background influence, i.e., predictive power of background features itself when foreground is masked. We perform experiments with 32 different neural networks ranging from small-size networks to large-scale networks trained with up to one Billion images. Our investigations reveal that increasing expressive power of DNNs leads to higher influence of background features, while simultaneously, increases their ability to make the correct prediction when background features are removed or replaced with a randomly selected texture-based background.

研究动机与目标

  • 探究深度神经网络在准确图像分类中对背景特征的依赖程度。
  • 评估模型表达能力的增强是否加剧对背景相关性的依赖。
  • 评估DNN是否具备背景不变性——即在背景被替换或遮蔽时是否仍能保持准确率。
  • 考察当前的训练范式是否促进鲁棒的、基于语义的表征学习,还是助长了数据集偏差的利用。

提出的方法

  • 在ImageNet测试图像中遮蔽前景内容,仅使用背景特征评估top-1和top-5准确率。
  • 在保留前景内容的前提下,将原始背景替换为人工背景(白色、基于纹理的背景、高斯噪声、均匀噪声)。
  • 评估了32种多样化的DNN,涵盖从小型架构(如Howard et al.)到在最多十亿张图像上训练的大规模模型。
  • 通过背景切换后的性能下降程度来量化背景影响与不变性。
  • 报告三次随机运行的平均准确率,以确保可复现性并降低方差。
  • 在多个数据集(ImageNet、VOC12、Caltech101)上分析结果,以评估发现的泛化能力。

实验结果

研究问题

  • RQ1深度神经网络在多大程度上依赖背景特征以实现正确的图像分类预测?
  • RQ2随着模型表达能力的增强,网络对背景特征的依赖性如何变化?
  • RQ3当图像背景被更换时,DNN性能是否显著下降?这种下降是否随模型容量的增加而减少?
  • RQ4当前景被遮蔽时,DNN是否仍能保持高准确率,表明其与背景存在强相关性?
  • RQ5当前的训练范式是否足以学习背景不变的表征,还是更倾向于利用数据集偏差?

主要发现

  • 即使前景被遮蔽,最先进的DNN仅依靠背景特征即可实现非平凡的top-1准确率(例如,ResNet-18在ImageNet上达到约50%),表明其与背景内容存在强烈相关性。
  • 在仅使用背景的图像上,top-1准确率随模型表达能力的增强而提高,表明更大的网络能更有效地利用背景相关性。
  • 当背景被替换为白色或基于纹理的图像时,测试准确率显著下降——例如,从原始ImageNet图像的95%下降到白色背景VOC12图像的75%。
  • 背景切换后的性能差距随模型容量的增加而减小,表明更大的网络对背景变化更具鲁棒性。
  • 在Caltech101上,准确率从原始图像的94%下降到白色背景的85%,以及基于纹理背景的74%,证实了跨数据集的一致性下降。
  • 部分图像被更大的网络仅基于背景特征正确分类,而较小的网络则失败——表明深层模型中出现了依赖背景的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。