[论文解读] Does enhanced shape bias improve neural network robustness to common corruptions?
本文研究了增强的形状偏差是否能提升深度神经网络对常见图像损坏的鲁棒性。通过使用边缘图和图像风格化进行数据增强,作者发现尽管形状偏差有所提高,但损坏鲁棒性的主要驱动力是强大的数据增强——尤其是风格化——而非形状偏差本身,后者是结果而非因果因素。
Convolutional neural networks (CNNs) learn to extract representations of complex features, such as object shapes and textures to solve image recognition tasks. Recent work indicates that CNNs trained on ImageNet are biased towards features that encode textures and that these alone are sufficient to generalize to unseen test data from the same distribution as the training data but often fail to generalize to out-of-distribution data. It has been shown that augmenting the training data with different image styles decreases this texture bias in favor of increased shape bias while at the same time improving robustness to common corruptions, such as noise and blur. Commonly, this is interpreted as shape bias increasing corruption robustness. However, this relationship is only hypothesized. We perform a systematic study of different ways of composing inputs based on natural images, explicit edge information, and stylization. While stylization is essential for achieving high corruption robustness, we do not find a clear correlation between shape bias and robustness. We conclude that the data augmentation caused by style-variation accounts for the improved corruption robustness and increased shape bias is only a byproduct.
研究动机与目标
- 测试卷积神经网络中增强的形状偏差是否能提升对常见图像损坏(如模糊和噪声)的鲁棒性。
- 分离形状偏差与数据增强在提升损坏鲁棒性方面的影响。
- 评估基于形状的表征是否本质上更具鲁棒性,还是鲁棒性源于增强带来的更广泛的数据分布多样性。
- 研究归一化层自适应是否能在不微调的情况下提升鲁棒性,从而表明网络内部表征具有可适应性。
提出的方法
- 在ImageNet图像的边缘图上预训练CNN,以促进基于形状的特征学习,同时抑制纹理线索。
- 通过神经风格迁移应用图像风格化,以改变纹理但保留结构形状信息。
- 将边缘图与风格化结合,生成最大化形状偏差但无纹理信息的输入。
- 通过从均匀分布中采样归一化层仿射参数来引入风格随机化,以进一步增强形状偏差。
- 在ImageNet-C基准上评估模型,以测量在多种损坏类型和严重程度下的鲁棒性。
- 仅在损坏的ImageNet-C数据上微调归一化层的仿射参数,以评估网络内部表征的适应能力。
实验结果
研究问题
- RQ1通过基于边缘或风格化数据增强提高形状偏差,是否能提升对常见图像损坏的鲁棒性?
- RQ2观察到的损坏鲁棒性提升是源于增强的形状偏差,还是源于风格化带来的更广泛数据增强?
- RQ3仅微调归一化层参数是否能提升在损坏数据上的鲁棒性,表明鲁棒表征编码在神经网络的内部特征中?
- RQ4不同输入组合——自然图像、边缘图、风格化图像及其组合——如何影响形状偏差和损坏鲁棒性?
主要发现
- 在边缘图上预训练显著提高了形状偏差,但并未提升损坏鲁棒性,这与形状偏差驱动鲁棒性的假设相矛盾。
- 基于风格化的数据增强(SIN)实现了最高的损坏鲁棒性,而仅使用边缘图的预训练(E)尽管形状偏差很高,但表现较差,表明风格化而非形状偏差是关键因素。
- 风格化边缘的组合(SE)实现了最高的形状偏差,但其鲁棒性仍低于SIN,表明保留自然图像结构对鲁棒性至关重要。
- 将风格化边缘叠加在自然图像上(SE+IN)实现了中等形状偏差,并且鲁棒性略好于SIN,表明自然图像结构与风格化结合能增强泛化能力。
- 仅微调归一化层仿射参数显著提升了所有损坏类型下的鲁棒性,即使卷积权重固定不变,表明鲁棒表征编码在神经网络的归一化层中。
- 同分布风格化(intra-stylization)几乎与分布外风格化一样有效,表明关键优势在于外观多样性,而非分布偏移本身。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。