Skip to main content
QUICK REVIEW

[论文解读] Exploring Corruption Robustness: Inductive Biases in Vision Transformers and MLP-Mixers

Katelyn Morrison, Benjamin Gilby|arXiv (Cornell University)|Jun 24, 2021
Adversarial Robustness in Machine Learning参考文献 20被引用 9
一句话总结

本文通过在 ImageNet-C 和纹理线索冲突数据集上使用预训练模型,研究了视觉变换器、MLP-Mixers 和 CNN 在数据扰动鲁棒性与形状偏差方面的表现。研究发现,视觉变换器在本质上比 CNN 和 MLP-Mixers 更具抗扰动能力,且表现出更强的形状偏差,其中参数更少的 DeiT-tiny 模型在参数量仅为 ResNet-50 五分之一的情况下,性能仍更优。

ABSTRACT

Recently, vision transformers and MLP-based models have been developed in order to address some of the prevalent weaknesses in convolutional neural networks. Due to the novelty of transformers being used in this domain along with the self-attention mechanism, it remains unclear to what degree these architectures are robust to corruptions. Despite some works proposing that data augmentation remains essential for a model to be robust against corruptions, we propose to explore the impact that the architecture has on corruption robustness. We find that vision transformer architectures are inherently more robust to corruptions than the ResNet-50 and MLP-Mixers. We also find that vision transformers with 5 times fewer parameters than a ResNet-50 have more shape bias. Our code is available to reproduce.

研究动机与目标

  • 评估并比较视觉变换器、MLP-Mixers 和 CNN 在数据扰动下的鲁棒性。
  • 探究形状偏差与图像扰动鲁棒性之间的关系。
  • 确定架构归纳偏差(尤其是自注意力机制)是否在不依赖数据增强的情况下独立促进鲁棒性。
  • 评估小型视觉变换器模型是否能在鲁棒性和形状偏差方面达到甚至超过大型 CNN。

提出的方法

  • 对三种架构(ResNet-50、视觉变换器(ViT、DeiT、Swin、CaiT)、MLP-Mixers(Base、Large))的 20 个预训练模型进行评估。
  • 在 ImageNet-C 上测量平均扰动误差(mCE)以量化扰动鲁棒性。
  • 利用纹理线索冲突数据集评估形状偏差,其中形状与纹理线索冲突。
  • 分析不同模型间形状偏差与 mCE 的相关性,以识别架构对鲁棒性的影响。
  • 比较参数量不同的模型,以评估模型规模在鲁棒性和偏差中的作用。
  • 使用标准 ImageNet 的 top-1 准确率和 mCE 评估模型在干净图像和带扰动图像上的性能。

实验结果

研究问题

  • RQ1视觉变换器是否在常见图像扰动下比 CNN 和 MLP-Mixers 具有更强的鲁棒性?
  • RQ2在不同架构之间,形状偏差与扰动鲁棒性是否存在相关性?
  • RQ3小型视觉变换器模型能否在扰动鲁棒性和形状偏差方面优于大型 CNN?
  • RQ4架构归纳偏差(如自注意力机制)在不依赖数据增强的情况下,对鲁棒性的贡献程度如何?
  • RQ5不同视觉变换器变体(如 Swin、DeiT、ViT)在形状偏差和 mCE 方面如何比较?

主要发现

  • 视觉变换器在所有模型中均持续优于 CNN 和 MLP-Mixers 的扰动鲁棒性,其中 Swin-T_large 模型的 mCE 最低,仅为 34.63%。
  • 参数量仅 500 万的 DeiT_tiny 视觉变换器模型,其形状偏差达到 29.37%,优于参数量大五倍的 ResNet-50(26.17%)。
  • 形状偏差与 mCE 之间存在显著的负相关关系:形状偏差越高,对扰动的鲁棒性越强,支持了形状偏差可增强鲁棒性的假设。
  • MLP-Mixers 展现出中等水平的形状偏差(36.90%–38.64%),在 ImageNet-C 上的表现与 CNN 相当,但其鲁棒性仍低于视觉变换器。
  • Swin-T_large 模型在 top-1 准确率(85.92%)和 mCE(34.63%)方面均表现最佳,表明其基于层次窗口的自注意力机制有助于提升全局表征能力和鲁棒性。
  • 未发现模型规模(参数数量)与形状偏差或 mCE 之间存在明确相关性,表明鲁棒性主要由架构设计决定,而非模型规模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。