Skip to main content
QUICK REVIEW

[论文解读] Towards Robust Vision Transformer

Xiaofeng Mao, Gege Qi|arXiv (Cornell University)|May 17, 2021
Advanced Neural Network Applications参考文献 51被引用 9
一句话总结

本文提出鲁棒视觉Transformer(RVT)及其增强版本RVT∗,通过识别标准视觉Transformer中的有害组件,并引入两种即插即用技术——位置感知注意力缩放(PAAS)和逐块增强——显著提升了模型在对抗样本、分布偏移和图像噪声下的鲁棒性。RVT∗在多个鲁棒性基准测试中达到最先进性能,包括在ImageNet-C、ImageNet-Sketch和ImageNet-R上的top-1准确率。

ABSTRACT

Recent advances on Vision Transformer (ViT) and its improved variants have shown that self-attention-based networks surpass traditional Convolutional Neural Networks (CNNs) in most vision tasks. However, existing ViTs focus on the standard accuracy and computation cost, lacking the investigation of the intrinsic influence on model robustness and generalization. In this work, we conduct systematic evaluation on components of ViTs in terms of their impact on robustness to adversarial examples, common corruptions and distribution shifts. We find some components can be harmful to robustness. By using and combining robust components as building blocks of ViTs, we propose Robust Vision Transformer (RVT), which is a new vision transformer and has superior performance with strong robustness. We further propose two new plug-and-play techniques called position-aware attention scaling and patch-wise augmentation to augment our RVT, which we abbreviate as RVT*. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous ViTs and state-of-the-art CNNs. Furthermore, RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at \url{https://github.com/alibaba/easyrobust}.

研究动机与目标

  • 系统评估视觉Transformer(ViTs)中关键组件对模型鲁棒性的影响,包括对抗样本、常见噪声和分布偏移。
  • 识别现有ViT架构中虽提升标准准确率但降低鲁棒性的组件。
  • 仅使用鲁棒组件设计新型视觉Transformer架构RVT,以提升泛化能力和鲁棒性。
  • 开发两种即插即用技术——位置感知注意力缩放(PAAS)和逐块增强——以进一步提升ViTs的鲁棒性和准确率。
  • 在ImageNet及六个鲁棒性基准上验证RVT和RVT∗,展示其在标准准确率与鲁棒性之间更优的权衡。

提出的方法

  • 通过用鲁棒替代组件替换标准ViT中的有害组件,提出鲁棒视觉Transformer(RVT),重点关注图像块嵌入、位置编码、Transformer块和分类头。
  • 提出位置感知注意力缩放(PAAS),通过学习基于位置感知相关强度来缩放注意力图,过滤自注意力中的噪声位置相关性。
  • 开发一种逐块增强技术,将数据增强(如随机裁剪、噪声、翻转)直接应用于图像块序列,提升训练多样性并减少过拟合。
  • 在多个Transformer块中应用PAAS,消融实验表明在5–10个块中应用时性能最佳,增益趋于饱和。
  • 将PAAS与逐块增强结合,形成RVT∗,一种可应用于任意ViT主干网络的即插即用增强方法。
  • 在ImageNet上采用标准训练协议,并通过消融研究验证不同ViT变体(如DeiT-Ti、ConViT-Ti、PiT-Ti)中各组件的贡献。

实验结果

研究问题

  • RQ1哪些视觉Transformer组件尽管提升了标准准确率,却对鲁棒性产生负面影响?
  • RQ2位置编码和注意力机制的选择如何影响模型对对抗样本和分布偏移的鲁棒性?
  • RQ3是否可以通过仅使用鲁棒组件系统性地重新设计视觉Transformer,以在不牺牲准确率的前提下实现更强鲁棒性?
  • RQ4即插即用技术如PAAS和逐块增强在多大程度上能提升不同ViT架构下的标准准确率和鲁棒准确率?
  • RQ5所提出的RVT在ImageNet-C、ImageNet-Sketch和ImageNet-R等多个鲁棒性基准上与最先进CNN和ViT相比表现如何?

主要发现

  • RVT-S∗在ImageNet-Sketch上达到46.9%的top-1准确率,在ImageNet-R上达到35.0%的top-1准确率,创下两项基准的新SOTA记录。
  • 在ImageNet-C上,RVT-S∗实现了top-1鲁棒准确率,优于此前的SOTA模型。
  • PAAS与逐块增强的结合在多个ViT架构上平均使标准准确率提升超过1%,鲁棒准确率提升超过5%。
  • 在5–10个Transformer块中应用PAAS可获得最佳性能增益,进一步应用则收益递减。
  • 在所测试的增强方法中,使用随机高斯噪声的逐块增强提供了最显著的鲁棒性提升。
  • RVT与RVT∗在FLOPs、标准准确率与鲁棒性之间的权衡上,优于所有对比的ViT及最先进CNN模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。