[论文解读] Are Transformers More Robust Than CNNs?
简要结论:统一的训练设置下,CNNs 和 Transformers 在对抗鲁棒性方面表现相似,而 Transformers 的自注意力架构提升了对分布外数据的鲁棒性。
Transformer emerges as a powerful tool for visual recognition. In addition to demonstrating competitive performance on a broad range of visual benchmarks, recent works also argue that Transformers are much more robust than Convolutions Neural Networks (CNNs). Nonetheless, surprisingly, we find these conclusions are drawn from unfair experimental settings, where Transformers and CNNs are compared at different scales and are applied with distinct training frameworks. In this paper, we aim to provide the first fair & in-depth comparisons between Transformers and CNNs, focusing on robustness evaluations. With our unified training setup, we first challenge the previous belief that Transformers outshine CNNs when measuring adversarial robustness. More surprisingly, we find CNNs can easily be as robust as Transformers on defending against adversarial attacks, if they properly adopt Transformers' training recipes. While regarding generalization on out-of-distribution samples, we show pre-training on (external) large-scale datasets is not a fundamental request for enabling Transformers to achieve better performance than CNNs. Moreover, our ablations suggest such stronger generalization is largely benefited by the Transformer's self-attention-like architectures per se, rather than by other training setups. We hope this work can help the community better understand and benchmark the robustness of Transformers and CNNs. The code and models are publicly available at https://github.com/ytongbai/ViTs-vs-CNNs.
研究动机与目标
- 促成一个公平的基准测试,比较 CNNs 和 Transformers 在鲁棒性方面的表现,而不是偏见的、规模差异显著的评估
- 在扰动型和补丁型攻击下评估对抗鲁棒性
- 在分布外基准(ImageNet-A、ImageNet-C、Stylized-ImageNet)上评估鲁棒性泛化
- 研究训练配方和架构如何影响鲁棒性结论
- 为跨架构的鲁棒性基准测试提供可执行的指导
提出的方法
- 在对齐的模型容量下训练 ResNet-50 (CNN) 和 DeiT-S (Transformer)(约 22–25M 参数)
- 使用标准 CNN 的 100 轮训练和遵循 DeiT 方案的 DeiT-S 的 100 轮训练
- 对 AutoAttack、PGD 变体和 Texture Patch Attack (TPA) 评估对抗鲁棒性
- 在分布外数据集 ImageNet-A、ImageNet-C、Stylized-ImageNet 上评估鲁棒性
- 进行消融研究:优化器、学习率调度、增强策略(RandAug、Mixup、CutMix)、激活函数(ReLU vs GELU)
- 探索蒸馏与混合架构以测试跨架构的鲁棒性迁移
实验结果
研究问题
- RQ1在公平、对齐的训练条件下,Transformers 天生就比 CNNs 在对抗鲁棒性方面表现更好吗?
- RQ2将 Transformers 的训练配方应用于 CNNs 是否能提升它们的对抗鲁棒性?
- RQ3Transformers 是否在不依赖于大规模预训练的情况下对分布外数据具有更强的鲁棒性?
- RQ4Transformers 的鲁棒性优势主要是由于其自注意力样式架构还是由于训练过程?
主要发现
- 在统一的训练条件下,Transformers 在基于扰动的对抗攻击上并不比 CNNs 更鲁棒。
- 使用 CNN 风格的训练配方进行对抗训练在使用 GELU 时可以达到 DeiT-S 的鲁棒性,但相比标准 CNN 训练可能降低无干净精度。
- 在强烈增强(如 CutMix)的帮助下,CNNs 能显著提升对补丁式攻击的鲁棒性,在某些设置下接近甚至超越 Transformers。
- 即使没有大规模外部预训练,Transformers 在分布外泛化基准(ImageNet-A、ImageNet-C、Stylized-ImageNet)上也始终优于 CNNs。
- 分布外数据的鲁棒性差距主要归因于架构(自注意力),而非仅训练设置,因为包含 Transformer 块的混合模型在鲁棒性上优于 CNNs。
- 知识蒸馏传递鲁棒性:以 DeiT-S 作为教师可以提升学生 ResNet-50 的鲁棒性,但相反(以 ResNet-50 作为教师)则未能带来同样的鲁棒性提升,提示结构鲁棒性不易通过蒸馏转移。
- 在模型尺寸对比(ResNet-18/50/101 vs DeiT-Mini/S)中,Transformers 一致展示出更强的对分布外数据的鲁棒性泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。