Skip to main content
QUICK REVIEW

[论文解读] Can CNNs Be More Robust Than Transformers?

Zeyu Wang, Yutong Bai|arXiv (Cornell University)|Jun 7, 2022
Advanced Neural Network Applications被引用 14
一句话总结

本论文表明,通过引入三种简单的架构改进,卷积神经网络(CNNs)可以实现与视觉变换器(Vision Transformers)相当甚至更优的鲁棒性:将输入图像划分为不重叠的图像块,使用大卷积核(例如11×11),并减少归一化层与激活函数层。在不使用任何自注意力机制的情况下,所提出的Robust-ResNet在多个分布外(out-of-distribution)基准测试中表现优于DeiT-S,包括在ImageNet-R上实现4.0%的准确率提升,在ImageNet-Sketch上实现3.9%的提升。

ABSTRACT

The recent success of Vision Transformers is shaking the long dominance of Convolutional Neural Networks (CNNs) in image recognition for a decade. Specifically, in terms of robustness on out-of-distribution samples, recent research finds that Transformers are inherently more robust than CNNs, regardless of different training setups. Moreover, it is believed that such superiority of Transformers should largely be credited to their self-attention-like architectures per se. In this paper, we question that belief by closely examining the design of Transformers. Our findings lead to three highly effective architecture designs for boosting robustness, yet simple enough to be implemented in several lines of code, namely a) patchifying input images, b) enlarging kernel size, and c) reducing activation layers and normalization layers. Bringing these components together, we are able to build pure CNN architectures without any attention-like operations that are as robust as, or even more robust than, Transformers. We hope this work can help the community better understand the design of robust neural architectures. The code is publicly available at https://github.com/UCSC-VLAA/RobustCNN.

研究动机与目标

  • 挑战当前普遍认为视觉变换器因自注意力机制而天然比CNN更具鲁棒性的观点。
  • 识别视觉变换器中对鲁棒性提升有贡献的具体架构组件,且独立于自注意力机制。
  • 设计一种简单而有效的基于CNN的架构,在不使用注意力机制的前提下,实现与视觉变换器相当或更优的鲁棒性。
  • 证明仅通过架构设计即可实现鲁棒性提升,而无需依赖训练策略或数据增强。

提出的方法

  • 将输入图像划分为非重叠的图像块,且更大的图像块尺寸被证明可提升鲁棒性。
  • 用大卷积核(如7×7或11×11)替代标准的小卷积核(如3×3),以增强感受野的全局性并提升鲁棒性。
  • 减少归一化层(如BatchNorm)和激活函数(如GELU)的数量,以最小化分布偏移并改善泛化能力。
  • 将上述三项改进整合到修改后的ResNet架构中,形成名为Robust-ResNet的模型,以评估其协同效应。
  • 采用知识蒸馏方法,以DeiT-S作为教师模型,验证性能提升源于架构设计而非训练动态。
  • 将架构扩展至更大规模(如DeiT-Base级别),以测试所提出设计原则的泛化性与可扩展性。

实验结果

研究问题

  • RQ1视觉变换器中哪些架构组件对其优越的分布外鲁棒性贡献最大?
  • RQ2在不使用自注意力机制的前提下,纯CNN架构能否实现与视觉变换器相当或更优的鲁棒性?
  • RQ3大卷积核、图像块化以及减少归一化/激活层的改进是否在不同模型规模和数据集上均保持有效?
  • RQ4知识蒸馏能否将视觉变换器的鲁棒性迁移至CNN?还是鲁棒性本质上源于架构本身?
  • RQ5CNN与视觉变换器在鲁棒性上的性能差距是源于架构设计,还是训练策略?

主要发现

  • Robust-ResNet(采用11×11大卷积核、输入图像块化、减少归一化/激活层的CNN)在Stylized-ImageNet上准确率达到18.6%,优于DeiT-S的16.2%,提升2.4%。
  • 在ImageNet-R上,Robust-ResNet达到41.9%的准确率,优于DeiT-S的45.9%,实现4.0%的性能提升,表明其在风格与分布偏移下具有更强的鲁棒性。
  • 在ImageNet-Sketch上,Robust-ResNet达到33.0%的准确率,优于DeiT-S的29.1%,提升3.9%,证实其在多样化分布外基准上的持续优势。
  • 相同架构改进使训练速度提升23%,因归一化层减少,表明鲁棒性提升的同时也实现了效率增益。
  • 从DeiT-S进行知识蒸馏无法将鲁棒性迁移至标准ResNet,但可成功迁移至所提出的Robust-ResNet,证实鲁棒性源于架构设计,而非训练过程。
  • 当扩展至DeiT-Base的FLOPs规模时,Robust-ResNet变体(如Robust-ResNet-Up-Inverted-DW-B)在ImageNet-R上达到50.5%的准确率,优于DeiT-B的44.7%,证明该设计原则具有良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。