[论文解读] Rethinking the Design Principles of Robust Vision Transformer
本文提出了一种新型视觉Transformer架构——鲁棒视觉Transformer(RVT),通过从鲁棒性视角重新思考网络组件,旨在提升模型的鲁棒性与泛化能力。通过整合鲁棒性设计元素,并引入即插即用技术如位置感知注意力重缩放和逐块增强,RVT在ImageNet及多个鲁棒性基准测试中均取得最先进性能,包括在ImageNet-C和ImageNet-Sketch排行榜上达到最高top-1准确率。
Recent advances on Vision Transformers (ViT) have shown that self-attention-based networks, which take advantage of long-range dependencies modeling ability, surpassed traditional convolution neural networks (CNNs) in most vision tasks. To further expand the applicability for computer vision, many improved variants are proposed to re-design the Transformer architecture by considering the superiority of CNNs, i.e., locality, translation invariance, for better performance. However, these methods only consider the standard accuracy or computation cost of the model. In this paper, we rethink the design principles of ViTs based on the robustness. We found some design components greatly harm the robustness and generalization ability of ViTs while some others are beneficial. By combining the robust design components, we propose Robust Vision Transformer (RVT). RVT is a new vision transformer, which has superior performance and strong robustness. We further propose two new plug-and-play techniques called position-aware attention rescaling and patch-wise augmentation to train our RVT. The experimental results on ImageNet and six robustness benchmarks show the advanced robustness and generalization ability of RVT compared with previous Transformers and state-of-the-art CNNs. Our RVT-S* also achieves Top-1 rank on multiple robustness leaderboards including ImageNet-C and ImageNet-Sketch. The code will be available at https://github.com/vtddggg/Robust-Vision-Transformer.
研究动机与目标
- 探究现有视觉Transformer组件在标准准确率与计算成本之外,对模型鲁棒性与泛化能力的影响。
- 识别在视觉Transformer中损害或提升鲁棒性的架构组件。
- 设计一种新的视觉Transformer架构RVT,以鲁棒性为优化目标,同时保持高性能。
- 开发即插即用的训练技术,以提升鲁棒性,而无需修改网络架构。
- 在标准与鲁棒性基准测试上验证RVT的优越性,包括ImageNet-C与ImageNet-Sketch。
提出的方法
- 通过评估各组件在分布偏移下的影响,重新审视ViT的设计原则,识别出在分布偏移下会降低或提升性能的组件。
- 通过仅组合鲁棒性组件,提出鲁棒视觉Transformer(RVT),以增强泛化能力与鲁棒性。
- 提出位置感知注意力重缩放技术,一种即插即用方法,根据空间位置自适应调整注意力图缩放,以提升模型稳定性。
- 开发逐块增强技术,一种数据增强策略,对每个图像块独立应用随机增强,以提升训练过程中的鲁棒性。
- 使用标准ImageNet与鲁棒性基准数据集训练RVT,利用所提技术提升在分布偏移下的泛化能力。
- 通过消融实验验证各组件与技术对鲁棒性与准确率的贡献。
实验结果
研究问题
- RQ1在分布偏移下,哪些视觉Transformer组件会降低或提升鲁棒性?
- RQ2是否能够从零开始重新设计视觉Transformer,以优先考虑鲁棒性而不牺牲性能?
- RQ3位置感知注意力重缩放与逐块增强技术在训练过程中如何提升模型鲁棒性?
- RQ4RVT在鲁棒性基准测试中相较于现有ViT与最先进CNN模型的性能提升程度如何?
- RQ5RVT是否能够在ImageNet-C与ImageNet-Sketch等鲁棒性排行榜上达到顶尖性能?
主要发现
- RVT在多个鲁棒性排行榜上取得最高top-1准确率,包括ImageNet-C与ImageNet-Sketch,展现出最先进水平的鲁棒性。
- 所提出的基于位置感知的注意力重缩放与逐块增强技术显著提升了鲁棒性,且无需修改网络架构。
- 某些以往被认为有益的ViT组件被发现会损害鲁棒性,凸显了重新评估设计原则的必要性。
- RVT在六个鲁棒性基准测试中均优于标准视觉Transformer与最先进CNN模型,证实其卓越的泛化能力。
- 消融实验表明,仅组合鲁棒性组件即可在分布偏移下实现显著性能提升,验证了该设计哲学的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。