[论文解读] An Impartial Take to the CNN vs Transformer Robustness Contest
本文对 ImageNet-1K 和分布偏移基准上的最先进 CNN(特别是 ConvNeXt)与 Transformer(ViT、Swin-T)进行了严格且公平的比较,表明 CNN 在鲁棒性、校准性和不确定性估计方面可与或优于 Transformer。关键发现是:自注意力机制本身并不天然具备更优的鲁棒性,且两种架构均表现出类似的偏差,如简单性偏差和纹理偏差。
Following the surge of popularity of Transformers in Computer Vision, several studies have attempted to determine whether they could be more robust to distribution shifts and provide better uncertainty estimates than Convolutional Neural Networks (CNNs). The almost unanimous conclusion is that they are, and it is often conjectured more or less explicitly that the reason of this supposed superiority is to be attributed to the self-attention mechanism. In this paper we perform extensive empirical analyses showing that recent state-of-the-art CNNs (particularly, ConvNeXt) can be as robust and reliable or even sometimes more than the current state-of-the-art Transformers. However, there is no clear winner. Therefore, although it is tempting to state the definitive superiority of one family of architectures over another, they seem to enjoy similar extraordinary performances on a variety of tasks while also suffering from similar vulnerabilities such as texture, background, and simplicity biases.
研究动机与目标
- 挑战一种广泛存在的信念,即由于自注意力机制的存在,Transformer 天然地比 CNN 更具鲁棒性和更好的校准性。
- 使用当前最佳的训练方案和架构,对 CNN 和 Transformer 进行公平、无偏见的比较。
- 探究自注意力机制是否真正导致鲁棒性提升,还是归因于归一化和激活函数等其他架构组件的影响更大。
- 通过校准性、分布外检测和误分类检测等多种指标,评估模型的可靠性,而不仅限于准确率。
- 指出先前比较中的缺陷,如模型容量扩展不公平以及在类别不平衡设置下使用不恰当的指标(例如在 AUROC 之外使用 AURP)。
提出的方法
- 使用相同的 ImageNet-1K 训练和评估协议,比较最先进 CNN(BiT 和 ConvNeXt)与 Transformer(ViT、Swin-T)。
- 采用标准评估协议,不修改训练方案,以确保模型达到最佳性能。
- 在分布偏移基准上评估鲁棒性:ImageNet-A、ImageNet-R、ImageNet-Sketches 和 ImageNet-V2。
- 采用多种可靠性指标:期望校准误差(ECE)、用于分布外检测的 AUROC 和 AURP,以及用于误分类检测的预测拒绝率(PRR)。
- 开展简单性偏差实验,以评估模型是否依赖于虚假的、简单的特征,而非复杂且不变的特征。
- 分析模型置信度分布,以检测在误分类样本上(尤其是在分布外设置下)是否存在过度自信现象。
实验结果
研究问题
- RQ1在多个分布偏移基准上,Transformer 是否始终优于 CNN 在鲁棒性和校准性方面?
- RQ2自注意力机制是否是鲁棒性提升的主要驱动力,还是其他架构组件(如归一化和激活函数)同样或更具影响力?
- RQ3在分布外检测中,不同评估指标(如 AURP 与 AUROC)如何影响 CNN 与 Transformer 之间性能差异的感知?
- RQ4CNN 和 Transformer 在多大程度上表现出简单性偏差,即更倾向于选择易于区分的特征而非稳健、不变的特征?
- RQ5现代 CNN 如 ConvNeXt 是否能在不使用自注意力机制的情况下,实现与 Transformer 相当的性能?
主要发现
- ConvNeXt 模型在分布内校准性方面优于或与最先进 Transformer 相当,其中 ConvNeXt-XL 在 ImageNet-1K 上的 PRR 达到 74.37%,优于 ViT-L/16(76.03%)和 Swin-L(72.89%)。
- 在 ImageNet-R 上,Swin-L 是唯一 PRR 为正的模型(36.53%),而 ConvNeXt-XL 和 L 的 PRR 分别为 -19.32% 和 -23.60%,表明其在误分类样本上存在过度自信。
- 在分布外检测方面,无明显胜者:ViT-L/16 和 ConvNeXt-XL 在 ImageNet-Sketches 和 ImageNet-V2 上表现相当,AUROC 值约为 0.85–0.87。
- BiT-R152x4 在 ImageNet-A 上实现了最高的 PRR(92.04%),显著优于所有 Transformer 模型,表明 CNN 在极端领域偏移下可能更具可靠性。
- 尽管 miscalibration 误差(ECE)较低,但多个模型(尤其在 ImageNet-R 上)在误分类样本上表现出高度过度自信,表明 ECE 单独不足以评估可靠性。
- 简单性偏差实验表明,CNN 和 Transformer 均倾向于关注简单、虚假的特征,而非复杂且不变的特征,这削弱了自注意力机制能实现更好特征学习的主张。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。