Skip to main content
QUICK REVIEW

[论文解读] Vision Transformer: Vit and its Derivatives

Zujun Fu|arXiv (Cornell University)|May 12, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

本文综述了视觉Transformer(ViT)及其关键衍生模型,包括PVT、Swin Transformer、MLP-Mixer、XCiT、MViT、TimesFormer、SegFormer和UNETR,展示了自注意力机制与架构创新如何在图像分类、目标检测、语义分割、视频识别和医学影像等任务中实现最先进性能。核心贡献在于表明,基于ViT的模型在扩展规模、大规模预训练以及采用局部注意力、高效注意力和基于MLP的混合等架构改进后,可实现更高的准确率与泛化能力。

ABSTRACT

Transformer, an attention-based encoder-decoder architecture, has not only revolutionized the field of natural language processing (NLP), but has also done some pioneering work in the field of computer vision (CV). Compared to convolutional neural networks (CNNs), the Vision Transformer (ViT) relies on excellent modeling capabilities to achieve very good performance on several benchmarks such as ImageNet, COCO, and ADE20k. ViT is inspired by the self-attention mechanism in natural language processing, where word embeddings are replaced with patch embeddings. This paper reviews the derivatives of ViT and the cross-applications of ViT with other fields.

研究动机与目标

  • 综述视觉Transformer(ViT)及其在计算机视觉任务中各类衍生模型的演进过程与架构创新。
  • 分析自注意力机制的改进如何提升密集预测与高分辨率任务中的效率与性能。
  • 评估模型规模与预训练数据量对少样本泛化能力与准确率的影响。
  • 探索ViT在跨领域应用中的潜力,包括视频识别、语义分割以及3D医学图像分割。
  • 识别提升ViT性能的关键架构原则,如局部注意力、基于MLP的混合机制以及位置编码的移除。

提出的方法

  • 提出金字塔视觉Transformer(PVT),采用空间降维注意力(SRA)机制,通过下采样键和值张量降低二次方复杂度,实现层次化特征学习。
  • 提出PVT-v2,引入重叠的补丁嵌入、深度可分离卷积前馈网络与线性复杂度自注意力机制,增强局部归纳偏置,并提升在不同图像分辨率下的灵活性。
  • 提出Swin Transformer,采用移位窗口划分策略,实现线性复杂度O(M×N)的局部自注意力,支持层次化表征学习与全局上下文建模。
  • 通过训练一个20亿参数模型在30亿张图像上,应用缩放定律,验证了在少样本设定下准确率的提升(ImageNet上top-1准确率达到84.86%)与样本效率。
  • 在MLP-Mixer中用两个MLP替代自注意力机制:一个用于跨补丁的通道混合,另一个用于跨空间位置的token混合。
  • 提出XCiT,采用交叉协方差注意力(XCA),通过深度可分离与逐点卷积解耦token与通道的混合过程,实现高效、非局部注意力,同时减少参数量。

实验结果

研究问题

  • RQ1如何使ViT中的自注意力机制在高分辨率与密集预测任务中更加高效?
  • RQ2哪些架构改进使ViT在目标检测与语义分割任务中达到与CNN相当的性能?
  • RQ3模型规模与预训练数据量的扩展在多大程度上提升了ViT模型的少样本泛化能力?
  • RQ4是否可以有效用基于MLP或卷积的混合机制替代自注意力机制而不损失性能?
  • RQ5如位置编码、池化与归一化等架构选择,如何影响ViT在不同输入分辨率下的鲁棒性?

主要发现

  • Swin Transformer通过移位窗口划分策略实现线性复杂度O(M×N),支持高效的局部自注意力与层次化特征学习。
  • PVT-v2通过重叠补丁与深度可分离卷积增强了局部归纳偏置,在语义分割与目标检测任务中表现更优。
  • 将ViT扩展至20亿参数并使用30亿张图像进行预训练,可在ImageNet上实现90.45%的top-1准确率与84.86%的少样本准确率,证明了其在小样本数据下的强大泛化能力。
  • 对头部与主干层分别应用权重衰减可提升少样本性能,其中对头部施加更强的权重衰减可实现更好的类别分离。
  • MLP-Mixer与XCiT通过两阶段MLP或卷积混合机制替代自注意力,实现竞争力性能,降低计算成本的同时保持准确率。
  • SegFormer通过采用无位置编码的层次化编码器与简单的MLP解码器,在语义分割任务中实现最先进性能,对分辨率变化具有强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。