Skip to main content
QUICK REVIEW

[论文解读] Convolutional Xformers for Vision

Pranav Jeevan, Amit sethi|arXiv (Cornell University)|Jan 25, 2022
Advanced Neural Network Applications被引用 4
一句话总结

本文提出视觉卷积Xformer(CXV),一种混合架构,结合线性注意力机制与卷积子层,以减少GPU显存使用和数据需求,同时在图像分类任务中保持最先进性能。通过用Performer和Linear Transformer等线性替代方案取代二次复杂度的自注意力机制,并通过卷积引入归纳偏置,CXV消除了对分类标记(class tokens)和位置嵌入的依赖,相较于ViTs、ResNets及其他视觉变换器,在低资源条件下展现出更优性能。

ABSTRACT

Vision transformers (ViTs) have found only limited practical use in processing images, in spite of their state-of-the-art accuracy on certain benchmarks. The reason for their limited use include their need for larger training datasets and more computational resources compared to convolutional neural networks (CNNs), owing to the quadratic complexity of their self-attention mechanism. We propose a linear attention-convolution hybrid architecture -- Convolutional X-formers for Vision (CXV) -- to overcome these limitations. We replace the quadratic attention with linear attention mechanisms, such as Performer, Nyströmformer, and Linear Transformer, to reduce its GPU usage. Inductive prior for image data is provided by convolutional sub-layers, thereby eliminating the need for class token and positional embeddings used by the ViTs. We also propose a new training method where we use two different optimizers during different phases of training and show that it improves the top-1 image classification accuracy across different architectures. CXV outperforms other architectures, token mixers (e.g. ConvMixer, FNet and MLP Mixer), transformer models (e.g. ViT, CCT, CvT and hybrid Xformers), and ResNets for image classification in scenarios with limited data and GPU resources (cores, RAM, power).

研究动机与目标

  • 为解决视觉变换器(ViTs)的高计算与数据需求问题,尽管其准确率表现优异,但其实际应用受到限制。
  • 通过用线性注意力机制替代二次复杂度的自注意力机制,减少图像分类任务中的GPU显存消耗与训练数据需求。
  • 通过引入卷积的归纳偏置,消除对分类标记与位置嵌入的依赖。
  • 设计一种训练策略,通过在不同训练阶段使用两种优化器,提升收敛速度与准确率。
  • 构建一种在低资源约束(有限数据与GPU显存)下具有良好泛化能力的模型,同时匹配或超越当前最先进性能。

提出的方法

  • 将视觉变换器中的二次复杂度自注意力机制替换为Performer、Nyströmformer与Linear Transformer等线性注意力机制,以降低计算复杂度。
  • 在每个模块中集成卷积子层,为图像数据提供归纳偏置,实现在不展开序列的情况下进行空间特征学习。
  • 通过卷积操作在整个网络中保持二维空间结构,从而消除对分类标记与位置嵌入的依赖。
  • 每个模块仅使用单层归一化,而非预归一化,以提升训练稳定性和性能。
  • 提出双优化器训练(DualOpT),在不同训练阶段使用两种不同优化器,以增强收敛性与准确率。
  • 在所有层中保持输入分辨率与空间结构,避免分层下采样或图像块划分。

实验结果

研究问题

  • RQ1结合线性注意力与卷积的混合架构是否能在显著降低GPU显存使用的同时,实现最先进图像分类准确率?
  • RQ2用卷积归纳偏置替代分类标记与位置嵌入,是否能在低数据与低GPU条件下提升模型性能?
  • RQ3双优化器训练策略是否能提升ViTs、ResNets与令牌混合模型等多样化架构的收敛速度与最终准确率?
  • RQ4在数据与资源受限环境下,CXV相较于ViT、ResNet、FNet、MLP-Mixer与ConvMixer等现有模型的性能表现如何?
  • RQ5归一化位置与注意力机制选择等架构设计选择在多大程度上影响模型泛化能力与效率?

主要发现

  • 在低数据与低GPU条件下,CXV在图像分类任务中优于ResNet-18、ResNet-34、ViT、CCT、CvT及其他视觉变换器。
  • 在使用RandAugment增强后,再对未增强数据进行微调时,CXV的top-1准确率最高可提升3个百分点。
  • 混合视觉线性变换器(ViLT)变体的GPU显存消耗仅为其他混合ViX模型(如ViN与ViP)的一半。
  • 采用DualOpT训练策略后,ViTs、ResNets与令牌混合模型等多种架构的收敛性与准确率均得到提升。
  • ConvMixer与WaveMix在性能上与变换器相当,但GPU使用量显著更低,表明归纳先验对效率至关重要。
  • 在低资源环境下,CXV的参数量与GPU显存使用量较ResNets减少数个数量级,同时实现更高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。