Skip to main content
QUICK REVIEW

[论文解读] A Survey of Visual Transformers

Yang Liu, Yao Zhang|arXiv (Cornell University)|Nov 11, 2021
Advanced Neural Network Applications参考文献 134被引用 42
一句话总结

本文对100多种视觉 Transformer 模型在分类、检测和分割方面的应用进行了全面综述,覆盖图像、点云和多感知数据,提供分类法、比较和未来发展方向。

ABSTRACT

Transformer, an attention-based encoder-decoder model, has already revolutionized the field of natural language processing (NLP). Inspired by such significant achievements, some pioneering works have recently been done on employing Transformer-liked architectures in the computer vision (CV) field, which have demonstrated their effectiveness on three fundamental CV tasks (classification, detection, and segmentation) as well as multiple sensory data stream (images, point clouds, and vision-language data). Because of their competitive modeling capabilities, the visual Transformers have achieved impressive performance improvements over multiple benchmarks as compared with modern Convolution Neural Networks (CNNs). In this survey, we have reviewed over one hundred of different visual Transformers comprehensively according to three fundamental CV tasks and different data stream types, where a taxonomy is proposed to organize the representative methods according to their motivations, structures, and application scenarios. Because of their differences on training settings and dedicated vision tasks, we have also evaluated and compared all these existing visual Transformers under different configurations. Furthermore, we have revealed a series of essential but unexploited aspects that may empower such visual Transformers to stand out from numerous architectures, e.g., slack high-level semantic embeddings to bridge the gap between the visual Transformers and the sequential ones. Finally, three promising research directions are suggested for future investment. We will continue to update the latest articles and their released source codes at https://github.com/liuyang-ict/awesome-visual-transformers.

研究动机与目标

  • 提供对视觉 Transformer 架构在计算机视觉任务(分类、检测、分割)上的系统性概述。
  • 按数据流(图像、点云、多感知数据)和动机组织已有方法。
  • 分析架构组件和训练方案,以揭示优点、局限性以及与 CNN 的关系。
  • 提出未来研究方向和在多样任务中利用视觉 Transformer 的实际考虑因素。

提出的方法

  • 根据三个计算机视觉任务和数据流类型,对超过100篇视觉 Transformer 工作进行评审和分类。
  • 提出骨干网和组件的分类法(例如基于补丁、基于查询、分层、局部/全局注意力)。
  • 总结训练策略,包括自监督和预训练数据的考虑。
  • 在不同配置和数据情景下比较方法,以提供直观的跨研究洞见。
  • 讨论未被充分利用的方面以及视觉 Transformer 与序列模型之间的潜在桥接机制。

实验结果

研究问题

  • RQ1用于 CV 任务的视觉 Transformer 主要有哪些架构族群?
  • RQ2视觉 Transformer 在图像分类、检测和分割上的表现如何,它们操作的数据流是什么?
  • RQ3哪些训练策略和归纳偏差有助于视觉 Transformer 在数据有限的情况下泛化?
  • RQ4统一、多任务和多模态视觉 Transformer 的未来方向与空缺是什么?

主要发现

  • 视觉 Transformer 在分类、检测和分割基准上已展现出令人印象深刻的性能,相较于在多种配置下的 CNN。
  • 存在多种架构趋势(例如局部与全局注意力、分层设计、深度变换器变体),各自对准确性和效率有权衡。
  • 结合 CNN 归纳偏差的混合方法(通过卷积干预、偏置或混合骨干网)提高数据效率和性能。
  • 包括局部注意力机制(如 Swin)、分层令牌和深度变换器技术以缓解过平滑和注意力崩溃问题。
  • 自监督和多模态预训练策略在使 ViT 表现良好方面发挥关键作用,通常降低对大规模外部数据集的需求。
  • 论文指出有前景的方向,如通过查询嵌入实现编 encoder–decoder 的统一,以及潜在的多任务、多数据流融合架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。