Skip to main content
QUICK REVIEW

[论文解读] Efficient Transformers: A Survey

Yi Tay, Mostafa Dehghani|arXiv (Cornell University)|Sep 14, 2020
Anomaly Detection Techniques and Applications被引用 220
一句话总结

关于一篇全面综述的效率导向 Transformer 变体(X-formers),通过降低自注意力成本,对模型按核心技术进行分类,并讨论跨领域的适用性与取舍。

ABSTRACT

Transformer model architectures have garnered immense interest lately due to their effectiveness across a range of domains like language, vision and reinforcement learning. In the field of natural language processing for example, Transformers have become an indispensable staple in the modern deep learning stack. Recently, a dizzying number of "X-former" models have been proposed - Reformer, Linformer, Performer, Longformer, to name a few - which improve upon the original Transformer architecture, many of which make improvements around computational and memory efficiency. With the aim of helping the avid researcher navigate this flurry, this paper characterizes a large and thoughtful selection of recent efficiency-flavored "X-former" models, providing an organized and comprehensive overview of existing work and models across multiple domains.

研究动机与目标

  • 提供一个系统的高效Transformer模型分类学及其技术创新。
  • 总结减少注意力、以及整个Transformer的计算(内存、FLOPs) 的主要方法。
  • 突出具有代表性的模型、它们的用例,以及语言与视觉任务中的取舍。

提出的方法

  • 以核心技术分类高效Transformer(固定模式、模式组合、可学习模式、神经记忆、低秩、核、递归、下采样、稀疏/条件计算)。
  • 详细描述关键模型的代表性解读(Memory Compressed Transformer, Image Transformer, Set Transformer, Sparse Transformers, Reformer, Linformer, Performers, 等)。
  • 讨论实际考虑:何时需要局部与全局注意力,编码器/解码器的使用,以及准确性与效率之间的权衡。

实验结果

研究问题

  • RQ1哪些架构和技术能在NLP与视觉中有效降低自注意力的二次成本?
  • RQ2不同效率范式(稀疏、内存、低秩、核、递归、下采样)在复杂度、适用性和性能方面的比较?
  • RQ3长序列处理与设备端部署的代表性模型及其取舍?
  • RQ4高效Transformer如何跨领域和模态进行泛化?

主要发现

  • 高效Transformer采用多种策略(局部/块注意力、记忆令牌、低秩投影、基于核的近似、递归、下采样,以及专家混合)以降低内存和/或计算。
  • 将方法分为固定模式、模式组合、可学习模式、神经记忆、低秩、核、递归、下采样,以及稀疏/条件计算的分类法,有助于组织快速发展的工作。
  • 各种模型实现次二次或线性注意力复杂度(如 Linformer、Performer、Longformer、Reformer、Sparse Transformer 家族、GShard/Switch Transformer 在稀疏情形)。
  • 在保持全局上下文与减少计算之间存在权衡,局部注意力常常牺牲一些全局信息。
  • 一些方法将多种技术结合(例如局部+记忆,或带注意力的下采样)以平衡覆盖与效率。
  • 论文包含一个详细表格(Table 1)总结了跨多模型的复杂度、解码能力以及高效技术类别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。