Skip to main content
QUICK REVIEW

[论文解读] Transformer on a Diet

Chenguang Wang, Zihao Ye|arXiv (Cornell University)|Feb 14, 2020
Topic Modeling参考文献 25被引用 4
一句话总结

本文提出三种轻量级Transformer架构——空洞Transformer、带记忆的空洞Transformer以及级联Transformer,通过仅保留关键的长距离和短距离依赖关系来降低计算复杂度。最轻量的变体在语言建模基准测试中实现了70%的参数减少,同时保持了具有竞争力的困惑度,证明了其在不牺牲性能的前提下具备高效的推理能力。

ABSTRACT

Transformer has been widely used thanks to its ability to capture sequence information in an efficient way. However, recent developments, such as BERT and GPT-2, deliver only heavy architectures with a focus on effectiveness. In this paper, we explore three carefully-designed light Transformer architectures to figure out whether the Transformer with less computations could produce competitive results. Experimental results on language model benchmark datasets hint that such trade-off is promising, and the light Transformer reduces 70% parameters at best, while obtains competitive perplexity compared to standard Transformer. The source code is publicly available.

研究动机与目标

  • 设计高效的Transformer架构,在保持序列建模任务上具有竞争力的性能的同时降低计算成本。
  • 探究在标准Transformer中剪枝冗余连接是否能有效保留长距离和局部依赖关系。
  • 通过最小化模型大小和推理成本,实现资源受限环境中Transformer的实际部署。
  • 评估在标准语言建模基准测试中,模型效率、参数量与性能之间的权衡。

提出的方法

  • 在自注意力层中引入指数膨胀因子的空洞连接,以扩展有效感受野,同时将计算量从O(n²)降低至O(nk)。
  • 通过缓存前序空洞层的输出结果,增强长距离建模能力,从而在带记忆的空洞Transformer中实现更丰富的上下文保留。
  • 采用级联连接,聚合来自多个前序层的特征,以强化级联Transformer中的局部上下文建模能力。
  • 在所有模型中使用共享超参数(如隐藏层尺寸2000、16头、dropout 0.4/0.2),并采用SGD和截断反向传播进行训练以保证一致性。
  • 设计保持残差连接和层归一化以确保稳定性,同时减少注意力计算路径的数量。
  • 在PTB和WT-2数据集上使用困惑度作为主要指标,评估所有模型的性能,比较参数量与推理效率。

实验结果

研究问题

  • RQ1是否能够通过减少连接的Transformer架构在语言建模任务中保持具有竞争力的性能?
  • RQ2计算复杂度能否从O(n²)降低至O(n),同时保持性能损失较小?
  • RQ3在轻量化形式下,哪种架构设计——空洞、带记忆,或级联——最能有效保留长距离和局部依赖关系?
  • RQ4不同轻量级Transformer变体中,参数减少与困惑度退化之间的相关性如何?

主要发现

  • 级联Transformer的困惑度非常接近完整Transformer,表明局部上下文建模对语言建模至关重要。
  • 带记忆的空洞Transformer相比标准Transformer实现了70%的参数减少,性能仅出现适度下降。
  • 所有轻量级Transformer变体均显著降低了计算成本,复杂度呈线性增长,即O(nk),而非O(n²)。
  • 最轻量的架构(空洞Transformer)在保持具有竞争力的困惑度的同时,将模型大小减少了70%,因此在资源受限环境中极具部署潜力。
  • 结果表明,在模型效率与性能之间存在可行的权衡,使大规模语言模型能够在边缘设备或低资源环境中得以部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。