[论文解读] Transformer on a Diet
本文提出三种轻量级Transformer架构——空洞Transformer、带记忆的空洞Transformer以及级联Transformer,通过仅保留关键的长距离和短距离依赖关系来降低计算复杂度。最轻量的变体在语言建模基准测试中实现了70%的参数减少,同时保持了具有竞争力的困惑度,证明了其在不牺牲性能的前提下具备高效的推理能力。
Transformer has been widely used thanks to its ability to capture sequence information in an efficient way. However, recent developments, such as BERT and GPT-2, deliver only heavy architectures with a focus on effectiveness. In this paper, we explore three carefully-designed light Transformer architectures to figure out whether the Transformer with less computations could produce competitive results. Experimental results on language model benchmark datasets hint that such trade-off is promising, and the light Transformer reduces 70% parameters at best, while obtains competitive perplexity compared to standard Transformer. The source code is publicly available.
研究动机与目标
- 设计高效的Transformer架构,在保持序列建模任务上具有竞争力的性能的同时降低计算成本。
- 探究在标准Transformer中剪枝冗余连接是否能有效保留长距离和局部依赖关系。
- 通过最小化模型大小和推理成本,实现资源受限环境中Transformer的实际部署。
- 评估在标准语言建模基准测试中,模型效率、参数量与性能之间的权衡。
提出的方法
- 在自注意力层中引入指数膨胀因子的空洞连接,以扩展有效感受野,同时将计算量从O(n²)降低至O(nk)。
- 通过缓存前序空洞层的输出结果,增强长距离建模能力,从而在带记忆的空洞Transformer中实现更丰富的上下文保留。
- 采用级联连接,聚合来自多个前序层的特征,以强化级联Transformer中的局部上下文建模能力。
- 在所有模型中使用共享超参数(如隐藏层尺寸2000、16头、dropout 0.4/0.2),并采用SGD和截断反向传播进行训练以保证一致性。
- 设计保持残差连接和层归一化以确保稳定性,同时减少注意力计算路径的数量。
- 在PTB和WT-2数据集上使用困惑度作为主要指标,评估所有模型的性能,比较参数量与推理效率。
实验结果
研究问题
- RQ1是否能够通过减少连接的Transformer架构在语言建模任务中保持具有竞争力的性能?
- RQ2计算复杂度能否从O(n²)降低至O(n),同时保持性能损失较小?
- RQ3在轻量化形式下,哪种架构设计——空洞、带记忆,或级联——最能有效保留长距离和局部依赖关系?
- RQ4不同轻量级Transformer变体中,参数减少与困惑度退化之间的相关性如何?
主要发现
- 级联Transformer的困惑度非常接近完整Transformer,表明局部上下文建模对语言建模至关重要。
- 带记忆的空洞Transformer相比标准Transformer实现了70%的参数减少,性能仅出现适度下降。
- 所有轻量级Transformer变体均显著降低了计算成本,复杂度呈线性增长,即O(nk),而非O(n²)。
- 最轻量的架构(空洞Transformer)在保持具有竞争力的困惑度的同时,将模型大小减少了70%,因此在资源受限环境中极具部署潜力。
- 结果表明,在模型效率与性能之间存在可行的权衡,使大规模语言模型能够在边缘设备或低资源环境中得以部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。