Skip to main content
QUICK REVIEW

[论文解读] Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search

Gyuwan Kim, Kyunghyun Cho|arXiv (Cornell University)|Oct 14, 2020
Topic Modeling参考文献 63被引用 9
一句话总结

该论文提出长度自适应Transformer(Length-Adaptive Transformer),一种单模型框架,可在不同计算预算下实现高效、任意时间推理。通过使用LengthDrop——一种结构化dropout方法,随机在每一层减少序列长度——并结合多目标进化搜索,模型可在不重新训练的情况下推导出最优长度配置。该方法通过“丢弃并恢复”过程将PoWER-BERT扩展至标记级任务,实现在SQuAD 1.1、MNLI-m和SST-2上的优越准确率-效率权衡,推理速度最高提升3倍。

ABSTRACT

Despite transformers' impressive accuracy, their computational cost is often prohibitive to use with limited computational resources. Most previous approaches to improve inference efficiency require a separate model for each possible computational budget. In this paper, we extend PoWER-BERT (Goyal et al., 2020) and propose Length-Adaptive Transformer that can be used for various inference scenarios after one-shot training. We train a transformer with LengthDrop, a structural variant of dropout, which stochastically determines a sequence length at each layer. We then conduct a multi-objective evolutionary search to find a length configuration that maximizes the accuracy and minimizes the efficiency metric under any given computational budget. Additionally, we significantly extend the applicability of PoWER-BERT beyond sequence-level classification into token-level classification with Drop-and-Restore process that drops word-vectors temporarily in intermediate layers and restores at the last layer if necessary. We empirically verify the utility of the proposed approach by demonstrating the superior accuracy-efficiency trade-off under various setups, including span-based question answering and text classification. Code is available at https://github.com/clovaai/length-adaptive-transformer.

研究动机与目标

  • 为解决大型预训练Transformer模型在计算资源受限环境下的高推理成本问题。
  • 消除为不同计算预算训练独立模型的需求,使单个模型能够支持多种部署场景。
  • 将PoWER-BERT的适用范围从序列级分类任务扩展至标记级任务,如基于跨度的问答任务。
  • 通过自动化配置搜索,实现在推理过程中对准确率-效率权衡的细粒度控制。
  • 在多种自然语言处理任务中,显著降低FLOPs和实际推理时间,同时保持模型性能。

提出的方法

  • 提出LengthDrop,一种结构化dropout的变体,基于随机长度比例在每个Transformer层中随机丢弃序列标记,从而在推理时增强对不同序列长度的鲁棒性。
  • 仅需一次训练即可获得单个Transformer模型,通过LengthDrop可提取出多个有效序列长度不同的子模型,无需重新训练。
  • 应用多目标进化搜索,以在任何给定计算预算下,最大化准确率的同时最小化FLOPs和推理时间,从而识别出最优长度配置。
  • 设计“丢弃并恢复”过程,临时将中间层的词向量暂存(类似PoWER-BERT),但在最终层恢复,从而实现与标记级任务的兼容性。
  • 利用进化搜索生成完整的准确率-效率权衡的Pareto前沿,支持针对任意目标预算的部署。
  • 将该框架集成至基于HuggingFace Transformers的现有模型中,确保广泛的兼容性与便捷的部署能力。

实验结果

研究问题

  • RQ1是否可以仅训练一次单个Transformer模型,并在推理时根据任意计算预算进行自适应调整,而无需重新训练或微调?
  • RQ2如何利用统一模型在不同计算约束下优化准确率-效率权衡?
  • RQ3PoWER-BERT的效率机制能否扩展至标记级分类任务(如基于跨度的问答)?
  • RQ4与标准Transformer相比,使用长度自适应推理在推理速度和FLOPs方面能带来多大性能提升?
  • RQ5与启发式或阈值法相比,该进化搜索策略在寻找最优长度配置方面表现如何?

主要发现

  • 长度自适应Transformer在SQuAD 1.1、MNLI-m和SST-2上实现了与标准BERT相当的准确率,同时将实际推理时间和FLOPs最高降低至1/3,即实现最高3倍加速。
  • 模型在所有测试的长度配置下均保持强大性能,得益于LengthDrop,对序列长度变化具有高度鲁棒性。
  • 进化搜索成功识别出位于准确率与效率Pareto前沿上的最优长度配置,优于启发式或固定阈值方法。
  • “丢弃并恢复”过程使PoWER-BERT的效率机制可应用于标记级任务(如基于跨度的问答),此前该任务在该机制下不可行。
  • 在多个NLP基准测试中,该框架在准确率-效率权衡方面优于现有方法,包括可剪枝网络(Slimmable Networks)和DynaBERT。
  • 该方法具有模块化特性,与HuggingFace Transformers兼容,可轻松集成至现有NLP流水线中,并可未来扩展至多模态模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。