[论文解读] Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search
该论文提出长度自适应Transformer(Length-Adaptive Transformer),一种单模型框架,可在不同计算预算下实现高效、任意时间推理。通过使用LengthDrop——一种结构化dropout方法,随机在每一层减少序列长度——并结合多目标进化搜索,模型可在不重新训练的情况下推导出最优长度配置。该方法通过“丢弃并恢复”过程将PoWER-BERT扩展至标记级任务,实现在SQuAD 1.1、MNLI-m和SST-2上的优越准确率-效率权衡,推理速度最高提升3倍。
Despite transformers' impressive accuracy, their computational cost is often prohibitive to use with limited computational resources. Most previous approaches to improve inference efficiency require a separate model for each possible computational budget. In this paper, we extend PoWER-BERT (Goyal et al., 2020) and propose Length-Adaptive Transformer that can be used for various inference scenarios after one-shot training. We train a transformer with LengthDrop, a structural variant of dropout, which stochastically determines a sequence length at each layer. We then conduct a multi-objective evolutionary search to find a length configuration that maximizes the accuracy and minimizes the efficiency metric under any given computational budget. Additionally, we significantly extend the applicability of PoWER-BERT beyond sequence-level classification into token-level classification with Drop-and-Restore process that drops word-vectors temporarily in intermediate layers and restores at the last layer if necessary. We empirically verify the utility of the proposed approach by demonstrating the superior accuracy-efficiency trade-off under various setups, including span-based question answering and text classification. Code is available at https://github.com/clovaai/length-adaptive-transformer.
研究动机与目标
- 为解决大型预训练Transformer模型在计算资源受限环境下的高推理成本问题。
- 消除为不同计算预算训练独立模型的需求,使单个模型能够支持多种部署场景。
- 将PoWER-BERT的适用范围从序列级分类任务扩展至标记级任务,如基于跨度的问答任务。
- 通过自动化配置搜索,实现在推理过程中对准确率-效率权衡的细粒度控制。
- 在多种自然语言处理任务中,显著降低FLOPs和实际推理时间,同时保持模型性能。
提出的方法
- 提出LengthDrop,一种结构化dropout的变体,基于随机长度比例在每个Transformer层中随机丢弃序列标记,从而在推理时增强对不同序列长度的鲁棒性。
- 仅需一次训练即可获得单个Transformer模型,通过LengthDrop可提取出多个有效序列长度不同的子模型,无需重新训练。
- 应用多目标进化搜索,以在任何给定计算预算下,最大化准确率的同时最小化FLOPs和推理时间,从而识别出最优长度配置。
- 设计“丢弃并恢复”过程,临时将中间层的词向量暂存(类似PoWER-BERT),但在最终层恢复,从而实现与标记级任务的兼容性。
- 利用进化搜索生成完整的准确率-效率权衡的Pareto前沿,支持针对任意目标预算的部署。
- 将该框架集成至基于HuggingFace Transformers的现有模型中,确保广泛的兼容性与便捷的部署能力。
实验结果
研究问题
- RQ1是否可以仅训练一次单个Transformer模型,并在推理时根据任意计算预算进行自适应调整,而无需重新训练或微调?
- RQ2如何利用统一模型在不同计算约束下优化准确率-效率权衡?
- RQ3PoWER-BERT的效率机制能否扩展至标记级分类任务(如基于跨度的问答)?
- RQ4与标准Transformer相比,使用长度自适应推理在推理速度和FLOPs方面能带来多大性能提升?
- RQ5与启发式或阈值法相比,该进化搜索策略在寻找最优长度配置方面表现如何?
主要发现
- 长度自适应Transformer在SQuAD 1.1、MNLI-m和SST-2上实现了与标准BERT相当的准确率,同时将实际推理时间和FLOPs最高降低至1/3,即实现最高3倍加速。
- 模型在所有测试的长度配置下均保持强大性能,得益于LengthDrop,对序列长度变化具有高度鲁棒性。
- 进化搜索成功识别出位于准确率与效率Pareto前沿上的最优长度配置,优于启发式或固定阈值方法。
- “丢弃并恢复”过程使PoWER-BERT的效率机制可应用于标记级任务(如基于跨度的问答),此前该任务在该机制下不可行。
- 在多个NLP基准测试中,该框架在准确率-效率权衡方面优于现有方法,包括可剪枝网络(Slimmable Networks)和DynaBERT。
- 该方法具有模块化特性,与HuggingFace Transformers兼容,可轻松集成至现有NLP流水线中,并可未来扩展至多模态模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。