Skip to main content
QUICK REVIEW

[论文解读] Finding Fast Transformers: One-Shot Neural Architecture Search by Component Composition

Henry Tsai, Jayden Ooi|arXiv (Cornell University)|Aug 15, 2020
Topic Modeling参考文献 21被引用 12
一句话总结

本文提出一种一次性神经架构搜索方法,通过从组件级架构选择中采样,构建快速的Transformer模型,同时在保持高准确率的前提下优化推理速度。通过将BERT重新参数化为模块化组件,并采用基于采样的搜索与感知性能分析的目标函数,该方法在BERT-base模型上实现10–30%的加速,在蒸馏模型上最高实现70%的加速,且准确率损失极小。

ABSTRACT

Transformer-based models have achieved stateof-the-art results in many tasks in natural language processing. However, such models are usually slow at inference time, making deployment difficult. In this paper, we develop an efficient algorithm to search for fast models while maintaining model quality. We describe a novel approach to decompose the Transformer architecture into smaller components, and propose a sampling-based one-shot architecture search method to find an optimal model for inference. The model search process is more efficient than alternatives, adding only a small overhead to training time. By applying our methods to BERT-base architectures, we achieve 10% to 30% speedup for pre-trained BERT and 70% speedup on top of a previous state-of-the-art distilled BERT model on Cloud TPU-v2 with a generally acceptable drop in performance.

研究动机与目标

  • 开发一种高效的方法,用于在不牺牲模型质量的前提下搜索快速的Transformer架构。
  • 解决最先进Transformer模型在实际部署场景中推理速度慢的挑战。
  • 实现一次性架构搜索,最大限度减少训练开销,同时直接优化推理速度。
  • 探索如何通过组件组合在多种自然语言处理任务中构建更快速的模型。
  • 证明基于组件的搜索方法在速度和效率方面优于传统搜索方法。

提出的方法

  • 将Transformer架构分解为模块化组件,包括注意力头、前馈层和归一化层,每个组件均可独立缩放或剪枝。
  • 提出一种基于采样的一次性搜索算法,可在单次训练过程中探索架构组合,避免多次训练循环。
  • 搜索目标结合外部计算性能分析数据,直接优化推理速度,而非依赖FLOPs等代理指标。
  • 同时采样组件级超参数(如宽度和深度),实现模型深度与宽度的联合优化。
  • 该方法支持从零开始训练,并支持与知识蒸馏集成,实现蒸馏模型的高效微调。
  • 搜索过程采用可微采样策略并引入正则化,以鼓励生成高效、高速的架构。

实验结果

研究问题

  • RQ1能否设计一种一次性架构搜索方法,高效探索Transformer中深度与宽度的权衡,同时最大限度减少训练开销?
  • RQ2基于组件的架构组合在实现更快推理速度的同时,是否能有效避免显著的准确率下降?
  • RQ3将真实硬件性能分析数据整合到搜索目标中,是否相比基于FLOPs的目标能带来更好的推理速度表现?
  • RQ4所提出的方法能否在多种自然语言处理任务中同时提升预训练和蒸馏BERT模型的性能?
  • RQ5在不同复杂度的任务中(如词性标注与形态学分析),架构选择有何差异?

主要发现

  • 在预训练的BERT-base模型上,该方法实现了10–30%的推理速度提升,下游任务准确率仅下降0.5–1.0%。
  • 在蒸馏BERT模型上,该方法最高实现70%的加速(比基线快3.5倍),同时保持相近的准确率。
  • 所选架构在不同任务间差异显著:形态学任务(需处理1000+类别)需要更大的模型,而词性标注任务则偏好更小、更快的模型。
  • SDO(基于采样的直接优化)算法在速度提升方面优于DO(基于Dropout的优化):在形态学任务上实现36倍加速,而DO为33倍,准确率相近。
  • 搜索过程仅增加1.4倍的训练时间开销和极少的内存成本,使其适用于大规模模型。
  • 与先前最优的蒸馏BERT模型相比,该方法在使用SDO-R时实现1.7倍的加速,且无需重新训练,节省了2倍的训练资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。