Skip to main content
QUICK REVIEW

[论文解读] On the Transformer Growth for Progressive BERT Training

Xiaotao Gu, Liyuan Liu|arXiv (Cornell University)|Oct 23, 2020
Topic Modeling参考文献 28被引用 4
一句话总结

本文提出 CompoundGrow,一种用于渐进式 BERT 预训练的复合缩放方法,通过优化的缩放算子,同时在深度、宽度和输入序列长度三个维度上对 Transformer 模型进行增长。通过平衡多个维度并选择有效的算子(如使用嵌入池化进行长度增长,使用参数共享进行宽度增长),该方法分别将 BERT-base 和 BERT-large 的预训练时间缩短 73.6% 和 82.2%(墙钟时间),同时保持或超越原始 BERT 的性能。

ABSTRACT

Due to the excessive cost of large-scale language model pre-training, considerable efforts have been made to train BERT progressively -- start from an inferior but low-cost model and gradually grow the model to increase the computational complexity. Our objective is to advance the understanding of Transformer growth and discover principles that guide progressive training. First, we find that similar to network architecture search, Transformer growth also favors compound scaling. Specifically, while existing methods only conduct network growth in a single dimension, we observe that it is beneficial to use compound growth operators and balance multiple dimensions (e.g., depth, width, and input length of the model). Moreover, we explore alternative growth operators in each dimension via controlled comparison to give operator selection practical guidance. In light of our analyses, the proposed method speeds up BERT pre-training by 73.6% and 82.2% for the base and large models respectively, while achieving comparable performances

研究动机与目标

  • 为了深化对渐进式预训练中 Transformer 模型缩放机制的理解,特别是多维缩放的作用。
  • 为了识别在 BERT 模型中适用于深度、宽度和输入长度维度的有效缩放算子。
  • 为了通过高效、复合的缩放策略,降低大规模 BERT 预训练的高计算成本。
  • 为了在渐进式训练中提供实用且基于实证的设计原则,用于缩放算子的选择。

提出的方法

  • 提出一种复合缩放算子,以平衡方式同时缩放模型的深度、宽度和输入序列长度。
  • 在长度维度上使用大小为 2 的嵌入池化,以替代对长序列的直接截断。
  • 在前馈网络中应用参数共享(k=2),以无需完全重新初始化的方式高效扩展宽度。
  • 通过堆叠方式从较小模型扩展深度,保留已学习的权重。
  • 进行受控的消融实验,比较不同维度下缩放算子的性能,包括低秩近似和池化方法。
  • 采用三阶段训练流程:先以部分容量训练小型模型,然后应用复合缩放扩展至完整容量,最后进行完整微调。

实验结果

研究问题

  • RQ1在 BERT 模型中,是否通过同时缩放深度、宽度和输入长度等多个维度的复合缩放,相比单维度缩放能带来更好的性能和更快的训练速度?
  • RQ2在不同维度上,哪些缩放算子最为有效?例如,长度增长中池化与截断的对比,宽度扩展中参数共享与低秩近似的对比?
  • RQ3复合缩放是否能在显著缩短训练时间的同时,实现与标准 BERT 预训练相当或更优的性能?
  • RQ4缩放算子的选择如何影响训练稳定性以及下游任务的最终微调性能?

主要发现

  • 与标准训练相比,CompoundGrow 将 BERT-base 的预训练墙钟时间减少了 73.6%,BERT-large 减少了 82.2%,且无性能下降。
  • 在 GLUE 基准上,该方法实现了与标准 BERT 相当或更优的性能,仅在 CoLA 上出现轻微下降,可能归因于数据集规模和方差。
  • 嵌入池化在长度增长中优于直接截断,提升了泛化能力和训练稳定性。
  • 在宽度扩展中,参数共享比低秩近似更有效,能够更好地保持模型容量和性能。
  • 与单维度缩放相比,同时在深度、宽度和输入长度上进行复合缩放可获得更优结果,验证了渐进式训练中复合效应的有效性。
  • 最终模型在 MNLI 和 SQuaD 基准上的表现与标准 BERT 相当或更优,证实了复合缩放策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。