[论文解读] Accelerating Pre-trained Language Models via Calibrated Cascade.
该论文提出CascadeBERT,一种校准的级联方法,通过动态选择完整且逐步增大的模型以级联方式加速预训练语言模型,采用难度感知目标提升预测可靠性。实验表明,其在速度-准确率权衡上优于动态早停和知识蒸馏基线方法。
Dynamic early exiting aims to accelerate pre-trained language models' (PLMs) inference by exiting in shallow layer without passing through the entire model. In this paper, we analyze the working mechanism of dynamic early exiting and find it cannot achieve a satisfying trade-off between inference speed and performance. On one hand, the PLMs' representations in shallow layers are not sufficient for accurate prediction. One the other hand, the internal off-ramps cannot provide reliable exiting decisions. To remedy this, we instead propose CascadeBERT, which dynamically selects a proper-sized, complete model in a cascading manner. To obtain more reliable model selection, we further devise a difficulty-aware objective, encouraging the model output class probability to reflect the real difficulty of each instance. Extensive experimental results demonstrate the superiority of our proposal over strong baseline models of PLMs' acceleration including both dynamic early exiting and knowledge distillation methods.
研究动机与目标
- 为解决预训练语言模型中动态早停方法的局限性,该方法存在浅层表示不足和退出决策不可靠的问题。
- 通过用完整且逐步增大的模型级联选择替代临时的早停机制,提升推理过程中模型选择的可靠性。
- 设计一种难度感知目标,使模型置信度与真实样本难度保持一致,从而增强预测可靠性。
- 在推理速度与模型性能之间实现优于现有加速技术(如动态早停和知识蒸馏)的更好平衡。
提出的方法
- 提出一种级联推理框架,其中每个阶段使用完整且逐步增大的预训练模型,而非在浅层进行早停。
- 引入一种难度感知目标,促使模型输出概率反映输入样本的真实难度,从而提升退出决策的可靠性。
- 对级联各阶段的预测置信度进行校准,确保高置信度输出对应更困难的样本。
- 采用端到端训练方式,损失函数结合标准交叉熵与难度感知正则化项。
- 使用置信度阈值机制,选择级联中最小的完整模型,使其达到足够的预测置信度。
- 采用多阶段推理流水线,每个阶段通过完整的Transformer块堆叠处理输入,避免部分推理。
实验结果
研究问题
- RQ1级联选择完整模型是否能在推理速度与准确率之间实现优于动态早停的效果?
- RQ2引入难度感知目标在加速推理中是否能提升模型选择决策的可靠性?
- RQ3与知识蒸馏相比,该方法在保持或提升模型性能的同时,能在多大程度上减少推理时间?
- RQ4级联各阶段的校准置信度输出是否与实际样本难度相关?
- RQ5该方法在不同模型规模和下游NLP任务上的可扩展性如何?
主要发现
- CascadeBERT在速度-准确率权衡上优于动态早停方法,后者常因浅层表示而牺牲准确率。
- 难度感知目标通过使预测置信度与实际样本难度对齐,提升了模型选择的可靠性。
- 在多个下游NLP任务中,该方法在推理速度和准确率上均优于知识蒸馏基线。
- 使用完整模型的级联机制相比浅层早停,显著降低了错误早停的风险。
- 实证结果表明,该方法实现了显著的加速,且准确率下降极小,尤其在更困难样本上,更高阶段的模型被选中。
- 级联各阶段的校准置信度分数与样本难度表现出强相关性,验证了设计目标的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。