Skip to main content
QUICK REVIEW

[论文解读] Towards Efficient NLP: A Standard Evaluation and A Strong Baseline

Xiangyang Liu, Tianxiang Sun|arXiv (Cornell University)|Oct 13, 2021
Topic Modeling被引用 15
一句话总结

本文提出了ELUE,一个用于在性能、FLOPs和参数量方面标准化评估高效NLP模型的基准测试平台及公开排行榜。它提出了ElasticBERT,一种强大的基线模型,通过梯度均衡和分组训练,使BERT能够在任意层生成预测,实现动态提前退出,其在GLUE任务上的表现优于或匹配当前最优的压缩和提前退出模型,同时将训练时间减少了43%。

ABSTRACT

Supersized pre-trained language models have pushed the accuracy of various natural language processing (NLP) tasks to a new state-of-the-art (SOTA). Rather than pursuing the reachless SOTA accuracy, more and more researchers start paying attention on model efficiency and usability. Different from accuracy, the metric for efficiency varies across different studies, making them hard to be fairly compared. To that end, this work presents ELUE (Efficient Language Understanding Evaluation), a standard evaluation, and a public leaderboard for efficient NLP models. ELUE is dedicated to depict the Pareto Frontier for various language understanding tasks, such that it can tell whether and how much a method achieves Pareto improvement. Along with the benchmark, we also release a strong baseline, ElasticBERT, which allows BERT to exit at any layer in both static and dynamic ways. We demonstrate the ElasticBERT, despite its simplicity, outperforms or performs on par with SOTA compressed and early exiting models. With ElasticBERT, the proposed ELUE has a strong Pareto Frontier and makes a better evaluation for efficient NLP models.

研究动机与目标

  • 为解决现有研究中指标不一致、结果难以获取,导致高效NLP模型缺乏标准化、全面评估的问题。
  • 通过实现对准确率、FLOPs和模型大小的公平、多维比较,建立语言理解模型的帕累托前沿。
  • 为静态与动态效率方法提供一个强大且稳健的基线,尤其解决现有基线在压缩与提前退出模型中的薄弱问题。
  • 通过开源平台实现可复现且透明的评估,支持公开结果与在线排行榜。
  • 在预训练阶段通过分组训练与梯度均衡,降低动态模型的训练时间并保持性能。

提出的方法

  • 提出ELUE,一个标准化评估平台,支持对模型性能、FLOPs和参数量的在线评估,结果公开可访问,并设有在线排行榜。
  • 提出ElasticBERT,一种支持在BERT任意层生成预测的动态模型,兼容静态与动态推理策略。
  • 采用梯度均衡(GE)平衡多个出口处的损失,缓解不同层因目标冲突导致的性能下降。
  • 在预训练阶段应用分组训练,将出口划分为若干组,使计算与训练时间减少高达43%,同时性能损失可忽略不计。
  • 采用多任务训练目标,每个出口头的损失按层深度加权,确保优化过程的平衡性。
  • 实施分层训练策略,保留顶层分类器,内部分类器共享主干参数,以保持表示质量。

实验结果

研究问题

  • RQ1能否建立一个标准化基准,以公平评估高效NLP模型在FLOPs、参数量和推理速度等多维效率指标上的表现?
  • RQ2像ElasticBERT这样的强基线模型在标准NLP基准上,能否显著优于或匹配现有压缩与提前退出模型?
  • RQ3梯度均衡在平衡多出口训练损失方面有多有效,能否提升所有出口层的性能?
  • RQ4在预训练阶段采用分组训练,是否能显著减少训练时间,同时保持对内部与最终出口的性能?
  • RQ5动态模型如ElasticBERT能否通过提供更优的准确率与效率权衡,实现对静态模型的帕累托改进?

主要发现

  • 采用梯度均衡与分组训练的ElasticBERT相比非分组训练,训练时间减少43%,且性能无显著下降。
  • 在GLUE基准上,12层的ElasticBERT BASE模型平均得分为88.4,在所有任务(包括MNLI、MRPC、QNLI和QQP)上均优于或匹配SOTA模型。
  • 6层版本的ElasticBERT BASE在GLUE上取得87.0的平均得分,展现出对深度减少的强鲁棒性及优异的效率-准确率权衡。
  • 采用GE与分组训练的ElasticBERT在所有出口层均保持高性能,顶层出口在MNLI上分别达到85.4/85.7,在MRPC上达到89.2。
  • ELUE基准成功构建了帕累托前沿,可清晰识别出在多个效率与准确率维度上实现帕累托改进的模型。
  • 消融实验表明,与两阶段训练和加权训练策略相比,梯度均衡在SST-2与MRPC上显著提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。