Skip to main content
QUICK REVIEW

[论文解读] Small and Practical BERT Models for Sequence Labeling

Henry Tsai, Jason Riesa|arXiv (Cornell University)|Aug 31, 2019
Natural Language Processing Techniques参考文献 10被引用 17
一句话总结

该论文提出了一种蒸馏的、小型化且高效的多语言 BERT 模型,用于序列标注任务,在 70 个语料库的 48 种语言上实现了最先进性能,同时模型大小仅为标准 BERT 的 1/6,推理速度提升 27 倍,且在低资源语言上表现更优,对混合代码输入具有鲁棒性,且无需在该类数据上进行显式训练。

ABSTRACT

We propose a practical scheme to train a single multilingual sequence labeling model that yields state of the art results and is small and fast enough to run on a single CPU. Starting from a public multilingual BERT checkpoint, our final model is 6x smaller and 27x faster, and has higher accuracy than a state-of-the-art multilingual baseline. We show that our model especially outperforms on low-resource languages, and works on codemixed input text without being explicitly trained on codemixed examples. We showcase the effectiveness of our method by reporting on part-of-speech tagging and morphological prediction on 70 treebanks and 48 languages.

研究动机与目标

  • 开发一个单一、小型且实用的多语言序列标注模型,保持高精度的同时可在单个 CPU 上部署。
  • 通过多语言设置下的跨语言迁移,提升低资源语言的性能。
  • 在无需对混合代码数据进行显式训练的前提下,实现对混合代码输入的鲁棒推理。
  • 在保留大型多语言 BERT 模型性能优势的同时,减小模型大小并降低推理延迟。
  • 证明知识蒸馏可生成一个紧凑模型,其性能优于 Meta-LSTM 等强基线模型在多语言序列标注任务上的表现。

提出的方法

  • 在 104 种语言上预训练的大小写敏感多语言 BERT 模型基础上,使用每个标记的第一个子词片段的 softmax 层进行微调,以实现序列标注。
  • 应用知识蒸馏将大型多语言 BERT 模型压缩为更小、更快的模型(MiniBERT),隐藏层大小减少至 256 个单元,仅保留 3 层。
  • 使用教师模型生成的软标签训练蒸馏模型,从而在紧凑架构中保留高质量预测。
  • 在所有 48 种语言中采用统一的训练设置,将所有语料库的样本拼接并打乱后进行训练,以实现联合多语言学习。
  • 基于 Universal Dependencies 2.7 数据集,在 70 个语料库上对词性标注和词形特征预测任务进行评估。
  • 在未对混合代码数据进行微调的情况下测试模型在印地语-英语混合数据上的鲁棒性,依赖模型从上下文中推断语言边界的能力。

实验结果

研究问题

  • RQ1一个单一的多语言模型是否能在 48 种不同语言上实现序列标注任务的最先进性能,同时保持小型化和高效性?
  • RQ2知识蒸馏是否能在显著减小模型大小和推理延迟的同时,保留大型多语言 BERT 模型的性能?
  • RQ3与特定语言或多语言基线相比,蒸馏后的多语言模型在低资源语言上的表现如何?
  • RQ4多语言模型是否能在未显式在混合代码数据上进行训练的情况下,对混合代码输入实现泛化?
  • RQ5在多语言设置中,从高资源语言到低资源语言的跨语言迁移在多大程度上提升了性能?

主要发现

  • 蒸馏模型(m MiniBERT)的模型大小仅为原始多语言 BERT 模型的 1/6,推理速度提升 27 倍,CPU 上的推理时间仅需 8.5ms。
  • m MiniBERT 在低资源语言(如哈萨克语、马拉地语)上的平均词性标注 F1 达 81.4,优于多语言 Meta-LSTM(52.9 F1),并匹配或超过基于 BERT 的基线模型。
  • 在印地语-英语混合的词性标注任务中,m MiniBERT 达到 79.5 F1,与监督 BERT 模型(90.6 F1)相差不足 10 分,尽管训练过程中从未接触过混合代码数据。
  • 多语言 BERT 模型(m BERT)在白俄罗斯语上的词性标注 F1 达 95.0,在立陶宛语上达 90.0,高于任何单语言模型或基线模型。
  • 对于训练样本少于 500 个的语言,m MiniBERT 的表现优于多语言 Meta-LSTM 和单个 BERT 模型,展现出强大的零样本跨语言迁移能力。
  • 蒸馏模型在保持原始多语言 BERT 模型 95% 性能的同时,显著提升了效率,使其在仅支持 CPU 的实际系统中具备部署可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。