Skip to main content
QUICK REVIEW

[论文解读] Application of Pre-training Models in Named Entity Recognition

Yu Wang, Yining Sun|arXiv (Cornell University)|Feb 9, 2020
Topic Modeling参考文献 16被引用 5
一句话总结

本文在MSRA-2006数据集上通过微调,评估了四种预训练语言模型——BERT、ERNIE、ERNIE2.0-tiny和RoBERTa——在中文命名实体识别(NER)任务中的表现。RoBERTa取得了94.17%的F1分数,达到当前最优性能,优于BERT和ERNIE,这主要归因于其动态掩码机制以及去除了句子级别的NSP预训练任务,而后者被证明对NER任务有害。

ABSTRACT

Named Entity Recognition (NER) is a fundamental Natural Language Processing (NLP) task to extract entities from unstructured data. The previous methods for NER were based on machine learning or deep learning. Recently, pre-training models have significantly improved performance on multiple NLP tasks. In this paper, firstly, we introduce the architecture and pre-training tasks of four common pre-training models: BERT, ERNIE, ERNIE2.0-tiny, and RoBERTa. Then, we apply these pre-training models to a NER task by fine-tuning, and compare the effects of the different model architecture and pre-training tasks on the NER task. The experiment results showed that RoBERTa achieved state-of-the-art results on the MSRA-2006 dataset.

研究动机与目标

  • 评估预训练语言模型在提升中文命名实体识别(NER)性能方面的有效性。
  • 探究模型架构与预训练任务对NER性能的影响。
  • 比较不同预训练策略(如静态掩码与动态掩码、实体级别掩码)对NER的影响。
  • 确定句子级别的预训练任务(如NSP)是否对序列标注任务(如NER)有益。
  • 基于模型架构与预训练目标,为NER任务选择最优预训练模型提供实证依据。

提出的方法

  • 在MSRA-2006中文NER数据集上微调了四种预训练模型——BERT、ERNIE、ERNIE2.0-tiny和RoBERTa。
  • 在预训练模型输出之上添加CRF层,以建模标签依赖关系并确保生成有效的标签序列。
  • 在预训练模型最后一层之后添加全连接层,将上下文表征映射到标签空间。
  • BERT和ERNIE采用静态掩码,而RoBERTa采用动态掩码,即在每个训练周期中对不同的标记进行掩码。
  • 在RoBERTa中去除了下一句预测(NSP)任务,与BERT和ERNIE不同,以评估其对NER性能的影响。
  • 使用PaddlePaddle在AI Studio上进行训练,采用V100 GPU,通过在验证集上调整超参数,设置训练2个周期、初始峰值学习率为5e-5、批量大小为16。

实验结果

研究问题

  • RQ1不同预训练模型架构(如层数、隐藏层大小)如何影响在MSRA-2006数据集上的NER性能?
  • RQ2预训练任务(特别是MLM、NSP和实体/短语级别掩码)对NER性能有何影响?
  • RQ3与BERT和ERNIE相比,RoBERTa中去除NSP预训练任务是否提升了NER任务的性能?
  • RQ4为何ERNIE2.0-tiny尽管拥有更多隐藏单元和持续预训练,但性能仍低于预期?其浅层架构如何影响性能?
  • RQ5与BERT和ERNIE使用的静态掩码相比,RoBERTa中的动态掩码在多大程度上增强了语义表征?

主要发现

  • RoBERTa在MSRA-2006数据集上取得了最高的F1分数94.17%,优于BERT(93.30%)、ERNIE(93.37%)和ERNIE2.0-tiny(86.52%)。
  • RoBERTa中去除下一句预测(NSP)任务带来了性能提升,表明句子级别的预训练对NER无益,甚至可能阻碍长距离依赖学习。
  • RoBERTa中的动态掩码机制增强了模型的泛化能力与语义表征能力,促使其在性能上优于采用静态掩码的BERT和ERNIE。
  • 尽管ERNIE2.0-tiny拥有更多隐藏单元和持续预训练,但其F1分数仅为86.52%,显著低于基线BiGRU+CRF模型(90.32%),这主要归因于其浅层3层架构限制了语义特征提取能力。
  • ERNIE的实体级别与短语级别掩码策略相比BERT略有性能下降,可能由于掩码过程中的分词错误所致。
  • RoBERTa的深层架构(12层)及其优化后的预训练目标,使其在序列标注任务(如NER)中比层数更少或预训练任务不合理的模型更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。