Skip to main content
QUICK REVIEW

[论文解读] Robust Named Entity Recognition with Truecasing Pretraining

Stephen Mayhew, Nitish Gupta|arXiv (Cornell University)|Dec 15, 2019
Topic Modeling参考文献 25被引用 9
一句话总结

本文提出了一种鲁棒的命名实体识别(NER)框架,通过预训练一个真大小写转换模型(truecaser),从全小写文本中预测正确的大小写形式,并将其输出作为额外特征整合到字符级嵌入中。该方法在有大小写和无大小写文本上均提升了NER性能,在WNUT17数据集上实现了最先进(SoTA)的结果,即使在使用无大小写BERT嵌入时亦是如此。

ABSTRACT

Although modern named entity recognition (NER) systems show impressive performance on standard datasets, they perform poorly when presented with noisy data. In particular, capitalization is a strong signal for entities in many languages, and even state of the art models overfit to this feature, with drastically lower performance on uncapitalized text. In this work, we address the problem of robustness of NER systems in data with noisy or uncertain casing, using a pretraining objective that predicts casing in text, or a truecaser, leveraging unlabeled data. The pretrained truecaser is combined with a standard BiLSTM-CRF model for NER by appending output distributions to character embeddings. In experiments over several datasets of varying domain and casing quality, we show that our new model improves performance in uncased text, even adding value to uncased BERT embeddings. Our method achieves a new state of the art on the WNUT17 shared task dataset.

研究动机与目标

  • 解决NER模型在无大小写或噪声文本上泛化能力差的问题,此类情况下对大小写的依赖会导致性能显著下降。
  • 通过引入学习恢复正确大小写的预训练目标,克服当前最先进NER模型对大小写信号的过拟合。
  • 在不丢弃有价值大小写信息的前提下提升NER鲁棒性,通过将大小写标签作为学习到的信号而非依赖真实标签。
  • 证明真大小写转换预训练可增强标准BiLSTM-CRF模型和现代BERT-based模型的性能,尤其在低资源或噪声数据领域表现更优。
  • 建立最佳实践,用于预处理和训练真大小写转换模型,以在多样化数据集和不同大小写质量水平下最大化下游NER性能。

提出的方法

  • 训练一个基于字符级BiLSTM的真大小写转换模型,以预测句子中每个字符的大小写(大写/小写)标签,输入为小写文本,真实大小写作为黄金标签。
  • 将真大小写转换模型的输出分布(每个字符的2D向量)作为学习特征,与字符嵌入拼接后输入CNN或BiLSTM进行编码。
  • 通过将真大小写转换模型的预测结果附加到字符级表示中,将其实现集成到NER模型中,从而在不修改词嵌入的前提下增强上下文理解能力。
  • 在大规模无标签文本上预训练真大小写转换模型,随后在有标签NER数据上与NER模型端到端联合微调,实现鲁棒表示的端到端学习。
  • 将该方法应用于标准BiLSTM-CRF和BERT-based NER模型,结果在不同架构和数据设置下均表现出一致性能提升。
  • 采用一种预处理策略,使训练数据更偏向命名实体类的大小写模式,以提升真大小写转换模型对实体级大小写模式的泛化能力。

实验结果

研究问题

  • RQ1在无标签文本上预训练真大小写转换模型,能否提升NER模型对无大小写或噪声输入的鲁棒性?
  • RQ2将预测的大小写信息作为字符嵌入中的特征,是否能带来比仅依赖真实大小写或完全忽略大小写更好的NER性能?
  • RQ3真大小写转换模型的性能与下游NER性能之间的相关性如何?一个性能不佳的真大小写转换模型是否仍能提升NER准确率?
  • RQ4真大小写转换预训练在多大程度上能提升无大小写BERT嵌入在NER任务中的性能?
  • RQ5针对真大小写转换训练数据的何种预处理策略能实现最佳泛化能力与下游NER性能提升?

主要发现

  • 在无大小写OntoNotes测试集上,该方法将NER F1提升1.0个百分点,其中广播新闻(bc)子类别提升最高达1.9个百分点。
  • 在WNUT17共享任务中,该模型实现了新的最先进性能,即使使用无大小写BERT嵌入,也优于先前所有方法。
  • 即使NER模型使用无大小写BERT,真大小写转换模型仍能提升无大小写文本上的性能,表明大小写预测带来的价值超越了预训练本身。
  • 在NER数据上微调预训练的真大小写转换模型可获得更优结果(F1=46.3),优于从零开始训练(F1=47.7)或使用固定预训练版本(F1=46.9),表明联合优化具有显著优势。
  • 微调后真大小写转换模型在字符级大小写预测上的F1为52.3%,其性能与NER性能提升呈正相关,但不完全一致,表明准确的大小写预测有益但并非NER性能提升的绝对必要条件。
  • 该方法在多样化领域和不同大小写质量水平下均表现出一致的性能增益,包括低资源和噪声文本,证实其在真实场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。