Skip to main content
QUICK REVIEW

[论文解读] May I Check Again? -- A simple but efficient way to generate and use contextual dictionaries for Named Entity Recognition. Application to French Legal Texts

Valentin Barrière, Amaury Fouret|arXiv (Cornell University)|Sep 8, 2019
Natural Language Processing Techniques参考文献 22被引用 6
一句话总结

本文提出MICA,一种上下文感知方法,通过使用Damerau-Levenshtein距离和最长公共子序列距离动态生成上下文实体词典,提升法语法律文本中的命名实体识别(NER)性能。通过将基于相似度的特征注入神经NER模型的最后层,该方法增强了对拼写错误的鲁棒性,并将F1分数提升1.67个百分点(从94.85%提升至96.52%),同时将相对召回误差降低40.9%。

ABSTRACT

In this paper we present a new method to learn a model robust to typos for a Named Entity Recognition task. Our improvement over existing methods helps the model to take into account the context of the sentence inside a court decision in order to recognize an entity with a typo. We used state-of-the-art models and enriched the last layer of the neural network with high-level information linked with the potential of the word to be a certain type of entity. More precisely, we utilized the similarities between the word and the potential entity candidates in the tagged sentence context. The experiments on a dataset of French court decisions show a reduction of the relative F1-score error of 32%, upgrading the score obtained with the most competitive fine-tuned state-of-the-art system from 94.85% to 96.52%.

研究动机与目标

  • 解决因拼写错误和领域特定语言导致法语法律文本NER性能较低的挑战。
  • 提升最先进NER模型在法律文档中对拼写变体和噪声输入的鲁棒性。
  • 通过微调语言嵌入和上下文敏感的实体候选生成,开发一种领域自适应的NER系统。
  • 通过提升召回率而不牺牲精确率,最小化去标识化任务中的假阴性。
  • 创建一种语言和领域无关的方法,可适用于法语法律文本之外的其他NER场景。

提出的方法

  • 使用堆叠嵌入(FastText、字符级BiLM和字符级嵌入)训练基础BLSTM-CRF NER模型。
  • 对每个句子,提取上下文窗口(最优大小:128)以从第一个模型的预测中收集潜在命名实体。
  • 使用Damerau-Levenshtein距离和最长公共子序列(LCS)距离计算每个词与候选实体之间的相似度得分。
  • 为每个词生成一个相似度向量,表示其作为特定实体类型(如PER、LOC)的可能性。
  • 将此相似度向量作为高层特征注入第二个NER模型的最后层,以优化预测结果。
  • 在包含66万份文档的法语法律语料库上对FastText和BiLM嵌入进行微调,以提升领域适应性。

实验结果

研究问题

  • RQ1上下文感知的实体候选生成是否能提升法语法律文本中NER对拼写错误的鲁棒性?
  • RQ2上下文窗口的大小如何影响上下文词典方法的性能?
  • RQ3从实体候选中提取的基于相似度的特征在多大程度上能提升NER的精确率和召回率?
  • RQ4将高层上下文特征注入神经NER模型的最后层,是否优于标准微调方法?
  • RQ5该方法是否可泛化至法语法律文档之外的其他领域和语言?

主要发现

  • 与最佳微调基线相比,MICA方法将相对F1分数误差降低了32%,F1分数从94.85%提升至96.52%。
  • 实体候选生成的最优上下文窗口大小为128个词符,超过该值性能会因精确率下降而降低。
  • 与基线相比,该系统将相对召回误差降低了40.9%,显著提升了去标识化的完整性。
  • 尽管使用第一个模型的预测结果构建词典,系统仍保持了稳定的假阳性率。
  • 在法律文本上对FastText和BiLM嵌入进行微调可提升模型性能,证实了领域自适应表示的价值。
  • 该方法在应用于基于CRF的NER系统时依然有效,表明其与非深度学习模型具有良好的兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。