Skip to main content
QUICK REVIEW

[论文解读] Named Entity Recognition in the Legal Domain using a Pointer Generator Network

Stavroula Skylaki, Ali Oskooei|arXiv (Cornell University)|Dec 17, 2020
Topic Modeling参考文献 22被引用 9
一句话总结

本文提出将法律命名实体识别(NER)重新定义为文本到文本的序列生成任务,采用指针生成网络处理噪声多、OCR损坏严重的法律文档,其中实体的精确位置未知。该方法在长文档和罕见/未知标识符(如案件编号)上优于传统序列标注模型,字符级分词使OOV案件编号的准确率提升50%。

ABSTRACT

Named Entity Recognition (NER) is the task of identifying and classifying named entities in unstructured text. In the legal domain, named entities of interest may include the case parties, judges, names of courts, case numbers, references to laws etc. We study the problem of legal NER with noisy text extracted from PDF files of filed court cases from US courts. The "gold standard" training data for NER systems provide annotation for each token of the text with the corresponding entity or non-entity label. We work with only partially complete training data, which differ from the gold standard NER data in that the exact location of the entities in the text is unknown and the entities may contain typos and/or OCR mistakes. To overcome the challenges of our noisy training data, e.g. text extraction errors and/or typos and unknown label indices, we formulate the NER task as a text-to-text sequence generation task and train a pointer generator network to generate the entities in the document rather than label them. We show that the pointer generator can be effective for NER in the absence of gold standard data and outperforms the common NER neural network architectures in long legal documents.

研究动机与目标

  • 解决仅已知命名实体但其在OCR提取文本中的精确位置未知时训练法律NER模型的挑战。
  • 克服传统序列标注NER模型在处理含OCR错误和拼写错误的长篇法律文档时的局限性。
  • 提升对罕见及未登录词(OOV)实体(如唯一案件编号)的抽取效果,这些实体常被标准模型损坏或无法识别。
  • 评估指针生成网络在从噪声大、不完整训练数据中生成准确命名实体方面的有效性。
  • 探究字符级序列生成是否能显著提升对案件编号等OOV法律标识符的性能。

提出的方法

  • 将NER任务重新定义为文本到文本的序列生成问题,而非序列标注,从而在无需精确实体跨度标注的情况下进行训练。
  • 使用同时具备复制(指针)和生成(生成器)机制的指针生成网络,以处理未登录词并确保在OCR错误下仍能保持实体完整性。
  • 应用全局注意力和复制注意力机制,使模型能够关注输入文档的相关部分,并直接复制罕见或损坏的词汇。
  • 采用混合抽取式-生成式架构进行模型训练,动态选择从输入中复制词语或从词汇表中生成新标记。
  • 实验对比词级别和字符级别的分词方式,其中字符级输入通过支持任意字符序列的生成,显著减少OOV问题。
  • 使用Levenshtein距离评估模型性能,特别关注案件编号等实体字符串的相似度。

实验结果

研究问题

  • RQ1当仅提供命名实体而无其在文本中的位置时,指针生成网络能否有效执行法律NER?
  • RQ2与标准序列标注NER架构相比,指针生成模型在含OCR错误的长篇、噪声多的法律文档上的表现如何?
  • RQ3字符级分词在多大程度上能提升对案件编号等OOV法律标识符的抽取效果?
  • RQ4指针生成网络中复制与生成机制的结合是否能有效减少法律文本中OCR损坏和拼写错误带来的错误?
  • RQ5所提出的文本到文本生成方法能否泛化用于抽取除当事人姓名和案件编号之外的其他罕见或唯一法律实体?

主要发现

  • 指针生成网络在长篇法律文档上优于标准序列标注NER模型,尤其在实体位置未知时表现更优。
  • 与词级别分词相比,使用字符级别分词使案件编号抽取的准确率提高50%。
  • 在字符级输入下,超过80%的预测结果错误少于一个字符,而词级别模型仅50%。
  • 指针生成网络通过直接从输入文本复制内容,有效应对OCR错误和拼写错误,降低对罕见或损坏词汇生成的依赖。
  • 混合抽取式-生成式架构使模型在处理唯一案件编号等OOV实体时表现稳健,而传统模型通常会误分类此类实体。
  • 将NER重新定义为文本到文本生成任务,消除了对标准跨度标注数据的需求,使在部分标注的法律数据集上进行训练成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。