Skip to main content
QUICK REVIEW

[论文解读] E-NER -- An Annotated Named Entity Recognition Corpus of Legal Text

Ting Wai Terence Au, Ingemar J. Cox|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用 4
一句话总结

本文介绍了E-NER,这是一个从美国证券交易委员会(SEC)公司文件中获取的、公开可用的命名实体识别(NER)语料库,包含40万多个词符,专为法律文本设计。实验表明,当将通用领域CoNLL-2003数据预训练的NER模型应用于法律文本时,性能显著下降——F1分数下降29.4%至60.4%,凸显了法律NER任务中领域特定训练数据的必要性。

ABSTRACT

Identifying named entities such as a person, location or organization, in documents can highlight key information to readers. Training Named Entity Recognition (NER) models requires an annotated data set, which can be a time-consuming labour-intensive task. Nevertheless, there are publicly available NER data sets for general English. Recently there has been interest in developing NER for legal text. However, prior work and experimental results reported here indicate that there is a significant degradation in performance when NER methods trained on a general English data set are applied to legal text. We describe a publicly available legal NER data set, called E-NER, based on legal company filings available from the US Securities and Exchange Commission's EDGAR data set. Training a number of different NER algorithms on the general English CoNLL-2003 corpus but testing on our test collection confirmed significant degradations in accuracy, as measured by the F1-score, of between 29.4\% and 60.4\%, compared to training and testing on the E-NER collection.

研究动机与目标

  • 为解决美国法律领域中公开可用、高质量NER数据集的缺乏问题。
  • 评估通用领域NER模型在应用于法律文档时的性能退化情况。
  • 通过比较通用领域与法律文本分布下模型的性能,证明领域特定训练数据的必要性。
  • 提供一个基准语料库(E-NER),用于训练和评估法律NER系统。
  • 通过支持迁移学习和领域自适应在法律文本中的系统性评估,推动未来法律NLP研究。

提出的方法

  • E-NER数据集源自52份美国SEC EDGAR文件,人工标注了五类命名实体:人物、组织、地点、金额和日期。
  • 该数据集包含超过40万个词符和约9,000个命名实体,训练/验证/测试集划分比例为70%/10%/20%。
  • 评估了四种NER模型:字典基线模型、隐马尔可夫模型(HMM)、条件随机场(CRF)和BERT。
  • 模型在三种组合下进行训练和测试:仅使用CoNLL-2003、先在CoNLL-2003上训练后在E-NER上测试、仅使用E-NER。
  • 对每种模型,计算微F1分数以比较其在不同数据分布下的性能表现。
  • 使用Hugging Face的transformers库对BERT进行微调,训练数据为E-NER数据集。

实验结果

研究问题

  • RQ1在CoNLL-2003上训练的通用领域NER模型,在SEC文件的法律文本上测试时,性能退化程度如何?
  • RQ2当在通用英语与法律英语上进行训练时,HMM、CRF和BERT模型的性能差异如何?
  • RQ3与通用领域文本相比,法律文档中的命名实体识别受领域偏移影响的程度如何?
  • RQ4E-NER数据集的规模和构成与CoNLL-2003等标准NER基准相比,在词符数量和命名实体多样性方面有何差异?
  • RQ5领域特定的预训练或微调是否能显著提升法律文本上的NER性能?

主要发现

  • 在CoNLL-2003上训练并在E-NER上测试,不同模型的F1分数退化范围为29.4%至60.4%,表明存在显著的领域偏移。
  • 字典基线模型和HMM模型在法律文本上的表现劣于通用英语,F1分数最低降至13.6%。
  • CRF和BERT模型在E-NER上的F1分数(最高达96.1%)高于在CoNLL-2003上的表现(最高达90.5%),表明在领域特定数据上微调后,模型对法律文本的泛化能力更强。
  • 法律文本的平均句长(34.5个词)是通用英语(13.7个词)的两倍以上,且法律命名实体更长(2.68个词符 vs. 1.45个词符)。
  • E-NER数据集包含约9,000个命名实体,仅为CoNLL-2003语料库中命名实体数量的约25%,反映出词汇和句法复杂性的差异。
  • 结果证实,为实现高性能法律NER,领域特定的训练数据至关重要,因为通用领域模型无法有效泛化至法律文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。