Skip to main content
QUICK REVIEW

[论文解读] MultiLegalSBD: A Multilingual Legal Sentence Boundary Detection Dataset

Tobias Brugger, Matthias Stürmer|arXiv (Cornell University)|May 2, 2023
Natural Language Processing Techniques被引用 5
一句话总结

本文介绍了 MultiLegalSBD,一个包含六种语言超过 130,000 个标注句子的多语言法律句子边界检测数据集。研究显示,现有 SBD 模型在法律文本上的表现欠佳,而单语和多语模型——尤其是基于 Transformer 的模型——在多语言数据上实现了超过 96% 的 SOTA F1 分数,在未见过的葡萄牙语法律文本的零样本评估中也超过了 90%。

ABSTRACT

Sentence Boundary Detection (SBD) is one of the foundational building blocks of Natural Language Processing (NLP), with incorrectly split sentences heavily influencing the output quality of downstream tasks. It is a challenging task for algorithms, especially in the legal domain, considering the complex and different sentence structures used. In this work, we curated a diverse multilingual legal dataset consisting of over 130'000 annotated sentences in 6 languages. Our experimental results indicate that the performance of existing SBD models is subpar on multilingual legal data. We trained and tested monolingual and multilingual models based on CRF, BiLSTM-CRF, and transformers, demonstrating state-of-the-art performance. We also show that our multilingual models outperform all baselines in the zero-shot setting on a Portuguese test set. To encourage further research and development by the community, we have made our dataset, models, and code publicly available.

研究动机与目标

  • 解决高质量、多语言法律句子边界检测(SBD)数据集的缺乏问题,该问题阻碍了法律文本处理中稳健的 NLP 应用。
  • 证明现有 SBD 系统在法律文本上表现不佳,原因在于复杂的句子结构、缩写以及领域特定的格式。
  • 使用 CRF、BiLSTM-CRF 和 Transformer 架构开发并评估单语和多语 SBD 模型,以提升法律文档上的性能。
  • 在未见过的葡萄牙语法律文本上评估零样本迁移性能,以评估跨语言泛化能力。
  • 发布数据集、模型和代码,以促进多语言法律 NLP 领域的社区研究与开发。

提出的方法

  • 整理了一个多语言法律 SBD 数据集,包含来自法语、德语、意大利语、西班牙语、英语和葡萄牙语法律文本的超过 130,000 个标注句子。
  • 由一名母语为德语、具备中等法语水平的单一母语者对所有语言进行标注,优先保证跨语言的一致性,尽管存在语言特异性差异。
  • 在数据集上训练并评估基于 CRF、BiLSTM-CRF 和 Transformer 架构(如 BERT、XLM-RoBERTa)的单语和多语模型。
  • 应用标准 NLP 预处理方法,如将换行符替换为空格并规范化特殊字符,以提升模型泛化能力。
  • 在葡萄牙语法律文本上进行零样本评估,以测试跨语言迁移性能,并比较不同模型类型的表现。
  • 优化超参数并探索架构改进,包括法律优化的预训练模型以及更大的跨语言编码器(如 XLM-RoBERTa)。
Figure 1. Mean performance comparison of baseline (green) and our multilingual models (violet) on multilingual legal text (French, Italian, Spanish, English, and German) and a zero-shot experiment on Portuguese data
Figure 1. Mean performance comparison of baseline (green) and our multilingual models (violet) on multilingual legal text (French, Italian, Spanish, English, and German) and a zero-shot experiment on Portuguese data

实验结果

研究问题

  • RQ1现有 SBD 系统在法语、西班牙语、意大利语、英语和德语法律数据上的表现如何?
  • RQ2通过基于 CRF、BiLSTM-CRF 和 Transformer 的单语和多语模型,SBD 性能能在多大程度上得到提升?
  • RQ3多语模型在未见过的葡萄牙语法律文本上的零样本设置下表现如何?
  • RQ4是否可以通过结构化标注,利用句子类型(如引用、列表)来提升模型性能?
  • RQ5跨语言迁移是否能泛化到不同语系的语言,例如匈牙利语?

主要发现

  • 现有 SBD 系统在多语言法律文本上的 F1 分数为 73.5 至 84.9,在葡萄牙语上的 F1 分数为 60.1 至 79.5,表明在法律领域表现欠佳。
  • 在 MultiLegalSBD 数据集上训练的单语模型在法语、德语、意大利语、西班牙语和英语上的 F1 分数达到 96.4 至 97.7,达到当前最先进水平。
  • 多语 Transformer 模型在多语言法律文本上的 F1 分数为 96.4 至 97.7,在零样本葡萄牙语测试集上的 F1 分数为 81.1 至 92.2,优于所有基线模型。
  • 多语 Transformer 模型在葡萄牙语法律文本上的 F1 分数达到 92.2,显著优于 CRF 和 BiLSTM-CRF 模型,后者在法律条文子集上的表现退化至基线水平。
  • CRF 和 BiLSTM-CRF 模型在葡萄牙语判决文本上表现尚可(F1 约 90%),但在法律文本上性能显著下降(退化至基线水平),表明其零样本泛化能力有限。
  • 本研究建议,未来改进可来自基于句子类型的感知标注、更好的预处理方法,以及使用法律优化的或更大规模的多语言预训练模型(如 XLM-RoBERTa)。
Figure 2. Sentence length distribution in tokens
Figure 2. Sentence length distribution in tokens

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。