Skip to main content
QUICK REVIEW

[论文解读] Legal Case Document Summarization: Extractive and Abstractive Methods and their Evaluation

Abhay Shukla, Paheli Bhattacharya|arXiv (Cornell University)|Oct 14, 2022
Artificial Intelligence in Law被引用 13
一句话总结

本文使用来自印度和英国最高法院判决的三个新数据集,评估了法律案例文档的抽取式与生成式摘要方法。研究发现,无监督抽取式方法(如 DSDR)和有监督模型(如 SummaRuNNer)优于领域特定方法,且基于分块的微调策略能提升长文档摘要性能;专家评估显示,自动指标与人工判断在摘要质量上的相关性较低。

ABSTRACT

Summarization of legal case judgement documents is a challenging problem in Legal NLP. However, not much analyses exist on how different families of summarization models (e.g., extractive vs. abstractive) perform when applied to legal case documents. This question is particularly important since many recent transformer-based abstractive summarization models have restrictions on the number of input tokens, and legal documents are known to be very long. Also, it is an open question on how best to evaluate legal case document summarization systems. In this paper, we carry out extensive experiments with several extractive and abstractive summarization methods (both supervised and unsupervised) over three legal summarization datasets that we have developed. Our analyses, that includes evaluation by law practitioners, lead to several interesting insights on legal summarization in specific and long document summarization in general.

研究动机与目标

  • 为解决现有对长篇复杂法律案例文档的摘要模型缺乏系统性评估的问题。
  • 基于印度和英国最高法院判决,构建三个新的法律摘要数据集以用于基准测试。
  • 比较抽取式与生成式方法(包括有监督、无监督和领域特定模型)的性能表现。
  • 研究在变换器模型输入token长度受限条件下,处理长篇法律文档的有效策略。
  • 通过自动指标与法律从业者专家判断相结合的方式,评估摘要质量。

提出的方法

  • 构建了三个新的法律摘要数据集:IN-Ext(印度抽取式)、IN-Abs(印度生成式)和 UK-Abs(英国生成式),其标准摘要由法律专家创建。
  • 应用了广泛的摘要方法:无监督抽取式(如 LexRank、DSDR、PacSum)、有监督抽取式(如 SummaRuNNer、BERTSUM)和生成式(如 BART、Longformer、Legal-Pegasus)。
  • 探索了三种长文档摘要策略:使用 Longformer 处理长上下文、使用短模型(如 BART)进行分块处理,以及混合抽取-生成式流水线。
  • 在法律语料上微调领域特定模型(如 Legal-Pegasus),以提升其在法律文本上的表现。
  • 由法律专家对 35 个摘要(涵盖 5 份文档)进行人工评估,依据 5 个修辞段落(如 事实、判决、先例)的完整性、可读性及整体质量,采用五级李克特量表打分。
  • 计算自动指标(ROUGE、BERTScore)与专家判断之间的相关性,以评估其在法律 NLP 中的可靠性。

实验结果

研究问题

  • RQ1抽取式与生成式摘要模型在法律案例文档上的性能表现如何比较?
  • RQ2在法律摘要任务中,领域无关模型是否优于领域特定模型?
  • RQ3在变换器模型输入长度受限的条件下,处理长篇法律文档的最有效策略是什么?
  • RQ4自动评估指标(如 ROUGE、BERTScore)与法律专家人工判断的相关性如何?
  • RQ5摘要在多大程度上准确反映了法律判决中的关键修辞段落(如事实、判决、先例)?

主要发现

  • 无监督抽取式方法(如 DSDR)在法律从业者中的整体满意度得分最高,优于有监督和生成式模型。
  • 在专家评估中,有监督抽取式模型(如 SummaRuNNer 和 DSDR)在关键信息覆盖度和可读性方面得分最高。
  • 基于分块的方法(先抽取摘要,再应用生成式模型)优于直接对长文档进行生成式摘要,尤其在微调后表现更优。
  • Longformer 在 UK-Abs 数据集(文档最长)上表现最佳,但在较短的法律文档上被基于分块的方法超越。
  • 自动指标与专家判断的相关性极低:ROUGE-1 F-Score(0.212)、ROUGE-2 F-Score(0.208)、ROUGE-L F-Score(0.132)和 BERTScore(0.067),表明其在法律摘要评估中可靠性有限。
  • 无一模型在所有修辞段落中实现均衡覆盖;摘要常遗漏关键元素,如引用的先例(PRE)和论点(ARG),尤其在文档后半部分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。