[论文解读] LawSum: A weakly supervised approach for Indian Legal Document Summarization
本文提出 LawSum,一种基于新构建的 10,764 份印度最高法院判决书数据集(含手写摘要)的弱监督方法,用于印度法律文档摘要。该方法通过伪相关性评分自动标注摘要相关句子,并使用焦点损失训练神经分类器以缓解类别不平衡问题,最终取得 0.619 的 ROUGE-F1 分数,显著优于强基线提取式摘要方法。
Unlike the courts in western countries, public records of Indian judiciary are completely unstructured and noisy. No large scale publicly available annotated datasets of Indian legal documents exist till date. This limits the scope for legal analytics research. In this work, we propose a new dataset consisting of over 10,000 judgements delivered by the supreme court of India and their corresponding hand written summaries. The proposed dataset is pre-processed by normalising common legal abbreviations, handling spelling variations in named entities, handling bad punctuations and accurate sentence tokenization. Each sentence is tagged with their rhetorical roles. We also annotate each judgement with several attributes like date, names of the plaintiffs, defendants and the people representing them, judges who delivered the judgement, acts/statutes that are cited and the most common citations used to refer the judgement. Further, we propose an automatic labelling technique for identifying sentences which have summary worthy information. We demonstrate that this auto labeled data can be used effectively to train a weakly supervised sentence extractor with high accuracy. Some possible applications of this dataset besides legal document summarization can be in retrieval, citation analysis and prediction of decisions by a particular judge.
研究动机与目标
- 为解决印度法律文本缺乏大规模、公开可用且结构良好的标注数据集的问题,该问题阻碍了法律分析研究的进展。
- 开发一种预处理流程,对噪声较大的印度法律判决书进行法律缩写标准化、命名实体拼写变体校正以及准确的句子分句。
- 提出一种弱监督方法,基于摘要与题录的对齐,自动识别印度法律文档中具有摘要价值的句子。
- 证明弱监督神经模型在印度法律文本上可超越强基线提取式摘要方法。
- 实现超越摘要的广泛应用,包括修辞角色标注、引用分析和判例检索。
提出的方法
- 作者从公开记录中收集了 10,764 份印度最高法院判决书,通过标准化法律缩写和校正命名实体的拼写变体对数据进行预处理。
- 将每份判决书按句子进行分句,并利用先前研究中的预训练模型为句子分配修辞角色标签。
- 开发了一种伪相关性评分机制,基于与对应题录的重叠程度,自动将句子标记为“具有摘要价值”。
- 使用焦点损失训练神经句子分类器,并对具有摘要价值的句子施加 4 倍的偏差以缓解类别不平衡问题。
- 通过欠采样和阈值优化(0.5–0.85)对模型进行微调,以最大化 ROUGE-F1 分数。
- 最终摘要系统根据分类器输出选择句子,不施加显式的长度约束。
实验结果
研究问题
- RQ1仅使用题录作为监督信号,弱监督方法能否有效识别印度法律判决书中具有摘要价值的句子?
- RQ2与 LexRank、LSA 和 Greedy-KL 等传统提取式摘要方法相比,神经分类器在印度法律文本上的性能如何?
- RQ3所提出的模型在不同法律领域(如宪法法、知识产权和刑事法)中的泛化能力如何?
- RQ4考虑到 1950 年至 1993 年间判决书中语言使用的演变,该模型在不同时间段的表现如何?
- RQ5所提出的数据集和处理流程能否支持摘要之外的下游任务,如修辞角色标注和引用分析?
主要发现
- 所提出的弱监督神经模型取得 0.619 的 ROUGE-F1 分数,显著优于强基线方法,如 LexRank(0.542)、LSA(0.540)和 Greedy-KL(0.538)。
- 模型在不同法律领域中表现出良好的泛化能力,其中在知识产权领域表现最佳(ROUGE-F1:0.697),在劳动与工业法领域也取得优异结果(0.676)。
- 在 1950–1955 年期间性能略有下降,表明对旧式语言风格的适应存在挑战,但在大多数时间范围内表现稳定。
- 采用基于词数的长度控制方法(如方法 5)相比基于句子的方法获得更高精确度(例如 0.558),这归因于印度判决书中句子平均长度较长(150 个词)。
- 该数据集是迄今为止公开可用的最大规模印度法律文本标注语料库,包含丰富的元数据,如案件引用、法官姓名、当事人信息和法律条文引用。
- 作者确认,该模型在不同子领域和时间周期中均表现稳健,验证了其在法律 NLP 应用中的实际可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。