Skip to main content
QUICK REVIEW

[论文解读] One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support

Ronja Stern, Vishvaksenan Rasiah|arXiv (Cornell University)|Jun 15, 2023
Artificial Intelligence in Law被引用 7
一句话总结

本文提出一个多语言、多任务的法律NLP基准——SCALE,涵盖五种语言的瑞士法律文件,用于测试长上下文理解、领域专业知识和多语言推理能力。尽管进行了广泛的领域内预训练,即使是大型模型也仅达到48.4%的宏平均F1分数,凸显了法律推理中的重大挑战,并凸显了该基准在推动大语言模型在真实司法应用中能力进步方面的价值。

ABSTRACT

Recent strides in Large Language Models (LLMs) have saturated many Natural Language Processing (NLP) benchmarks, emphasizing the need for more challenging ones to properly assess LLM capabilities. However, domain-specific and multilingual benchmarks are rare because they require in-depth expertise to develop. Still, most public models are trained predominantly on English corpora, while other languages remain understudied, particularly for practical domain-specific NLP tasks. In this work, we introduce a novel NLP benchmark for the legal domain that challenges LLMs in five key dimensions: processing \emph{long documents} (up to 50K tokens), using \emph{domain-specific knowledge} (embodied in legal texts), \emph{multilingual} understanding (covering five languages), \emph{multitasking} (comprising legal document-to-document Information Retrieval, Court View Generation, Leading Decision Summarization, Citation Extraction, and eight challenging Text Classification tasks) and \emph{reasoning} (comprising especially Court View Generation, but also the Text Classification tasks). Our benchmark contains diverse datasets from the Swiss legal system, allowing for a comprehensive study of the underlying non-English, inherently multilingual legal system. Despite the large size of our datasets (some with hundreds of thousands of examples), existing publicly available multilingual models struggle with most tasks, even after extensive in-domain pre-training and fine-tuning. We publish all resources (benchmark suite, pre-trained models, code) under permissive open CC BY-SA licenses.

研究动机与目标

  • 为解决法律NLP领域中缺乏全面、多语言且具有领域特异性的基准,特别是针对非英语、高复杂度法律推理任务的问题。
  • 评估当前大语言模型在长篇法律文件(最长50K tokens)上的表现,这些文件需要深入的法律领域理解。
  • 创建一个覆盖单一司法管辖区(瑞士)五种语言的基准,以实现对跨语言迁移和多语言泛化能力的严格测试。
  • 通过评估多种预训练多语言模型并训练定制的瑞士法律模型,为未来研究建立强基线。
  • 将所有数据、模型和代码以宽松的CC BY-SA许可证发布,以促进法律NLP领域的开放研究和可复现性。

提出的方法

  • 该基准SCALE由来自26个瑞士州和瑞士联邦最高法院(FSCS)的七种不同法律NLP数据集组成,涵盖五种官方语言。
  • 任务包括文本分类(关键性预测、判决预测、法律领域预测)、信息检索,以及两项生成任务:法院视角生成和主要判决摘要生成。
  • 作者微调并评估了一系列多语言预训练模型,包括mBERT、mT5,以及他们自研的Legal Swiss RoBERTa和Legal Swiss Longformer模型。
  • 评估采用标准指标,如宏平均F1、BLEU、METEOR、ROUGE和NDCG,重点关注长上下文处理(最长50K tokens)。
  • 研究包括在瑞士法律语料库上进行领域内预训练,以评估领域特定微调对模型性能的影响。
  • 所有资源均以CC BY-SA许可证在Hugging Face上发布,确保完全可复现性和开放获取。
Figure 1: Sequence of tasks for support in the judicial system.
Figure 1: Sequence of tasks for support in the judicial system.

实验结果

研究问题

  • RQ1当前多语言大语言模型在瑞士这样复杂、多司法管辖区的法律背景下,跨五种语言的泛化能力如何?
  • RQ2大语言模型在需要深度推理和上下文理解的长篇法律文件(最长50K tokens)上的表现如何?
  • RQ3在瑞士法律语料库上进行领域内预训练是否能显著提升法律文本分类和生成任务的性能?
  • RQ4为何即使经过大量领域内微调,大型模型在关键法律任务(如关键性预测和引用提取)上仍表现不佳?
  • RQ5当基于复杂法律推理时,mT5和BERT等生成模型在摘要生成和法院视角生成任务上的表现如何?

主要发现

  • 表现最佳的模型在所有文本分类任务上的宏平均F1分数仅为48.4%,表明法律推理方面仍有巨大提升空间。
  • ChatGPT在文本分类任务上表现较差,显著低于微调过的模型,表明其在零样本法律推理方面存在局限。
  • 关键性预测、信息检索和法院视角生成任务的结果尤其薄弱,表现出随意性和不一致性。
  • 即使经过广泛的领域内预训练,公开的多语言模型在大多数任务上仍表现不佳,凸显了该基准的难度。
  • 生成任务如主要判决摘要生成结果参差不齐:部分输出虽通顺(如BERT得分为88.03),但部分存在事实错误或偏离主题。
  • 该基准揭示了当前大语言模型在处理复杂法律推理、领域特定术语以及专业法律环境下的跨语言泛化能力方面仍缺乏鲁棒性。
Figure 2: Database Creation Pipeline
Figure 2: Database Creation Pipeline

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。