Skip to main content
QUICK REVIEW

[论文解读] LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain

Joel Niklaus, Veton Matoshi|arXiv (Cornell University)|Jan 30, 2023
Natural Language Processing Techniques参考文献 78被引用 4
一句话总结

LEXTUREME 是一个用于法律自然语言处理的多语言、多任务基准,包含 24 种语言和 8 个语系的 11 个数据集。它评估多语言模型在法律文本理解任务中的表现,结果表明即使是最先进的模型也仅达到中等水平,凸显了对专用法律 NLP 系统的需求,并为该领域设立了具有挑战性的新评估标准。

ABSTRACT

Lately, propelled by the phenomenal advances around the transformer architecture, the legal NLP field has enjoyed spectacular growth. To measure progress, well curated and challenging benchmarks are crucial. However, most benchmarks are English only and in legal NLP specifically there is no multilingual benchmark available yet. Additionally, many benchmarks are saturated, with the best models clearly outperforming the best humans and achieving near perfect scores. We survey the legal NLP literature and select 11 datasets covering 24 languages, creating LEXTREME. To provide a fair comparison, we propose two aggregate scores, one based on the datasets and one on the languages. The best baseline (XLM-R large) achieves both a dataset aggregate score a language aggregate score of 61.3. This indicates that LEXTREME is still very challenging and leaves ample room for improvement. To make it easy for researchers and practitioners to use, we release LEXTREME on huggingface together with all the code required to evaluate models and a public Weights and Biases project with all the runs.

研究动机与目标

  • 为解决法律 NLP 领域中多语言基准的缺乏,特别是针对非英语语言的问题。
  • 创建一个标准化且具有挑战性的基准,真实反映不同语言和法律体系下法律语言的复杂性。
  • 通过语言聚合得分和数据集聚合得分两个综合指标,实现多语言模型的公平比较。
  • 发布一个公开、透明的评估平台,集成 Hugging Face,提供公开排行榜,并通过 Weights and Biases 实现完整可复现性。
  • 展示现有模型(包括像 ChatGPT 这类大语言模型)在法律 NLP 任务中的局限性。

提出的方法

  • 作者从文献(2010–2022 年)中整理了 11 个现有的法律 NLP 数据集,涵盖 8 个语系(日耳曼语、罗曼语、斯拉夫语等)的 24 种语言。
  • 定义了两种聚合评估指标:语言聚合得分和数据集聚合得分,采用调和平均数以平衡在多样化设置下的表现。
  • 对五种基于 Transformer 的多语言模型(如 mBERT、XLM-RoBERTa、DeBERTa)在所有数据集上进行了评估,以建立基线性能。
  • 该基准已在 Hugging Face 上发布,配备公开排行榜和完整的评估代码,确保可复现性和透明性。
  • 创建了 Weights and Biases 项目,用于记录所有模型运行,实现完整的可审计性和可比性。
  • 该数据集集合包含多样化的法律任务,如文本分类、命名实体识别和法律判决预测,输入范围从简短句子到完整法律文件。

实验结果

研究问题

  • RQ1多语言模型在多样化的法律语言和法律文本类型上的表现如何?
  • RQ2现有多语言模型(包括像 ChatGPT 这类大语言模型)在法律 NLP 任务上的泛化能力如何?
  • RQ3高资源与低资源法律语言设置之间的性能差距有多大?
  • RQ4现有基准是否能够充分捕捉法律语言的复杂性,包括长距离依赖关系和领域特定术语?
  • RQ5模型规模和架构在多语言背景下对法律 NLP 任务性能的影响如何?

主要发现

  • 表现最佳的基线模型在 XLM-RoBERTa-large 模型上取得了 60.0 的语言聚合得分和 60.0 的数据集聚合得分,表明仍有巨大的提升空间。
  • 即使是最强的模型,包括 XLM-RoBERTa-large 和 mDeBERTa-v3-base,在多个任务上的 micro-F1 也低于 80%,表明法律文本理解仍存在持续挑战。
  • ChatGPT 在 LEXTREME 的多个任务中表现不佳,尤其是在低资源语言中,表明其在法律推理能力方面存在局限。
  • 观察到模型规模与性能之间存在显著相关性,更大的模型在所有语言和任务中均持续优于较小模型。
  • 各数据集中输入序列长度的分布表明,许多法律文件的长度超过了典型 NLP 模型的输入长度,凸显了在法律 NLP 中对长上下文建模的需求。
  • 该基准揭示了当前多语言模型在法律领域分布偏移下并不鲁棒,尤其是在低资源语言中,强调了需要进行领域特定的微调和数据收集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。