[论文解读] LeXFiles and LegalLAMA: Facilitating English Multinational Legal Language Model Development
本文介绍了LeXFiles,一个涵盖六个法律体系(欧盟、英国、美国、加拿大、印度、欧洲委员会)的多样化跨国英语法律语料库,共190亿词符,以及LegalLAMA,一个用于评估预训练语言模型法律知识的探测基准。作者发布了两个基于LeXFiles微调的新法律PLM(LexLMs),并证明上游掩码语言建模性能与法律概念探测性能,与在LexGLUE上的下游性能存在强相关性,凸显了领域特定预训练和法律知识获取对有效法律NLP模型的重要性。
In this work, we conduct a detailed analysis on the performance of legal-oriented pre-trained language models (PLMs). We examine the interplay between their original objective, acquired knowledge, and legal language understanding capacities which we define as the upstream, probing, and downstream performance, respectively. We consider not only the models' size but also the pre-training corpora used as important dimensions in our study. To this end, we release a multinational English legal corpus (LeXFiles) and a legal knowledge probing benchmark (LegalLAMA) to facilitate training and detailed analysis of legal-oriented PLMs. We release two new legal PLMs trained on LeXFiles and evaluate them alongside others on LegalLAMA and LexGLUE. We find that probing performance strongly correlates with upstream performance in related legal topics. On the other hand, downstream performance is mainly driven by the model's size and prior legal knowledge which can be estimated by upstream and probing performance. Based on these findings, we can conclude that both dimensions are important for those seeking the development of domain-specific PLMs.
研究动机与目标
- 解决现有法律PLM在多样化法律体系与子语料库中缺乏全面评估的问题。
- 探究上游预训练目标、法律概念探测性能与下游任务性能之间的相互作用。
- 开发并发布大规模跨国英语法律语料库(LeXFiles)与法律知识探测基准(LegalLAMA),以支持未来研究。
- 在LeXFiles上训练并评估新的法律PLM(LexLMs),并与现有模型在LegalLAMA和LexGLUE上的表现进行比较。
- 确定模型规模、预训练语料多样性与法律知识获取对下游法律NLP性能的相对贡献。
提出的方法
- 作者构建了LeXFiles,一个包含来自六个英语法律体系的11个子语料库的多语言法律语料库,共580万份文档,总计约190亿词符。
- 他们发布了LegalLAMA,一个包含8个子任务的探测基准,用于评估模型在不同法律体系与主题下对法律术语、判例法与法规条文的知识掌握程度。
- 通过在LeXFiles上对RoBERTa-base与RoBERTa-large模型进一步预训练100万步,训练了两个新的法律PLM(LexLMs)。
- 作者在LeXFiles子语料库与LegalLAMA任务上评估了7个PLM,测量其上游(MLM)、探测(知识获取)与下游(LexGLUE)性能。
- 分析了上游、探测与下游性能之间的相关性,以评估上游与探测分数对下游成功预测能力的强弱。
- 对选定的LexGLUE任务进行微调,以评估迁移性能并验证预训练在下游泛化中的作用。
实验结果
研究问题
- RQ1法律PLM在LeXFiles语料库中不同法律体系与子语料库中的表现如何变化?
- RQ2上游掩码语言建模性能在多大程度上可预测法律NLP任务的下游性能?
- RQ3法律PLM在法律知识探测任务上的泛化能力如何?这揭示了其获取的法律知识的哪些特征?
- RQ4模型规模与预训练语料多样性对下游性能的相对贡献是什么?
- RQ5上游与探测性能能否作为法律NLP中下游性能的可靠代理指标?
主要发现
- 上游掩码语言建模性能与法律概念探测性能之间存在强相关性,表明在多样化法律语料库上预训练的模型能系统性地获取法律知识。
- LexGLUE上的下游性能主要由模型规模与先前的法律知识决定,而这些知识可通过上游与探测性能进行估计。
- LeXFiles语料库包含190亿词符,分布在11个子语料库中,其中美国判例法(占59.2%的词符)与美国合同(占27.3%)是最大组成部分,反映出现有法律语料库中显著的美国偏向性。
- LegalLAMA包含8个探测子任务,涵盖法律术语、判例法与法规条文,掩蔽术语源自关键法律文书,如《欧洲人权公约》与美国刑法典。
- 在LexGLUE任务上微调的模型表明,上游与探测性能是下游成功的重要预测指标,表明预训练期间的知识获取是迁移性能的关键决定因素。
- 发布基于LeXFiles预训练的LexLMs,为训练与评估覆盖更广泛跨国法律体系的法律PLM提供了新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。