[论文解读] Legal Transformer Models May Not Always Help
本文研究了领域自适应预训练和适配器在法律NLP中的有效性,发现仅在低资源任务上,领域自适应模型(如LegalRoBERTa)才能显著提升性能。研究证明,适配器在训练成本远低于全量微调的情况下,可实现相近的性能表现,并发布了基于RoBERTa的LegalRoBERTa模型,该模型在法律文本上进行了预训练,以提升法律NLP应用的性能。
Deep learning-based Natural Language Processing methods, especially transformers, have achieved impressive performance in the last few years. Applying those state-of-the-art NLP methods to legal activities to automate or simplify some simple work is of great value. This work investigates the value of domain adaptive pre-training and language adapters in legal NLP tasks. By comparing the performance of language models with domain adaptive pre-training on different tasks and different dataset splits, we show that domain adaptive pre-training is only helpful with low-resource downstream tasks, thus far from being a panacea. We also benchmark the performance of adapters in a typical legal NLP task and show that they can yield similar performance to full model tuning with much smaller training costs. As an additional result, we release LegalRoBERTa, a RoBERTa model further pre-trained on legal corpora.
研究动机与目标
- 评估与标准模型相比,领域自适应预训练是否能提升法律NLP任务的性能。
- 探究领域自适应预训练的收益与下游任务数据量之间的关系。
- 评估适配器作为全量微调在法律NLP中高效替代方案的性能表现。
- 发布一个基于RoBERTa的新型法律专用模型LegalRoBERTa,该模型在精选法律语料库上进行了预训练。
- 确定在何种条件下,领域自适应预训练在法律NLP应用中真正具有优势。
提出的方法
- 从Caselaw Access Project、Google Patents及专利诉讼文件等来源收集并清洗了4.9GB的公开法律文本。
- 使用领域特定的超参数,通过掩码语言建模在该法律语料库上对RoBERTa模型进行预训练,构建LegalRoBERTa。
- 在两个法律NLP任务(法律文本分类和案件检索)上,将LegalRoBERTa与其他法律模型(如LegalBERT)与基础BERT和RoBERTa进行基准测试。
- 系统性地调整法律文本分类任务中的训练数据量,以评估数据稀缺对领域自适应预训练收益的影响。
- 在法律文本分类任务中实现并评估适配器——插入到Transformer层中的小型可训练神经模块——比较其性能与全量微调的差异。
- 使用标准指标(精确率、召回率、F1、R@5、P@5、RP@5、NDCG@5)评估不同模型与设置下的检索与分类性能。
实验结果
研究问题
- RQ1与标准预训练模型相比,使用法律语料库进行领域自适应预训练是否能在法律NLP任务上显著提升性能?
- RQ2领域自适应预训练的收益如何随下游训练数据集大小而变化?
- RQ3基于适配器的微调能否在降低训练成本和存储需求的同时,实现与全量模型微调相当的性能?
- RQ4在法律文本分类与检索任务中,使用LegalRoBERTa相比基础RoBERTa或BERT是否能带来可测量的性能提升?
- RQ5在何种条件下,研究人员应在法律NLP应用中优先选择领域自适应模型而非标准模型?
主要发现
- 使用法律语料库进行领域自适应预训练仅在低资源下游任务中带来显著性能提升,而在高资源任务中收益微乎其微。
- LegalRoBERTa在低资源文本分类与检索任务中优于基础RoBERTa和BERT,在LMTC任务中F1得分为0.72,在案件检索任务中NDCG@5为0.80。
- 在相同检索任务中,LegalBERT的F1(0.73)略高于LegalRoBERTa(0.72),但两者均优于基础RoBERTa(F1:0.74)和BERT(F1:0.71)。
- 适配器实现了与全量微调相当的性能表现:在LMTC任务中,基于适配器的模型与全量微调模型的F1(0.72)和NDCG@5(0.80)完全一致。
- 当下游训练数据量较大时,领域自适应预训练的性能增益可忽略不计;而当数据稀缺时,增益则非常显著,证实了其强烈依赖于数据量。
- 尽管使用的训练数据少于LegalBERT,LegalRoBERTa仍实现了相近的性能表现,表明聚焦于法律语料库的高效预训练是可行的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。