Skip to main content
QUICK REVIEW

[论文解读] Large Scale Legal Text Classification Using Transformer Models

Zein Shaheen, Gerhard Wohlgenannt|arXiv (Cornell University)|Oct 24, 2020
Natural Language Processing Techniques参考文献 32被引用 10
一句话总结

本论文提出了一种基于微调的Transformer方法,针对JRC-Acquis和EURLEX57K数据集上的大规模法律文本分类任务,采用BERT、RoBERTa、DistilBERT、XLNet以及多语言BERT模型,通过语言模型微调、渐进式解冻策略和迭代分层采样技术,实现了新的最先进性能,分别在JRC-Acquis和EURLEX57K数据集上达到0.661和0.754的微F1分数,实现了标准化的数据划分。

ABSTRACT

Large multi-label text classification is a challenging Natural Language Processing (NLP) problem that is concerned with text classification for datasets with thousands of labels. We tackle this problem in the legal domain, where datasets, such as JRC-Acquis and EURLEX57K labeled with the EuroVoc vocabulary were created within the legal information systems of the European Union. The EuroVoc taxonomy includes around 7000 concepts. In this work, we study the performance of various recent transformer-based models in combination with strategies such as generative pretraining, gradual unfreezing and discriminative learning rates in order to reach competitive classification performance, and present new state-of-the-art results of 0.661 (F1) for JRC-Acquis and 0.754 for EURLEX57K. Furthermore, we quantify the impact of individual steps, such as language model fine-tuning or gradual unfreezing in an ablation study, and provide reference dataset splits created with an iterative stratification algorithm.

研究动机与目标

  • 提升法律领域大规模多标签文本分类(LMTC)任务的最先进性能,尤其针对具有长尾标签分布的数据集。
  • 评估近期Transformer模型(BERT、RoBERTa、DistilBERT、XLNet和多语言BERT)在具有数千个标签的法律文本上的有效性。
  • 通过迭代分层采样技术建立标准化、可复现的数据集划分,以支持未来研究的公平比较。
  • 量化语言模型微调、渐进式解冻和判别性学习率等训练策略对LMTC性能的影响。
  • 利用EuroVoc分类体系的层次结构,推导出精简的标签集合,以提升分类性能。

提出的方法

  • 在JRC-Acquis和EURLEX57K的法律文本上,对多种Transformer模型(BERT、RoBERTa、DistilBERT、XLNet、多语言BERT)进行领域特定的微调。
  • 应用包括在目标法律文本上进行语言模型微调、按组逐步解冻网络层以及使用倾斜三角学习率在内的训练策略。
  • 采用迭代分层采样技术,为两个数据集生成标准化、平衡的训练/验证/测试划分,以确保可复现性和公平比较。
  • 利用EuroVoc分类体系中的语义关系,构建精简的标签集合(如顶级术语、微型同义词表、领域子集),以提升分类性能。
  • 通过消融研究隔离各训练策略和超参数对模型性能的独立贡献。
  • 以微F1作为主要评估指标,并在标准CPU上测量推理时间,以分析计算效率。

实验结果

研究问题

  • RQ1在具有长尾标签分布的大规模法律文本分类任务中,基于Transformer的模型性能如何比较?
  • RQ2语言模型微调和渐进式解冻对具有数千个标签的法律文本分类性能有何影响?
  • RQ3与随机划分相比,迭代分层采样能否生成更可靠且可比较的数据集划分?
  • RQ4EuroVoc分类体系的层次结构在多大程度上可用于减少标签空间并提升分类准确率?
  • RQ5在该LMTC设置下,不同Transformer架构的计算成本和推理时间如何变化?

主要发现

  • 所提方法在JRC-Acquis数据集上实现了新的最先进微F1分数0.661,在EURLEX57K数据集上达到0.754。
  • RoBERTa和DistilBERT在大多数设置中优于BERT,其中DistilBERT在计算成本更低的情况下仍表现出色。
  • 语言模型微调和渐进式解冻均对实现高性能至关重要,消融研究证实了其显著的正面影响。
  • DistilBERT的推理时间最低(12 ms/样本),而XLNet最高(77 ms/样本),凸显了准确率与效率之间的权衡。
  • 基于EuroVoc层次结构推导出的精简标签集合显著提升了分类得分,证明了利用语义结构的价值。
  • 多语言BERT展现出有前景的初步结果,提示未来可结合多语言预训练和双语语料开展进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。