Skip to main content
QUICK REVIEW

[论文解读] Legal Area Classification: A Comparative Study of Text Classifiers on Singapore Supreme Court Judgments

Jerrold Soh, Lim How Khang|arXiv (Cornell University)|Apr 13, 2019
Artificial Intelligence in Law参考文献 20被引用 5
一句话总结

本研究评估了最先进的NLP模型(包括BERT、词嵌入和LSA)与传统统计模型在将新加坡最高法院判决书分类为31个法律领域方面的表现。尽管深度学习在NLP中占据主导地位,LSA模型在精确率方面仍优于神经网络,而BERT和GloVe-CNN在召回率方面表现更优,凸显了在长篇法律文本上对大型模型进行领域特定微调的必要性。

ABSTRACT

This paper conducts a comparative study on the performance of various machine learning (``ML'') approaches for classifying judgments into legal areas. Using a novel dataset of 6,227 Singapore Supreme Court judgments, we investigate how state-of-the-art NLP methods compare against traditional statistical models when applied to a legal corpus that comprised few but lengthy documents. All approaches tested, including topic model, word embedding, and language model-based classifiers, performed well with as little as a few hundred judgments. However, more work needs to be done to optimize state-of-the-art methods for the legal domain.

研究动机与目标

  • 评估现代NLP模型与传统统计模型在将新加坡最高法院判决书分类为法律领域的表现。
  • 研究数据稀缺性和文档长度对法律NLP中文本分类器性能的影响。
  • 评估最先进的深度学习模型(如BERT和ULMBERT)在少量、长篇判决文本构成的法律语料库中是否具有良好泛化能力。
  • 基于一个包含6,227份新加坡最高法院判决书的新数据集(在31个法律领域中标注),建立法律领域分类的基准。
  • 探讨基于关键词的基线模型在召回率关键的法律检索任务中是否具有作为强劲竞争者的潜力。

提出的方法

  • 本研究使用一个包含6,227份新加坡最高法院判决书的新数据集,这些判决书由人工标注至31个普通法法律领域。
  • 文本分类模型包括传统方法(LSA、TF-IDF结合线性SVM)、词嵌入方法(GloVe、CNN、平均/最大池化)以及基于Transformer的模型(BERT-base、BERT-large、ULMBERT)。
  • 模型在全数据集的10%、50%和100%子集上进行训练和评估,以衡量数据效率。
  • 性能通过微观和宏观精确率与召回率进行衡量,同时引入一个基于关键词的基线模型(count_25),使用包含25个术语的法律本体。
  • 通过截断或分割长判决书来解决BERT等模型无法处理完整长度文本的输入长度限制问题。
  • 所有模型均以未经超参数调优的原始状态进行评估,以确保公平比较。

实验结果

研究问题

  • RQ1最先进的NLP模型与传统统计模型在将法律判决书分类为法律领域方面表现如何?
  • RQ2数据稀缺性(数千份标注判决)在多大程度上影响现代深度学习模型在法律文本分类中的性能?
  • RQ3文档长度和输入长度限制如何影响基于Transformer的模型(如BERT)在法律文本上的性能?
  • RQ4在召回率关键的法律检索任务中,简单的基于关键词的基线模型能否超越复杂的神经网络模型?
  • RQ5领域特定的预训练与微调在提升法律语料库中模型性能方面起到何种作用?

主要发现

  • LSA模型在100%完整数据集上实现了最高的宏观精确率(80.0%),甚至优于BERT和GloVe-CNN模型。
  • 在10%子集上,$glove_{cnn}$ 实现了最高的宏观精确率(75.3%),但 $lsa_{250}$ 仍以74.2%位列第二。
  • BERT模型在10%和50%子集上实现了最佳的微观和宏观召回率,其中 $bert_{large}$ 在100%数据集上达到68.5%的微观召回率和61.6%的宏观召回率。
  • 基于关键词的基线模型 $count_{25}$ 在所有数据子集上的微观和宏观召回率均优于其他所有模型,表明其在以召回率为焦点的任务中具有强大的基线性能。
  • 尽管为未经微调的原始状态,BERT模型在仅588份标注判决的情况下即表现出具有竞争力的性能,表明其具备数据高效适应的潜力。
  • ULMBERT在10%子集上表现强劲,但随着数据量增加未能有效扩展,表明该模型在数据利用方面存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。