Skip to main content
QUICK REVIEW

[论文解读] Fine-grained Intent Classification in the Legal Domain

Ankan Mullick, Abhilash Nandy|arXiv (Cornell University)|May 6, 2022
Artificial Intelligence in Law被引用 5
一句话总结

本文提出了一项针对法律文书的新细粒度意图分类数据集,该数据集同时标注了粗粒度(4类:谋杀、抢劫、土地纠纷、腐败)和细粒度子意图,并对基于Transformer的模型在文档分类与意图分类任务上的表现进行了评估。尽管在粗粒度任务上表现良好,模型在细粒度意图分类任务上表现显著不佳,凸显了该数据集作为法律NLP基准的挑战性与价值。

ABSTRACT

A law practitioner has to go through a lot of long legal case proceedings. To understand the motivation behind the actions of different parties/individuals in a legal case, it is essential that the parts of the document that express an intent corresponding to the case be clearly understood. In this paper, we introduce a dataset of 93 legal documents, belonging to the case categories of either Murder, Land Dispute, Robbery, or Corruption, where phrases expressing intent same as the category of the document are annotated. Also, we annotate fine-grained intents for each such phrase to enable a deeper understanding of the case for a reader. Finally, we analyze the performance of several transformer-based models in automating the process of extracting intent phrases (both at a coarse and a fine-grained level), and classifying a document into one of the possible 4 categories, and observe that, our dataset is challenging, especially in the case of fine-grained intent classification.

研究动机与目标

  • 为解决法律文书细粒度意图分类缺乏标注数据集的问题,特别是为了理解案件审理过程中隐含意图。
  • 通过短语级和子意图级标注,实现对法律文书的更深层次分析,以提升法律文书理解能力。
  • 评估最先进Transformer模型在法律领域文档级分类与细粒度意图分类任务上的表现。
  • 建立一个捕捉细微法律意图的基准数据集,以支持未来法律NLP与自动化案件摘要的研究。

提出的方法

  • 从CommonLII使用Selenium收集了来自四类案件(谋杀、抢劫、土地纠纷、腐败)的93份法律文书,构建数据集。
  • 两名标注员筛选出表达意图且与文档类别匹配的句子,随后另外两人提取意图短语,排除姓名、日期等无关细节。
  • 一名独立标注员为每种类别开发了子意图分类体系,四名标注员为每个意图短语标注其对应的细粒度子意图。
  • 通过Cohen's kappa(κ = 0.79)测量标注者间一致性,确保标注质量。
  • 使用JointBERT框架,对预训练的Transformer模型(BERT、RoBERTa、ALBERT、DeBERTa)进行微调,以执行文档分类与联合意图-槽位分类任务。
  • 评估指标包括精确率、召回率、F1-score以及所有类别上的宏平均分数,并关注类别不平衡的影响。

实验结果

研究问题

  • RQ1基于Transformer的模型能否有效将法律文书分类到粗粒度意图类别(谋杀、抢劫、土地纠纷、腐败)?
  • RQ2模型在法律意图短语中识别并分类细粒度子意图(如“行动”、“证据”、“描述”)的能力如何?
  • RQ3类别不平衡在多大程度上影响模型性能,特别是对腐败等低频类别的影响?
  • RQ4能否使用预训练的Transformer模型在法律文本上有效执行联合意图与槽位分类?
  • RQ5所提出的数据集是否具有足够挑战性且适合作为推进法律NLP中细粒度意图分类的基准?

主要发现

  • DeBERTa在文档分类任务中取得了最高的准确率(0.90)与F1-score(0.90),优于BERT、RoBERTa与DistilBERT。
  • 在粗粒度意图分类任务中,BERT的F1-score最高(0.89),其次为RoBERTa(0.88)与ALBERT(0.87),宏平均F1为0.90。
  • 细粒度意图分类性能显著下降,BERT的宏平均F1仅为0.50,表明仍有巨大提升空间。
  • 采用BERT主干的JointBERT模型在细粒度意图分类任务上的F1-score为0.50(宏平均),各类别F1-score范围在0.29至0.67之间。
  • 腐败与谋杀的子意图表现最差,F1-score分别为0.52与0.54,其中“Murder_evidence”类别最低(0.29),主要由于样本量少且任务复杂。
  • 尽管各类别样本量较低,模型在所有细粒度类别上均实现了F1 > 0.4,14个类别中有12个高于0.4,表明该任务在进一步优化后具备可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。