Skip to main content
QUICK REVIEW

[论文解读] Fast Approach to Build an Automatic Sentiment Annotator for Legal Domain using Transfer Learning

Viraj Salaka Gamage, Menuka Warushavithana|arXiv (Cornell University)|Oct 3, 2018
Topic Modeling参考文献 16被引用 5
一句话总结

本文提出一种迁移学习方法,利用在电影评论上预训练的RNTN模型,构建法律文本的自动情感标注工具。通过在人工标注的法律语料上微调源模型,该方法在检测法律短语中的负面情感时,准确率提升6%(76.80% vs. 70.17%),召回率提升10%(70.14%)。

ABSTRACT

This study proposes a novel way of identifying the sentiment of the phrases used in the legal domain. The added complexity of the language used in law, and the inability of the existing systems to accurately predict the sentiments of words in law are the main motivations behind this study. This is a transfer learning approach, which can be used for other domain adaptation tasks as well. The proposed methodology achieves an improvement of over 6\% compared to the source model's accuracy in the legal domain.

研究动机与目标

  • 解决法律文本情感分析的挑战,因为法律文本在语言上复杂且在自然语言处理领域研究不足。
  • 克服预训练情感模型(如Socher等人,2013b年提出的RNTN模型)在法律领域语言上表现不佳的局限性。
  • 开发一种无需在法律领域进行大规模人工标注的领域自适应情感标注工具。
  • 实现法律短语中负面情感的自动化识别,以支持法律推理和论辩分析。
  • 证明该方法在自然语言处理中其他领域适应任务中的可迁移性。

提出的方法

  • 微调最初在电影评论上训练的递归神经张量网络(RNTN)模型,用于情感分类。
  • 使用约1,500个来自法院案件笔录的法律短语手动标注测试数据集,标签为负面或非负面。
  • 通过使用少量特定领域的数据集,对源模型的参数进行微调,以适应法律领域。
  • 为负面情感类别引入基于阈值的评分机制,以提高召回率,同时不显著降低精确率。
  • 使用混淆矩阵和标准指标,将微调后的目标模型性能与原始源模型(Socher等人,2013b年)进行比较。
  • 利用RNTN的结构特性,通过捕捉法律文本中的层次句法依赖关系,建模短语级情感。

实验结果

研究问题

  • RQ1迁移学习能否在仅需极少领域特定标注的情况下,有效将预训练于电影评论的情感模型适配到法律领域?
  • RQ2与源模型相比,微调RNTN模型在法律文本中情感分类的准确率和召回率提升程度如何?
  • RQ3目标模型在识别法律短语中的负面情感方面,与源模型相比表现如何?
  • RQ4引入基于阈值的决策规则对法律文本情感分类的召回率和精确率有何影响?
  • RQ5该迁移学习方法能否推广到法律领域之外的其他自然语言处理领域适应任务中?

主要发现

  • 目标模型在分类法律短语情感时的整体准确率达到76.80%,比源模型的70.17%高出6个百分点。
  • 目标模型在识别负面情感方面的召回率达到70.14%,比基线模型的60.43%高出10个百分点。
  • 目标模型中负面情感类别的精确率提升至84.41%,高于基线模型的79.62%。
  • 源模型与目标模型在预测结果上存在差异的短语占总数的9.5%,表明性能提升源于领域特定的适应。
  • 模型性能受限于源模型的上限,表明进一步提升需依赖源架构的改进。
  • 该方法具有可迁移性,可在无需新大规模人工标注的情况下,适配到其他领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。