QUICK REVIEW
[论文解读] Automatic Catchphrase Extraction from Legal Case Documents via Scoring using Deep Neural Networks
Vu Tran, Le-Minh Nguyen|arXiv (Cornell University)|Sep 14, 2018
Advanced Text Analysis Techniques参考文献 9被引用 7
一句话总结
本文提出了一种基于深度学习的方法,仅使用文档级上下文和标准答案式短语(gold-standard catchphrases),无需依赖语料库范围的统计信息或引用信息,从法律案件文档中自动提取关键词短语。该系统采用卷积神经网络(CNN)基于局部上下文和词嵌入对短语进行打分,其ROUGE得分与使用外部元数据的最先进方法相当。
ABSTRACT
In this paper, we present a method of automatic catchphrase extracting from legal case documents. We utilize deep neural networks for constructing scoring model of our extraction system. We achieve comparable performance with systems using corpus-wide and citation information which we do not use in our system.
研究动机与目标
- 开发一种不依赖外部语料库统计信息或引用信息的法律案件文档自动关键词短语抽取系统。
- 通过深度神经网络学习标准关键词短语与文档中短语之间的直接关联,提升关键词短语识别效果。
- 实现对缺乏关键词短语的历史文档和新案件报告的高效且准确的关键词短语生成。
- 评估模型仅基于局部上下文和学习表征区分关键词短语与普通句子短语的能力。
提出的方法
- 系统采用两阶段方法:首先通过卷积神经网络(CNN)对短语进行打分,然后选择得分最高的短语。
- CNN模型将每个词的周围词(上下文窗口大小为5)、句子和文档级特征编码为潜在表征。
- 使用词嵌入(GloVe)作为输入特征,模型通过对比损失函数进行训练,以最大化关键词短语与非关键词短语之间的得分差异。
- 损失函数包含多个组成部分:正样本对损失、负样本对损失以及正则化项,以提升泛化能力并防止过拟合。
- 短语选择通过在半径 r=4 范围内(基于窗口大小5)识别得分最高的 t 个锚点短语完成,不施加句法约束。
- 模型使用随机梯度下降进行端到端训练,采用梯度裁剪和固定学习率 0.0001。
实验结果
研究问题
- RQ1仅使用文档内部上下文和标准答案式短语,深度学习模型能否有效提取法律关键词短语,而无需依赖语料库范围的统计信息或引用数据?
- RQ2与现有方法相比,基于CNN的打分模型在区分关键词短语与普通句子短语方面的表现如何?
- RQ3模型学习到的得分在多大程度上满足关键约束条件,如关键词短语的平均得分更高、方差更小?
- RQ4该系统在不同年份的法律案件文档集上是否保持一致的性能表现?
主要发现
- 所提系统在四个测试集(2006–2009年)上的平均ROUGE-1 F1得分为 0.2295,与使用语料库范围和引用信息的系统相当。
- 模型在ROUGE-W上的表现最佳,平均F1得分为 0.1175,表明其在候选关键词短语与参考短语之间的长序列共现方面表现优异。
- 系统满足5项设计约束中的3项:关键词短语得分的均值和方差高于句子短语,且模型未对所有关键词短语进行统一高分评分。
- 尽管未严格满足负向约束(o2),但模型并未将所有关键词短语的得分都高于句子短语,表明其具有鲁棒性。
- 模型在不同测试集上表现稳定,ROUGE-1 F1得分范围为 0.2148(2006年)至 0.2584(2009年),显示出一致的泛化能力。
- 在所有ROUGE指标上,该系统均优于多个强基线模型,如Mead LexRank、Mead Centroid和随机选择,证实了其有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。