Skip to main content
QUICK REVIEW

[论文解读] Charge-Based Prison Term Prediction with Deep Gating Network

Huajie Chen, Deng Cai|arXiv (Cornell University)|Aug 30, 2019
Artificial Intelligence in Law参考文献 24被引用 7
一句话总结

本文提出了基于罪名的刑期预测(CPTP)这一新任务,通过按罪名预测个体刑期,提升了准确率与可解释性。提出深度门控网络(DGN),采用分层的、针对罪名的门控机制,筛选并聚合相关案件信息,在中国最高人民法院提供的238,749起刑事案件大规模新数据集上实现了最先进性能。

ABSTRACT

Judgment prediction for legal cases has attracted much research efforts for its practice use, of which the ultimate goal is prison term prediction. While existing work merely predicts the total prison term, in reality a defendant is often charged with multiple crimes. In this paper, we argue that charge-based prison term prediction (CPTP) not only better fits realistic needs, but also makes the total prison term prediction more accurate and interpretable. We collect the first large-scale structured data for CPTP and evaluate several competitive baselines. Based on the observation that fine-grained feature selection is the key to achieving good performance, we propose the Deep Gating Network (DGN) for charge-specific feature selection and aggregation. Experiments show that DGN achieves the state-of-the-art performance.

研究动机与目标

  • 解决现有总刑期预测模型忽略罪名层面细节的局限性。
  • 通过将总刑期预测分解为针对罪名的预测,提升预测准确率与可解释性。
  • 利用中国最高人民法院的真实刑事案件记录,构建首个大规模、结构化的基于罪名的刑期预测数据集。
  • 开发一种方法,有效处理嘈杂、交错且冗长的案件描述,聚焦于罪名相关的信息。
  • 证明通过启发式整合,基于罪名的预测可提升总刑期预测性能。

提出的方法

  • 提出深度门控网络(DGN),一种分层架构,通过堆叠多个LSTM块与针对罪名的门控层,逐层筛选并聚合每个罪名的案件特征。
  • 使用词嵌入表示输入的案件描述,随后通过堆叠的LSTM层进行序列编码,并结合针对罪名的门控机制,突出相关段落。
  • 在每个块中采用门控机制,根据其与特定罪名的相关性,动态选择并抑制特征,实现对罪名相关内容的细粒度关注。
  • 在DGN最终输出上应用一维卷积神经网络(CNN),学习全局文档级表征以用于回归。
  • 使用对数Huber损失(LHL)进行模型训练,实证表明其在回归性能上优于MSE、MAE和标准Huber损失。
  • 通过简单启发式方法(如求和预测刑期)整合个体罪名的预测结果,生成总刑期估计值。

实验结果

研究问题

  • RQ1与端到端方法相比,基于罪名的刑期预测是否能提升总刑期预测的准确率与可解释性?
  • RQ2深度学习模型如何有效从冗长、交错的案件描述中识别并聚合罪名相关的信息?
  • RQ3在基于罪名的刑期预测中,DGN模型的最优深度与损失函数为何?
  • RQ4与直接预测总刑期相比,建模单个罪名是否能带来更优的整体性能?
  • RQ5在真实法律案件中,基于罪名的预测的主要失败模式与局限性是什么?

主要发现

  • 所提出的深度门控网络(DGN)在基于罪名的刑期预测任务上达到最先进性能,显著优于多个从基于方面的情感分类中迁移而来的强基线模型。
  • 模型性能随深度增加至三个块而提升,此后出现过拟合,表明存在最优的网络深度。
  • 对数Huber损失(LHL)在所有指标上表现最佳,尤其在S分数上优势明显,表明其与评估指标的匹配性增强了回归稳定性。
  • 即使未直接在总刑期预测上进行训练,个体罪名预测的启发式求和结果仍优于专门训练的总刑期基线模型,证明了CPTP分解的价值。
  • 错误分析揭示了主要失败模式:长篇团伙犯罪案件、描述不完整(仅限检察院指控内容)以及训练数据中代表性不足的罕见法律情形(如过度防卫)。”

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。