Skip to main content
QUICK REVIEW

[论文解读] Multi-Label Classification of Patient Notes a Case Study on ICD Code Assignment

Tal Baumel, Jumana Nassour-Kassis|arXiv (Cornell University)|Sep 27, 2017
Biomedical Text Mining and Ontologies被引用 88
一句话总结

本文比较了四种模型,用于从出院摘要分配多标签 ICD 编码,并展示层次注意力 GRU(HA-GRU)在具有透明、句子级注意力的错误分析方面达到当前最先进的结果。研究使用 MIMIC II 和 III 数据集,覆盖完整 ICD-9 编码和汇总(rolled-up) ICD-9 编码。

ABSTRACT

In the context of the Electronic Health Record, automated diagnosis coding of patient notes is a useful task, but a challenging one due to the large number of codes and the length of patient notes. We investigate four models for assigning multiple ICD codes to discharge summaries taken from both MIMIC II and III. We present Hierarchical Attention-GRU (HA-GRU), a hierarchical approach to tag a document by identifying the sentences relevant for each label. HA-GRU achieves state-of-the art results. Furthermore, the learned sentence-level attention layer highlights the model decision process, allows easier error analysis, and suggests future directions for improvement.

研究动机与目标

  • 在电子病历中以非常大的标签集为目标,自动化实现多标签 ICD 编码的动机与意义。
  • 研究四种模型(SVM、CBOW、CNN、HA-GRU)在完整与汇总的 ICD-9 编码集上的表现。
  • 通过注意力机制实现模型透明度,以解释预测。
  • 在 MIMIC II 和 MIMIC III 上评估模型,以考察训练数据量对泛化能力的影响。

提出的方法

  • 评估四种多标签 ICD 编码模型:一对多 SVM、CBOW 神经模型、CNN,以及带层次句子级注意力的 HA-GRU。
  • 使用 spaCy 分词、基于编辑距离的归一化,以及 5+ 词汇 cutoff 进行文本预处理。
  • 将文档分层为句子,以实现两级 GRU 编码器。
  • HA-GRU 采用句子级双向 GRU 并进行注意力权重计算,以选取每个标签相关的句子;随后进行文档级双向 GRU,并进行标签特异性注意力。
  • 以适当的损失函数独立训练每个分类器:SVM/CBOW/CNN 使用二元交叉熵,HA-GRU 使用分类交叉熵,输出对每个标签的 softmax。
  • 在两种标签配置下进行比较:完整的 5 位 ICD-9 代码和汇总的 3 位代码。

实验结果

研究问题

  • RQ1极端多标签分类是否能够在包含大量 ICD 编码的长出院摘要上有效实现?
  • RQ2在 DRNN(HA-GRU)中的层次注意力是否比传统基线提高多标签 ICD 编码任务?
  • RQ3在完整 ICD-9 与汇总 ICD-9 编码集以及不同训练数据规模(MIMIC II 与 MIMIC III)上,模型表现如何?
  • RQ4注意力机制是否能够为 ICD 编码预测提供透明、可解释的解释?

主要发现

  • HA-GRU 在汇总 ICD-9 编码上取得最佳性能,在 MIMIC III 上的 Micro-F1 为 55.86%,相较最佳非 HA 基线大约高出 2.8 个百分点。
  • 在完整 ICD-9 实验中,CNN 在 MIMIC III 上略微优于 HA-GRU,但 HA-GRU 仍然表现强劲并提供更好的解释能力。
  • 在以 MIMIC II 与 MIMIC III 进行训练时,更多数据使所有模型表现提升,且 HA-GRU 在汇总任务上显示显著提升(例如在 MIMIC II 的汇总设置中,F1 绝对值提升约 7%)。
  • 两级注意力实现对每个标签的句子选择以及对每个句子单词级的聚焦,有助于模型透明度和错误分析。
  • 通过将罕见变体基于编辑距离进行分词与归一化的预处理步骤,显著提升 CBOW 和 CNN 的性能,约提升 0.5% 的 F1。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。