QUICK REVIEW
[论文解读] Classifying medical notes into standard disease codes using Machine Learning
Amitabha Karmakar|arXiv (Cornell University)|Feb 1, 2018
Text and Document Classification Technologies参考文献 8被引用 7
一句话总结
本文提出一种使用卷积神经网络(CNNs)结合自注意力机制的深度学习方法,以自动将临床出院记录分类为标准的ICD-9疾病编码。该方法优于先前的模型,在完整MIMIC-III数据集上对ICD-9第1级编码的F1得分达到79.7%,表明CNN结合注意力机制在该任务中比LSTM或层次化模型更有效。
ABSTRACT
We investigate the automatic classification of patient discharge notes into standard disease labels. We find that Convolutional Neural Networks with Attention outperform previous algorithms used in this task, and suggest further areas for improvement.
研究动机与目标
- 利用深度学习改进临床出院记录自动分类为标准ICD-9疾病编码。
- 评估注意力机制与CNN是否在该任务中优于传统的LSTM和层次化分类器等模型。
- 研究标签层次结构、数据规模和嵌入策略对模型性能的影响。
- 探索通过修改训练指标,结合简化版与完整ICD编码方法的可行性。
- 评估预训练嵌入在临床文本分类任务中的实用性。
提出的方法
- 本研究在MIMIC-III数据库的52,696份出院记录上采用多标签、多分类分类框架。
- 应用带有和不带自注意力机制的CNN模型,以捕捉临床文本中的局部和长距离依赖关系。
- 模型采用可学习的词嵌入,同时进行了使用WikiGloVe和在MIMIC病历上微调的自定义预训练嵌入的额外实验。
- 利用层次结构将标签减少至17个ICD-9第1级编码,以提升训练稳定性和性能。
- 还实现了一个基于句子级别的LSTM的层次化模型作为对比,通过句子分割来建模时间进程。
- 训练目标包含F1得分优化,并对注意力机制、嵌入方法和标签简化进行了消融研究。
实验结果
研究问题
- RQ1带有自注意力机制的CNN是否在将临床记录分类为ICD-9编码方面优于标准CNN、LSTM和层次化模型?
- RQ2将ICD-9编码数量减少至第1级层次结构,对分类性能和模型泛化能力有何影响?
- RQ3预训练嵌入在多大程度上提升了临床记录分类任务的性能?
- RQ4注意力机制能否缓解固定句子分割在建模临床叙事时的局限性?
- RQ5通过调整训练指标以考虑层次标签的接近程度,是否可行地统一简化版与完整ICD编码方法?
主要发现
- 带有注意力机制的CNN模型在5K验证集上取得了最高的F1得分(78.2%),但在完整数据集上因过拟合而表现较差。
- 标准CNN模型在完整数据集上对17个ICD-9第1级编码的分类任务中实现了79.7%的F1得分,优于文献中报告的所有先前方法。
- 层次化LSTM模型的表现劣于两种CNN变体,表明在此背景下,建模句子级时间结构的收益有限。
- WikiGloVe的预训练嵌入略微降低了性能,而基于MIMIC的自定义嵌入带来了0.01%的性能提升,表明领域特定的预训练更有效。
- 与罕见的第5级编码相比,使用更大且类别分布更均衡的标签集(17个第1级编码)显著提升了模型性能。
- 研究发现,CNN通过卷积滤波器隐式学习文档级抽象表示,这可能解释了其在性能上优于依赖显式句子分割的模型的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。