Skip to main content
QUICK REVIEW

[论文解读] Development of deep learning algorithms to categorize free-text notes pertaining to diabetes: convolution neural networks achieve higher accuracy than support vector machines

Boyi Yang, Adam Wright|arXiv (Cornell University)|Sep 16, 2018
Machine Learning in Healthcare参考文献 17被引用 3
一句话总结

本研究开发并评估了深度学习模型——特别是卷积神经网络(CNNs)——在电子健康记录(EHRs)中对糖尿病相关病历笔记进行分类的效果。基于来自布里格姆妇女医院的2,000份标注EHR笔记和来自德克萨斯大学医学院的1,000份笔记,可分离卷积神经网络模型在本机构测试集上取得了0.975的AUC,在外部验证中取得0.875的AUC,其在机构内分类准确率优于支持向量机(SVMs),但在跨机构泛化方面存在权衡。

ABSTRACT

Health professionals can use natural language processing (NLP) technologies when reviewing electronic health records (EHR). Machine learning free-text classifiers can help them identify problems and make critical decisions. We aim to develop deep learning neural network algorithms that identify EHR progress notes pertaining to diabetes and validate the algorithms at two institutions. The data used are 2,000 EHR progress notes retrieved from patients with diabetes and all notes were annotated manually as diabetic or non-diabetic. Several deep learning classifiers were developed, and their performances were evaluated with the area under the ROC curve (AUC). The convolutional neural network (CNN) model with a separable convolution layer accurately identified diabetes-related notes in the Brigham and Womens Hospital testing set with the highest AUC of 0.975. Deep learning classifiers can be used to identify EHR progress notes pertaining to diabetes. In particular, the CNN-based classifier can achieve a higher AUC than an SVM-based classifier.

研究动机与目标

  • 开发能够准确分类与糖尿病相关的自由文本EHR笔记的深度学习模型。
  • 将卷积神经网络(CNNs)、循环神经网络(RNNs)和混合模型与传统的支持向量机(SVMs)进行性能比较。
  • 通过在另一家机构的外部数据集上进行验证,评估模型的泛化能力。
  • 确定深度学习模型是否能在保持实际部署可行性的同时,提升分类准确率并超越SVMs。

提出的方法

  • 本研究使用了来自布里格姆妇女医院的2,000份人工标注的EHR病程记录(1,000份用于训练,1,000份用于测试),另使用来自德克萨斯大学医学院的1,000份笔记作为外部验证数据。
  • 文本通过词到数字的索引映射进行分词和编码,最终形成包含20,218个唯一词汇的词表。
  • 训练了多种深度学习架构,包括标准CNN、可分离CNN、RNN以及CNN-RNN混合模型,输入为词嵌入。
  • 使用受试者工作特征曲线下面积(AUC)评估模型性能,基于验证损失采用早停策略。
  • 可分离CNN(模型g)在速度与准确率之间进行了优化,实现了性能与推理时间的最佳平衡。
  • 通过在NumPy和TensorFlow层面固定随机种子,对超参数进行调优,以确保结果可复现。

实验结果

研究问题

  • RQ1深度学习模型,特别是CNNs,是否能在分类糖尿病相关EHR笔记方面优于传统的SVMs?
  • RQ2模型在布里格姆妇女医院内部测试与德克萨斯大学医学院外部验证中的性能表现有何差异?
  • RQ3将CNN与RNN(如双向LSTM)结合是否能提升在专业EHR文本上的分类性能?
  • RQ4深度学习模型在具有不同临床笔记书写风格的机构之间,其泛化能力如何?
  • RQ5与标准卷积相比,可分离卷积是否能同时提升准确率与推理速度?

主要发现

  • 可分离CNN模型(模型g)在布里格姆妇女医院数据集上的测试AUC达到最高值0.975,显著优于SVM基线模型。
  • 在德克萨斯大学医学院的外部验证集中,最佳CNN模型的AUC为0.875,虽低于其在内部的表现,但仍高于SVM的泛化性能。
  • 基于RNN的模型,包括双向LSTM,在二分类任务中未提升性能,且对高度专业的EHR笔记分类效果较差。
  • 在CNN后添加LSTM层未带来性能提升,混合CNN-RNN模型在此数据集上也未表现出协同增益。
  • 在BWH数据上训练的CNN模型捕捉到了机构特有的书写模式,从而提升了本机构内的分类准确率,但降低了在另一家机构的泛化能力。
  • 尽管泛化能力较低,CNN模型在单一机构内仍比SVM更快速、更准确,且在标准笔记本电脑上仅用161秒即完成训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。