[论文解读] Disease phenotyping using deep learning: A diabetes case study
本研究提出一种深度学习模型,通过模仿临床编码员的决策来改进电子健康记录(EHR)中的糖尿病表型识别,利用人口统计学、实验室检查结果、药物使用情况以及既往诊断编码。该模型在预测ICD编码方面表现出高准确性,并发现9.07%的糖尿病病例存在编码错误或缺失,专家评审确认该模型在高置信度分歧病例中优于编码员。
Characterization of a patient clinical phenotype is central to biomedical informatics. ICD codes, assigned to inpatient encounters by coders, is important for population health and cohort discovery when clinical information is limited. While ICD codes are assigned to patients by professionals trained and certified in coding there is substantial variability in coding. We present a methodology that uses deep learning methods to model coder decision making and that predicts ICD codes. Our approach predicts codes based on demographics, lab results, and medications, as well as codes from previous encounters. We are able to predict existing codes with high accuracy for all three of the test cases we investigated: diabetes, acute renal failure, and chronic kidney disease. We employed a panel of clinicians, in a blinded manner, to assess ground truth and compared the predictions of coders, model and clinicians. When disparities between the model prediction and coder assigned codes were reviewed, our model outperformed coder assigned ICD codes.
研究动机与目标
- 通过使用深度学习建模编码员决策,解决糖尿病ICD编码中的不准确性。
- 开发一种可泛化的、数据驱动的疾病表型识别方法,无需依赖特定疾病的特征工程。
- 通过专家医生评审分歧病例,评估模型在准确性与可靠性方面的表现。
- 利用模型预测与专家验证,估算全球EHR中糖尿病编码错误率。
- 测试模型在多个医疗机构中的可扩展性与泛化能力。
提出的方法
- 使用去标识化的EHR数据(映射至OHDSI通用数据模型)训练一个多层感知机深度神经网络,输入特征包括人口统计学、实验室检查、药物使用情况以及既往诊断编码。
- 对特征进行筛选,仅保留至少在5%的糖尿病阳性病例中出现的特征,将维度从13,139降低至966,以减少稀疏性。
- 将既往就诊的诊断编码聚合为二值向量,以表示既往疾病负担,使模型能够在不使用RNN的情况下学习时间模式。
- 模型输出采用Sigmoid激活函数,生成表示糖尿病可能性的概率分数(p),用于按置信度水平对分歧病例进行分层。
- 专家医生以双盲方式评审了120个分歧病例,评估诊断是否存在及其自身判断的置信度。
- 在11家医疗机构的数据上重新训练模型,以评估其泛化能力,并在每家机构的独立测试集上评估性能。
实验结果
研究问题
- RQ1能否使用标准EHR数据元素,通过深度学习模型准确复现糖尿病ICD编码决策?
- RQ2模型预测的置信度与专家医生评估的实际临床糖尿病可能性之间是否存在相关性?
- RQ3真实世界EHR数据中糖尿病编码错误的比例是多少?这些错误在遗漏与错误编码之间如何分布?
- RQ4在多机构数据上训练的单一深度学习模型是否能有效泛化至不同医疗机构?
- RQ5模型与编码员的分歧在多大程度上反映了实际的编码错误,经专家评审验证?
主要发现
- 当在单一医疗机构的数据上进行训练和测试时,该深度学习模型的F1得分为0.80,表明其在预测糖尿病ICD编码方面表现优异。
- 在高置信度分歧病例中,40例专家评审中有35例与模型意见一致,表明当模型高度自信时,编码员更可能出错。
- 模型预测9.07%的所有就诊记录存在糖尿病编码错误或缺失,其中5.68%为遗漏,3.39%为错误编码。
- 模型预测的糖尿病概率与医生评估的疾病可能性高度一致,验证了其在不同置信度区间的校准能力。
- 当在11家医疗机构的数据上进行训练后,该模型在第143家医疗机构的测试集中取得了0.79的F1得分,显示出良好的泛化能力,并能有效应对机构特异性的批次效应。
- 专家评审确认,模型的置信度评分准确反映了各分歧组中糖尿病的真实流行率,表明其不确定性估计具有可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。