[论文解读] Clinical Tagging with Joint Probabilistic Models
本文提出一种联合概率模型,利用噪声锚点标签(而非金标准诊断)进行临床标签化,通过基于似然的目标函数和基于矩的初始化方法,提升对未观察到的临床状况的预测能力。该方法在预测‘患者可能还患有其他什么疾病?’的任务中显著优于基线模型,在保留数据上的条件预测任务中达到68%的准确率和79%的MRR,尽管无法访问真实标签,仍接近最优性能。
We describe a method for parameter estimation in bipartite probabilistic graphical models for joint prediction of clinical conditions from the electronic medical record. The method does not rely on the availability of gold-standard labels, but rather uses noisy labels, called anchors, for learning. We provide a likelihood-based objective and a moments-based initialization that are effective at learning the model parameters. The learned model is evaluated in a task of assigning a heldout clinical condition to patients based on retrospective analysis of the records, and outperforms baselines which do not account for the noisiness in the labels or do not model the conditions jointly.
研究动机与目标
- 解决在缺乏金标准标签或其获取成本高昂时,训练准确临床状况预测模型的挑战。
- 开发一种基于从ICD9编码、药物使用和自由文本记录中提取的噪声锚点标签,对多种临床状况进行联合建模的方法。
- 通过联合建模而非单独建模,提升对未观察到的临床状况(特别是回答‘患者可能还患有其他什么疾病?’)的预测能力。
- 评估基于似然的训练目标函数和基于矩的初始化方法,在无真实标签情况下恢复模型参数的有效性。
提出的方法
- 该方法使用二部图概率图模型,从电子病历特征中联合预测23种临床状况。
- 使用噪声锚点标签(如ICD9编码、药物使用、自由文本术语)作为金标准标签的替代品,并通过一个噪声过程模型估计标签噪声。
- 采用矩方法初始化,利用锚点统计量估计噪声过程的参数,为优化提供稳健的初始参数。
- 通过半监督学习优化基于似然的目标函数,利用锚点标注数据和未标注数据共同精炼模型参数。
- 模型采用患者记录的二值词袋表示法,包括分箱后的年龄、性别、主诉、分诊记录和临床编码。
- 最终推理采用噪声或(noisy-or)因子分解方法,建模临床状况的共现关系,并计算未观察到状况的后验概率。
实验结果
研究问题
- RQ1使用噪声锚点的联合概率建模是否能优于单独分类器,在预测未观察到的临床状况方面表现更优?
- RQ2在无真实标签的情况下,基于矩的初始化在提升模型收敛性和性能方面有多有效?
- RQ3基于似然的训练目标在多大程度上能恢复接近使用真实标签进行最大似然估计的模型质量?
- RQ4与独立条件预测相比,联合建模是否能提升在临床问题‘患者可能还患有其他什么疾病?’上的性能?
主要发现
- 所提方法在保留数据的条件预测任务中达到68%准确率、92% Top-5召回率和79% MRR,显著优于噪声鲁棒分类器和朴素标签基线。
- 经过似然优化后的‘Noisy-or final’模型,其性能距离使用真实标签的最优最大似然估计(MLE)仅差3%(71%准确率,81% MRR),表明模型结构被有效恢复。
- 基于矩的初始化(‘Noisy-or init’)达到64%准确率和76% MRR,表明恰当初始化至关重要——随机初始化未能超越朴素标签基线。
- 模型学习到了有意义且具有临床相关性的特征:例如,'sob'和'albuterol sulfate'在哮喘预测中具有高权重,'s/p fall'与跌倒相关状况高度相关。
- 即使在无真实标签的情况下,该方法仍保持有效性,其性能接近使用金标准标签的MLE,表明对标签噪声具有强鲁棒性。
- 结果表明,结合锚点的联合建模可实现更优的条件间校准,提升多条件查询的推理性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。