Skip to main content
QUICK REVIEW

[论文解读] A Bayesian Hierarchical Network for Combining Heterogeneous Data Sources in Medical Diagnoses

Claire Donnat, Nina Miolane|arXiv (Cornell University)|Jul 27, 2020
Anomaly Detection Techniques and Applications参考文献 39被引用 8
一句话总结

本文提出一种基于随机期望最大化(StEM)算法的贝叶斯分层网络,用于整合异质性、噪声大且可能不可靠的医疗数据源(如症状、风险因素和侧向流动检测(LFA)结果),实现单一、具备不确定性感知的诊断。该方法能够稳健地结合不精确数据及其置信区间,在模拟数据和真实世界部署中表现优异,尤其在一项新冠状病毒免疫研究中成功识别出潜在的假阴性结果,并对检测的敏感性和特异性进行了再校准。

ABSTRACT

Computer-Aided Diagnosis has shown stellar performance in providing accurate medical diagnoses across multiple testing modalities (medical images, electrophysiological signals, etc.). While this field has typically focused on fully harvesting the signal provided by a single (and generally extremely reliable) modality, fewer efforts have utilized imprecise data lacking reliable ground truth labels. In this unsupervised, noisy setting, the robustification and quantification of the diagnosis uncertainty become paramount, thus posing a new challenge: how can we combine multiple sources of information -- often themselves with vastly varying levels of precision and uncertainty -- to provide a diagnosis estimate with confidence bounds? Motivated by a concrete application in antibody testing, we devise a Stochastic Expectation-Maximization algorithm that allows the principled integration of heterogeneous, and potentially unreliable, data types. Our Bayesian formalism is essential in (a) flexibly combining these heterogeneous data sources and their corresponding levels of uncertainty, (b) quantifying the degree of confidence associated with a given diagnostic, and (c) dealing with the missing values that typically plague medical data. We quantify the potential of this approach on simulated data, and showcase its practicality by deploying it on a real COVID-19 immunity study.

研究动机与目标

  • 解决整合多种异质性、噪声大且不可靠的医疗数据源(如症状、风险因素和LFA检测结果)的挑战,其中真实标签往往缺失或不确定。
  • 在低数据量或高噪声环境下(常见于家庭检测和新发疾病筛查),开发一种系统性方法,用于估计具有量化置信区间的诊断概率。
  • 在缺乏可靠真实标签的情况下,通过考虑各模态间不确定性的贝叶斯形式化方法,实现稳健诊断。
  • 通过识别高不确定性病例(如潜在的假阴性)来提高诊断准确性,特别是在检测结果与临床症状或暴露史冲突时。

提出的方法

  • 提出一种贝叶斯分层网络,用于建模在多个数据源(包括症状、风险因素和检测结果)条件下疾病状态的联合概率。
  • 采用随机期望最大化(StEM)算法,迭代估计模型参数(包括敏感性、特异性和疾病流行率),即使在数据缺失的情况下也能进行。
  • 为模型参数使用共轭先验,并通过后验推断进行更新,从而在所有输入上实现系统性不确定性量化。
  • 将潜在疾病状态作为隐变量,观测数据包括症状报告、风险因素暴露情况和LFA检测结果。
  • 通过EM框架中的边缘化处理缺失数据,避免数据删除,从而保留统计效能。
  • 将检测性能(敏感性和特异性)的不确定性建模为随机变量,通过先验知识和实证数据进行更新,实现动态再校准。

实验结果

研究问题

  • RQ1如何整合多种异质性且噪声大的医疗数据源(如自报症状、暴露史和侧向流动检测结果),以生成具备不确定性量化的可靠诊断?
  • RQ2在缺乏真实标签的情况下,贝叶斯分层模型在多大程度上能提升诊断准确性,特别是当检测准确性不确定或未经校准时?
  • RQ3该模型能否检测并标记高诊断不确定性的病例(如潜在的假阴性),特别是在检测结果与临床症状冲突时?
  • RQ4LFA检测的敏感性和特异性在不同临床亚组(如无症状与有症状者、早期与晚期检测)中如何变化?模型能否基于真实世界数据对这些值进行再校准?
  • RQ5当数据稀疏且噪声大时,模型能否推断出人群中真实的免疫状态和症状概率?

主要发现

  • 在模拟数据中,StEM算法成功收敛至接近真实值的参数估计,多数系数的相对差异小于5%。
  • 当敏感性和特异性较高时,收敛速度显著提升,且算法扩展性良好,迭代时间随样本量线性增长。
  • 在117名医护人员的真实数据中,模型对LFA的敏感性和特异性进行了再校准,尤其在无症状个体中更新幅度最大,表明其实际性能低于制造商声明。
  • 模型将两名受试者(编号108和92)标记为潜在的假阴性,正确识别出因症状与检测结果不一致导致的高不确定性,其后验分布反映了这种模糊性。
  • 后验分布显示,干咳和呼吸困难等症状在确诊的有症状个体中更为普遍,提供了具有人群特异性的洞察。
  • 当多个数据源一致时,模型提供的诊断置信区间更窄且更具信息量;当数据源冲突时,置信区间更宽,从而增强了临床可解释性和安全性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。