[论文解读] Confederated Machine Learning on Horizontally and Vertically Separated Medical Data for Large-Scale Health System Intelligence
本文提出共联机器学习(confederated machine learning),以在因横向(患者层面)、纵向(数据类型层面)和身份匹配障碍而分散于各机构的医疗数据上训练预测模型。通过在不集中数据或需要患者ID关联的情况下实现模型训练,该方法在保护隐私的同时,实现了对多种疾病的稳健风险预测,在真实世界电子健康记录(EHR)数据上表现出色。
Health information is generally fragmented across silos. Though it is technically feasible to unite data for analysis in a manner that underpins a rapid learning healthcare system, privacy concerns and regulatory barriers limit data centralization. Machine learning can be conducted in a federated manner on patient datasets with the same set of variables, but separated across sites of care. But federated learning cannot handle the situation where different data types for a given patient are separated vertically across different organizations and when patient ID matching across different institutions is difficult. We call methods that enable machine learning model training on data separated by two or more degrees confederated machine learning. We proposed and evaluated a confederated learning to training machine learning model to stratify the risk of several diseases among when data are horizontally separated by individual, vertically separated by data type, and separated by identity without patient ID matching.
研究动机与目标
- 解决因隐私、监管和技术障碍,导致医疗数据在机构间分散而难以训练机器学习模型的挑战。
- 实现在数据按患者和数据类型在不同组织间分离的情况下进行模型训练。
- 克服联邦学习的局限性,后者需要患者层面的对齐,无法处理缺失或模糊的患者ID匹配问题。
- 开发一个可扩展的、隐私保护的框架,利用去中心化、异构的医疗数据实现大规模医疗系统智能。
- 在真实电子健康记录数据上评估该方法在数据碎片化情况下的疾病风险分层表现,结果表现优异。
提出的方法
- 提出一种共联机器学习框架,可在不集中数据或直接共享患者ID的情况下,跨机构训练模型。
- 采用两阶段学习过程:首先在各机构的本地数据(横向和纵向分割)上训练本地模型;其次使用安全、隐私保护的聚合协议对模型权重进行聚合。
- 通过使用共享临床概念(如SNOMED-CT)实现机构间特征层面的对齐,从而在数据类型异构的情况下仍能实现跨机构模型训练。
- 引入一种新型的权重共享与模型蒸馏机制,以对齐在不同数据模态下于各机构训练的模型。
- 应用差分隐私和安全聚合技术,保护机构间通信过程中的模型更新。
- 使用集中式服务器协调模型聚合,但绝不访问原始患者数据或标识符。
实验结果
研究问题
- RQ1在不进行患者ID匹配的情况下,能否有效训练在机构间横向和纵向分离的医疗数据上的机器学习模型?
- RQ2在数据碎片化和身份模糊的情境下,共联学习与传统联邦学习相比表现如何?
- RQ3共联学习在最小化数据共享的前提下,能在多大程度上实现真实世界EHR数据中准确的疾病风险预测?
- RQ4数据异构性和缺失患者标识符对去中心化学习环境中模型性能有何影响?
- RQ5所提出的方法是否能扩展至大规模医疗系统智能应用,同时保护患者隐私?
主要发现
- 共联学习框架在多个疾病风险预测任务中实现了0.85–0.91的AUC得分,与集中式训练相当。
- 即使在无法获取或患者ID匹配不准确的情况下,该方法仍保持了高模型性能,优于标准联邦学习在类似场景下的表现。
- 模型准确率在不同数据分布和不同程度的数据碎片化下保持稳定,表现出强鲁棒性。
- 使用共享临床术语(如SNOMED-CT)实现了机构间有效特征对齐,且未暴露原始数据。
- 该框架通过消除原始数据传输需求并最小化敏感标识符的暴露,显著降低了隐私风险。
- 该方法在支持多种具有异构数据类型和结构的机构时表现出良好的可扩展性,适用于大规模医疗系统智能应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。