Skip to main content
QUICK REVIEW

[论文解读] Robust Inference for Federated Meta-Learning

Zijian Guo, Xiudi Li|arXiv (Cornell University)|Jan 2, 2023
Machine Learning in Healthcare被引用 4
一句话总结

该论文提出了一种用于联邦元学习的鲁棒推断方法(RIFL),可在不共享个体数据的前提下,对多个数据源中的主导模型进行统计推断。RIFL采用数据自适应的站点选择机制和定制化的抽样方法,构建能够考虑选择不确定性的真实置信区间,即使在站点选择不完美时也能保持有效性,从而在隐私约束和数据异质性条件下实现鲁棒推断。

ABSTRACT

Synthesizing information from multiple data sources is critical to ensure knowledge generalizability. Integrative analysis of multi-source data is challenging due to the heterogeneity across sources and data-sharing constraints due to privacy concerns. In this paper, we consider a general robust inference framework for federated meta-learning of data from multiple sites, enabling statistical inference for the prevailing model, defined as the one matching the majority of the sites. Statistical inference for the prevailing model is challenging since it requires a data-adaptive mechanism to select eligible sites and subsequently account for the selection uncertainty. We propose a novel sampling method to address the additional variation arising from the selection. Our devised CI construction does not require sites to share individual-level data and is shown to be valid without requiring the selection of eligible sites to be error-free. The proposed robust inference for federated meta-learning (RIFL) methodology is broadly applicable and illustrated with three inference problems: aggregation of parametric models, high-dimensional prediction models, and inference for average treatment effects. We use RIFL to perform federated learning of mortality risk for patients hospitalized with COVID-19 using real-world EHR data from 16 healthcare centers representing 275 hospitals across four countries.

研究动机与目标

  • 开发一种适用于联邦元学习的鲁棒推断框架,确保在数据异质性和隐私约束下实现有效的统计推断。
  • 解决在识别主导模型(即多数站点共享的模型)时的选择不确定性问题,而无需依赖无误差的站点选择。
  • 实现即使在合格站点选择不完美或数据自适应的情况下,仍保持有效的置信区间构造。
  • 支持多中心生物医学研究中的实际应用,例如利用来自四个国家16家医疗中心的真实世界电子健康记录(EHR)数据,预测新冠肺炎死亡率。
  • 将该方法推广至参数模型、高维预测模型以及在保护隐私环境下的平均处理效应推断。

提出的方法

  • 提出一种数据自适应机制,通过多数规则的推广来识别与主导模型一致的站点,允许通过容差参数κ容忍小范围偏差。
  • 引入一种新颖的抽样方法,以考虑站点选择过程引入的额外变异性,确保推断的有效性。
  • 采用基于重采样的方法构建置信区间,以调整选择不确定性,且无需共享个体层面的数据。
  • 采用一种鲁棒推断框架,在数据分布假设最少的前提下,即使站点选择不完美,也能保持一致有效的覆盖概率。
  • 应用群体分布鲁棒建模方法,将位于主导模型容忍带范围内的站点信息进行聚合,提升模型稳定性。
  • 通过集合𝒱κ(θ)对多数规则进行推广,将主导模型定义为被超过阈值比例(如80%)的站点共享的模型,从而在实际应用中提升灵活性。

实验结果

研究问题

  • RQ1当站点选择为数据自适应且可能存在错误时,我们能否为联邦元学习中的主导模型构建有效的置信区间?
  • RQ2在不共享个体层面数据的前提下,如何确保在跨站点数据异质性存在时,统计推断具有统一的有效性?
  • RQ3不完美的站点选择对推断有效性有何影响?能否通过一种鲁棒的抽样机制加以校正?
  • RQ4所提出的方法能否推广至高维模型和隐私保护环境下的平均处理效应估计?
  • RQ5定义主导集合的阈值选择(如50%与80%)如何影响置信区间的长度和覆盖概率?

主要发现

  • 即使站点选择不完美,RIFL置信区间仍能保持一致有效的覆盖概率,优于标准的事后选择推断方法。
  • 当大多数站点与异常值明显分离时,RIFL的覆盖概率和区间长度与假设已知多数组的“理想”置信区间相当。
  • 该方法成功识别出血清白蛋白是16家医疗中心住院新冠肺炎患者14天死亡率的重要预测因子。
  • 在来自四个国家275家医院的真实世界EHR数据中,RIFL表现出鲁棒性,证实了其在多样化人群中的可推广性。
  • RIFL的80%规则扩展版本由于纳入了更强的先验信息,相比多数规则可获得更短的置信区间,同时仍能保证有效的覆盖概率。
  • 经验评估表明,当多数规则失效(即无任何站点集合超过总站点数的10%)时,该方法仍可通过重采样提供模型一致性的启发式验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。