[论文解读] Towards the Practical Utility of Federated Learning in the Medical Domain
该论文通过在三个真实世界医疗数据集——纵向电子健康记录(EHR)、皮肤癌图像和心电图信号上评估六种联邦学习(FL)算法及一种混合方法(FedPxN),建立了医疗领域联邦学习的实际基准。结果表明,FedPxN在减少试错次数的同时持续实现优异性能,而频繁的全局更新和更高的客户端参与度虽带来更高成本,但能提升模型准确率。
Federated learning (FL) is an active area of research. One of the most suitable areas for adopting FL is the medical domain, where patient privacy must be respected. Previous research, however, does not provide a practical guide to applying FL in the medical domain. We propose empirical benchmarks and experimental settings for three representative medical datasets with different modalities: longitudinal electronic health records, skin cancer images, and electrocardiogram signals. The likely users of FL such as medical institutions and IT companies can take these benchmarks as guides for adopting FL and minimize their trial and error. For each dataset, each client data is from a different source to preserve real-world heterogeneity. We evaluate six FL algorithms designed for addressing data heterogeneity among clients, and a hybrid algorithm combining the strengths of two representative FL algorithms. Based on experiment results from three modalities, we discover that simple FL algorithms tend to outperform more sophisticated ones, while the hybrid algorithm consistently shows good, if not the best performance. We also find that a frequent global model update leads to better performance under a fixed training iteration budget. As the number of participating clients increases, higher cost is incurred due to increased IT administrators and GPUs, but the performance consistently increases. We expect future users will refer to these empirical benchmarks to design the FL experiments in the medical domain considering their clinical tasks and obtain stronger performance with lower costs.
研究动机与目标
- 为解决在真实医疗场景中部署联邦学习(FL)缺乏实用指导的问题,特别是针对医院和IT提供商。
- 在包括机构间数据异质性在内的现实条件下,评估多种FL算法的性能。
- 为多样化医疗数据模态提供关于模型架构、归一化技术、本地训练轮次和成本因素(功耗、GPU、管理员)的实证基准。
- 评估跨孤岛联邦学习在医疗领域中模型性能、训练成本与可扩展性之间的权衡。
- 识别一种稳健且通用的FL方法,以最小化临床部署中的试错成本。
提出的方法
- 在三个具有不同模态的真实世界医疗数据集上评估了六种成熟的FL算法——FedAvg、FedProx、FedBN、FedDyn、SCAFFOLD和FedPxN:表格型EHR(eICU)、皮肤镜图像(HAM10000)和心电图信号(PhysioNet)。
- 通过从不同机构(如eICU来自不同医院,HAM10000来自不同皮肤科诊所)获取各客户端的数据,确保了真实世界的数据异质性。
- 标准化实验设置:固定通信轮次,调整本地训练轮次,并对比两种归一化技术——层归一化(LN)和组归一化(GN)。
- 提出并评估了FedPxN,一种结合FedProx正则化与FedBN批量归一化的混合算法,以提升对数据异质性的鲁棒性。
- 使用AUROC衡量性能,涵盖六个临床任务(如死亡率预测、皮肤病变分类),并通过功耗和客户端数量量化成本。
- 通过消融实验研究客户端数量(5至30)和通信轮次,评估可扩展性与成本-性能权衡。
实验结果
研究问题
- RQ1在真实世界数据异质性条件下,哪种FL算法在多样化医疗数据模态(结构化、图像、信号)上表现最佳?
- RQ2在固定训练预算下,频繁的全局模型更新如何影响FL性能?
- RQ3增加参与客户端数量对模型性能和运行成本有何影响?
- RQ4不同的归一化技术(LN与GN)如何影响医疗应用中FL的收敛性和准确性?
- RQ5混合FL算法(FedPxN)是否能在多种模态和任务中持续优于或匹配表现最佳的单一算法?
主要发现
- FedPxN——一种结合FedProx正则化与FedBN批量归一化的混合算法——在所有三种医疗模态中均持续实现与其它FL算法相当或更优的性能。
- 简单的FL算法如FedAvg和FedProx在大多数设置下优于更复杂的算法(如SCAFFOLD和FedDyn),表明复杂性并不总能带来更好结果。
- 在固定训练迭代次数下,频繁的全局模型更新带来了更好的性能,表明通信频率是关键超参数。
- 随着参与客户端数量的增加,模型性能单调提升,在所有30个eICU客户端上训练时达到最高AUROC,证明了数据多样性的优势。
- 尽管FedPxN的功耗略高(3.401 kWh)高于FedBN(2.888 kWh),但其在所有任务和设置中均实现了最佳或接近最佳的AUROC,是一种具有成本效益的选择。
- 当使用GN在20个客户端上训练时,FedProx和FedPxN的AUROC分别为67.15和66.79,表明尽管算法设计不同,顶级方法之间的性能差距极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。