Skip to main content
QUICK REVIEW

[论文解读] LoAdaBoost: loss-based AdaBoost federated machine learning with reduced computational complexity on IID and non-IID intensive care data

Huang Li, Yifeng Yin|arXiv (Cornell University)|Nov 30, 2018
Privacy-Preserving Technologies in Data参考文献 22被引用 14
一句话总结

该论文提出LoAdaBoost,一种基于损失的自适应提升联邦学习方法,可降低计算复杂度,并在独立同分布(IID)和非独立同分布(non-IID)的重症监护室(ICU)数据上提升预测准确率。通过根据客户端相对于前一轮中位损失的交叉熵损失动态调整训练轮次,LoAdaBoost在非IID场景下表现尤为出色,AUC最高达0.6548,平均轮次比FedAvg减少30%。

ABSTRACT

Intensive care data are valuable for improvement of health care, policy making and many other purposes. Vast amount of such data are stored in different locations, on many different devices and in different data silos. Sharing data among different sources is a big challenge due to regulatory, operational and security reasons. One potential solution is federated machine learning, which is a method that sends machine learning algorithms simultaneously to all data sources, trains models in each source and aggregates the learned models. This strategy allows utilization of valuable data without moving them. One challenge in applying federated machine learning is the possibly different distributions of data from diverse sources. To tackle this problem, we proposed an adaptive boosting method named LoAdaBoost that increases the efficiency of federated machine learning. Using intensive care unit data from hospitals, we investigated the performance of learning in IID and non-IID data distribution scenarios, and showed that the proposed LoAdaBoost method achieved higher predictive accuracy with lower computational complexity than the baseline method.

研究动机与目标

  • 解决在重症监护室(ICU)数据联邦学习中面临的非独立同分布(non-IID)及计算密集型数据分布挑战。
  • 在保持或提升在分布式、隐私敏感型健康数据上模型性能的同时,降低联邦学习的计算复杂度。
  • 开发一种基于客户端模型性能动态调整训练轮次的方法,以改善收敛性和准确率。
  • 在IID和non-IID的ICU数据集上评估该方法,包括数据共享策略的情景。

提出的方法

  • LoAdaBoost使用交叉熵损失作为性能指标,评估每轮全局训练中客户端模型的质量。
  • 通过计算前一轮所有客户端损失的中位数,建立模型拟合的基准。
  • 根据客户端损失相对于中位数损失的情况,将客户端分类为欠拟合、拟合良好或过拟合。
  • 动态调整训练轮次:欠拟合客户端获得更多的轮次,拟合良好的客户端获得更少轮次,过拟合客户端不再接受进一步训练。
  • 该方法与FedAvg的全局模型平均机制集成,保持通信效率的同时提升本地模型质量。
  • 该方法应用于MIMIC-III和eICU数据集,在IID、non-IID及数据共享条件下进行评估。

实验结果

研究问题

  • RQ1基于损失的自适应提升机制是否能提升在non-IID ICU数据上的联邦学习性能,同时降低计算成本?
  • RQ2在IID和non-IID数据分布下,LoAdaBoost与FedAvg相比,在收敛速度、预测准确率(AUC)和平均训练轮次方面表现如何?
  • RQ3基于客户端损失与中位数损失相对关系的动态轮次分配是否能提升联邦学习中的模型泛化能力?
  • RQ4在何种数据分布条件下(IID vs. non-IID),LoAdaBoost优于FedAvg?数据共享策略是否仍然必要?

主要发现

  • 在non-IID的eICU数据上,LoAdaBoost的AUC为0.6548 ± 0.0048,优于FedAvg的0.6512 ± 0.0043,且平均轮次更少(271 vs. 300)。
  • 在IID的eICU数据上,LoAdaBoost的AUC为0.6057 ± 0.0077,显著高于FedAvg的0.5693 ± 0.0057,平均轮次为262,低于FedAvg的400。
  • 在数据共享条件下,LoAdaBoost的AUC为0.6412 ± 0.0065,高于FedAvg的0.6253 ± 0.0088,且平均轮次更低(272 vs. 350)。
  • LoAdaBoost在所有数据分布场景下收敛更快,AUC更高,表现出对数据偏移的鲁棒性,并显著降低计算负载。
  • 与FedAvg相比,该方法将平均训练轮次最多减少了30%,尤其在IID场景下优势明显,因为FedAvg需400轮才能收敛。
  • 在non-IID设置下,即使不采用数据共享,LoAdaBoost的性能仍与FedAvg相当或更优,表明自适应提升机制能有效缓解数据偏移的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。