[论文解读] Federated Learning Enables Big Data for Rare Cancer Boundary Detection
本文提出了一种联邦学习(FL)框架,用于在不共享原始数据的情况下,跨71个全球机构训练深度学习模型,以实现胶质母细胞瘤肿瘤边界自动检测。利用来自6,314名患者的25,256例MRI扫描——这是文献中最大的此类数据集——该方法在检测手术可靶向肿瘤区域方面实现了33%的性能提升,在完整肿瘤范围检测方面实现了23%的性能提升,证明了联邦学习在罕见病研究中的可扩展性和有效性。
Although machine learning (ML) has shown promise in numerous domains, there are concerns about generalizability to out-of-sample data. This is currently addressed by centrally sharing ample, and importantly diverse, data from multiple sites. However, such centralization is challenging to scale (or even not feasible) due to various limitations. Federated ML (FL) provides an alternative to train accurate and generalizable ML models, by only sharing numerical model updates. Here we present findings from the largest FL study to-date, involving data from 71 healthcare institutions across 6 continents, to generate an automatic tumor boundary detector for the rare disease of glioblastoma, utilizing the largest dataset of such patients ever used in the literature (25,256 MRI scans from 6,314 patients). We demonstrate a 33% improvement over a publicly trained model to delineate the surgically targetable tumor, and 23% improvement over the tumor's entire extent. We anticipate our study to: 1) enable more studies in healthcare informed by large and diverse data, ensuring meaningful results for rare diseases and underrepresented populations, 2) facilitate further quantitative analyses for glioblastoma via performance optimization of our consensus model for eventual public release, and 3) demonstrate the effectiveness of FL at such scale and task complexity as a paradigm shift for multi-site collaborations, alleviating the need for data sharing.
研究动机与目标
- 解决胶质母细胞瘤等罕见癌症机器学习模型中数据多样性有限和泛化能力不足的挑战。
- 克服多机构合作中因隐私、监管和物流限制导致的集中化数据共享障碍。
- 开发一种可扩展的、隐私保护的机器学习框架,利用联邦学习在全局分布的数据集上训练高性能肿瘤分割模型。
- 实现在不同人群和成像协议下具有鲁棒性和泛化能力的模型性能,以支持罕见病应用。
- 证明联邦学习在神经肿瘤学复杂医学图像分割任务中大规模应用的可行性与优越性。
提出的方法
- 采用联邦学习框架,使本地模型在71家机构的去中心化MRI数据上独立训练,而无需共享原始图像。
- 通过中心服务器以安全、隐私保护的方式聚合参与机构的模型更新(梯度或权重)。
- 应用共识训练策略,将本地模型聚合为全局模型,提升泛化能力和鲁棒性。
- 采用基于3D U-Net的卷积神经网络(CNN)架构,用于胶质母细胞瘤肿瘤边界的3D MRI分割。
- 实施数据增强和归一化技术,以应对不同机构间成像协议的差异。
- 通过多轮迭代联邦学习,结合模型平均和学习率调度,优化收敛性和性能。
实验结果
研究问题
- RQ1联邦学习能否在不集中原始医学图像的前提下,有效训练深度学习模型,实现对大规模、多样化且地理分布广泛的胶质母细胞瘤肿瘤分割数据集的分割?
- RQ2与公开可用的集中训练基线模型相比,联邦学习模型在分割手术可靶向肿瘤区域和完整肿瘤范围方面,性能提升程度如何?
- RQ3在联邦学习环境中,模型性能在不同成像协议、扫描仪类型和患者群体中的表现如何变化?
- RQ4在联邦学习中,数据多样性与规模对罕见病应用中模型泛化能力的影响是什么?
- RQ5联邦学习能否作为多中心医学人工智能研究中集中数据共享的可扩展、隐私保护的替代方案?
主要发现
- 与公开可用的基线模型相比,联邦学习模型在检测手术可靶向肿瘤区域的Dice分数上实现了33%的相对提升。
- 该模型在完整肿瘤范围分割的Dice分数上表现出23%的相对提升,表明其在全面肿瘤勾画方面具有更高的准确性。
- 本研究利用了目前已知最大的胶质母细胞瘤分割数据集——涵盖来自六大洲71家机构的6,314名患者的25,256例MRI扫描。
- 通过联邦学习训练的共识模型在不同成像协议和患者群体中均表现出良好的泛化能力,证实了联邦学习方法的鲁棒性。
- 性能提升在多个独立验证队列中保持一致,证明了模型的可靠性与可迁移性。
- 结果验证了联邦学习作为罕见病大规模、多中心医学人工智能研究中可行、可扩展且隐私保护的范式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。