Skip to main content
QUICK REVIEW

[论文解读] Distributed Weight Consolidation: A Brain Segmentation Case Study

Patrick McClure, Charles Zheng|PubMed|May 28, 2018
Domain Adaptation and Few-Shot Learning参考文献 30被引用 5
一句话总结

本文提出分布式权重整合(DWC),一种持续学习方法,可在无序训练或模型集成的情况下,从独立的非重叠sMRI数据集上整合预训练的深度神经网络——特别针对脑部分割任务。DWC在单个站点上的泛化能力得到提升,并在大规模独立多中心数据集上保持强劲性能,其在各站点特定测试中的表现优于集成基线模型,同时保持了良好的泛化能力。

ABSTRACT

Collecting the large datasets needed to train deep neural networks can be very difficult, particularly for the many applications for which sharing and pooling data is complicated by practical, ethical, or legal concerns. However, it may be the case that derivative datasets or predictive models developed within individual sites can be shared and combined with fewer restrictions. Training on distributed data and combining the resulting networks is often viewed as continual learning, but these methods require networks to be trained sequentially. In this paper, we introduce distributed weight consolidation (DWC), a continual learning method to consolidate the weights of separate neural networks, each trained on an independent dataset. We evaluated DWC with a brain segmentation case study, where we consolidated dilated convolutional neural networks trained on independent structural magnetic resonance imaging (sMRI) datasets from different sites. We found that DWC led to increased performance on test sets from the different sites, while maintaining generalization performance for a very large and completely independent multi-site dataset, compared to an ensemble baseline.

研究动机与目标

  • 解决由于隐私、伦理或法律限制,无法共享临床神经影像数据时,对分布式非共享临床神经影像数据进行深度神经网络训练的挑战。
  • 开发一种方法,可在不依赖集中化数据或有序训练的情况下,整合来自多个站点的独立训练模型的知识。
  • 在单个站点测试集上提升模型泛化能力,同时在大规模完全独立的多中心数据集上保持高性能。
  • 为分布式医学影像应用提供一种可扩展的替代方案,以替代模型集成和有序持续学习。

提出的方法

  • DWC采用变分推理框架,整合来自不同sMRI数据集的多个独立训练的3D空洞卷积神经网络(基于MeshNet)的权重。
  • 它将整合过程建模为网络权重上的后验分布,并使用均值场近似以实现高效优化。
  • 该方法利用共享的权重先验分布,实现在不直接共享数据的情况下跨站点的知识迁移。
  • 在推理过程中,采用带有蒙特卡洛采样(10次采样)的随机梯度下降法,以近似期望输出。
  • 该方法支持非有序整合:多个站点的模型可按任意顺序组合,与传统持续学习不同。
  • 最终使用整合模型的MAP估计作为推理网络,并在保留的测试集上进行评估。

实验结果

研究问题

  • RQ1能否有效整合来自非重叠sMRI数据集上独立训练的深度神经网络的知识,以提升在单个站点测试集上的性能?
  • RQ2与基线方法相比,整合后的模型在大规模完全独立的多中心数据集上是否保持了泛化性能?
  • RQ3在性能和对数据集顺序的鲁棒性方面,DWC与模型集成和有序持续学习相比如何?
  • RQ4DWC是否能有效应用于数据共享受限但模型共享可行的医学影像任务?
  • RQ5非有序整合对多样化神经影像站点上模型性能的影响如何?

主要发现

  • DWC在HCP、NKI、Buckner和WU120数据集上的加权平均Dice分数达到78.30,显著优于集成基线(p = 1.66e-15)。
  • DWC在ABIDE数据集上的Dice分数为70.76,与集成方法无显著差异(p = 0.733),表明在独立数据上的泛化能力未下降。
  • DWC的性能与VCL相当,但对数据集顺序的敏感性低于有序持续学习,其加权平均得分为78.28,而当最后训练较大数据集时,得分仅为75.95。
  • 视觉检查显示,DWC的分割结果与真实值高度一致,错误主要出现在区域边界处,与高性能的HNBW_MAP模型表现相似。
  • 该方法成功将来自四个不同站点(HCP、NKI、Buckner、WU120)的模型整合为单一模型,该模型在所有站点及独立数据集上均表现出良好泛化能力。
  • 采用变分推理结合蒙特卡洛采样,实现了对整合模型期望输出的稳健估计,支持可靠的推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。