Skip to main content
QUICK REVIEW

[论文解读] Split Learning for Distributed Collaborative Training of Deep Learning Models in Health Informatics

Zhuohang Li, Chao Yan|PubMed|Aug 21, 2023
Privacy-Preserving Technologies in Data参考文献 15被引用 6
一句话总结

该论文提出了一种名为分割学习(split learning)的隐私保护分布式训练框架,用于医疗信息学中的深度学习模型,其中客户端训练客户端模型,并仅将潜在表征("压缩数据")发送至服务器,服务器在不访问原始数据的情况下完成前向和反向传播。该方法在性能上与集中式和联邦学习相当,同时通过仅让客户端掌握全局模型的部分组件,提升了客户端效率并降低了隐私风险。

ABSTRACT

Deep learning continues to rapidly evolve and is now demonstrating remarkable potential for numerous medical prediction tasks. However, realizing deep learning models that generalize across healthcare organizations is challenging. This is due, in part, to the inherent siloed nature of these organizations and patient privacy requirements. To address this problem, we illustrate how split learning can enable collaborative training of deep learning models across disparate and privately maintained health datasets, while keeping the original records and model parameters private. We introduce a new privacy-preserving distributed learning framework that offers a higher level of privacy compared to conventional federated learning. We use several biomedical imaging and electronic health record (EHR) datasets to show that deep learning models trained via split learning can achieve highly similar performance to their centralized and federated counterparts while greatly improving computational efficiency and reducing privacy risks.

研究动机与目标

  • 解决由于隐私和数据主权限制导致医疗组织间难以共享数据,从而在医疗组织间训练可泛化的深度学习模型的挑战。
  • 开发一种分布式学习框架,在保护患者层面数据隐私的同时,支持多机构协作。
  • 通过仅让客户端掌握全局模型的部分组件,减少对全局模型的完整知识暴露,从而降低模型反演攻击和成员推断攻击的风险,优于联邦学习。
  • 通过将部分模型训练任务卸载至服务器,同时最小化通信开销,提升客户端设备的计算效率。
  • 通过可配置的切割层位置和大小,实现隐私、效用与效率之间的灵活权衡。

提出的方法

  • 在指定的切割层将全局深度神经网络划分为两个子模型:客户端模型(在本地训练)和服务器模型(在服务器上训练)。
  • 客户端使用其客户端模型对原始数据执行前向传播,并仅将生成的潜在表征(压缩数据)发送至服务器,从而保护原始数据隐私。
  • 服务器使用服务器模型完成前向传播,计算损失,并通过反向传播将梯度发送回客户端,用于本地模型更新。
  • 训练过程在多轮迭代中进行,客户端使用从服务器接收的梯度更新其模型,模拟集中式训练过程。
  • 切割层的大小和位置为可调参数,用于控制压缩数据中的信息泄露与模型效用之间的权衡。
  • 该框架不要求客户端与服务器之间共享模型架构或参数,从而降低了模型反演和知识产权泄露的风险。
(a) Federated learning
(a) Federated learning

实验结果

研究问题

  • RQ1分割学习是否能在保护患者数据隐私的前提下,实现与集中式和联邦学习相当的模型性能,特别是在医疗应用中?
  • RQ2与联邦学习相比,分割学习在隐私风险方面表现如何,特别是在模型反演和成员推断攻击方面?
  • RQ3切割层的位置和大小对健康数据中分割学习的隐私-效用-效率权衡有何影响?
  • RQ4分割学习是否能减轻医疗组织的计算负担,同时保持高模型准确率?
  • RQ5分割学习如何适应异构的数据分布以及多样化的生物医学数据类型(如医学影像和电子健康记录)?

主要发现

  • 在五个不同类型的健康数据集(包括医学影像和电子健康记录)上,分割学习实现了与集中式和联邦学习相当的模型性能。
  • 通过将部分模型训练任务卸载至服务器,分割学习显著降低了客户端的计算成本,提升了资源受限机构的效率。
  • 通过仅让客户端掌握全局模型的部分组件,分割学习相比联邦学习降低了模型反演和成员推断攻击的风险。
  • 使用压缩数据——即客户端模型生成的潜在表征——最小化了信息泄露,尤其当切割层更深时,其包含的输入特异性信息更少。
  • 可配置的切割层位置提供了在隐私、效用和效率之间灵活权衡的能力,相比联邦学习更具灵活性。
  • 尽管相比联邦学习存在更高的通信开销,但通过边缘服务器和异步训练等潜在优化手段,该框架仍具备可行性。
(b) Split learning
(b) Split learning

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。