Skip to main content
QUICK REVIEW

[论文解读] COVID-19 Imaging Data Privacy by Federated Learning Design: A Theoretical Framework

Anwaar Ulhaq, Oliver Burmeister|arXiv (Cornell University)|Oct 13, 2020
Privacy-Preserving Technologies in Data参考文献 31被引用 15
一句话总结

本文提出了一种名为差分隐私设计(dPbD)的理论框架,以增强新冠状病毒病医学影像联邦学习系统的隐私保护。通过在整个设计生命周期中嵌入差分隐私,该框架确保了可扩展、稳健且保护隐私的协作,无需共享原始数据,在保持模型效用的同时保护患者隐私。

ABSTRACT

To address COVID-19 healthcare challenges, we need frequent sharing of health data, knowledge and resources at a global scale. However, in this digital age, data privacy is a big concern that requires the secure embedding of privacy assurance into the design of all technological solutions that use health data. In this paper, we introduce differential privacy by design (dPbD) framework and discuss its embedding into the federated machine learning system. To limit the scope of our paper, we focus on the problem scenario of COVID-19 imaging data privacy for disease diagnosis by computer vision and deep learning approaches. We discuss the evaluation of the proposed design of federated machine learning systems and discuss how differential privacy by design (dPbD) framework can enhance data privacy in federated learning systems with scalability and robustness. We argue that scalable differentially private federated learning design is a promising solution for building a secure, private and collaborative machine learning model such as required to combat COVID19 challenge.

研究动机与目标

  • 为应对全球新冠状病毒病研究中使用医学影像数据进行安全、隐私保护协作日益增长的需求。
  • 克服现有联邦学习系统在隐私保障方面缺乏足够可扩展性和鲁棒性的局限。
  • 从一开始就将差分隐私作为核心设计原则整合,而非作为事后补充。
  • 提供一个全面的理论框架,平衡联邦学习在医疗领域中的隐私、效用与系统韧性。
  • 实现在无数据泄露的前提下,跨机构对敏感新冠状病毒病影像数据进行安全、去中心化的AI模型训练。

提出的方法

  • 提出一种理论框架——差分隐私设计(dPbD),将隐私保护融入联邦学习系统开发的各个阶段。
  • 采用隐私优先设计方法,使差分隐私从初始设计阶段即嵌入系统,直至最终部署。
  • 在客户端层面于模型参数聚合前注入噪声,以隐藏个体数据的贡献。
  • 使用联邦平均算法聚合模型更新,无需共享原始数据,从而保持数据本地性和机密性。
  • 设计低全局敏感度函数,以增强系统对数据扰动和模型反演攻击的鲁棒性。
  • 在整个系统生命周期中融入端到端匿名化、可扩展性以及隐私-效用权衡优化等原则。

实验结果

研究问题

  • RQ1如何构建一个理论框架,以支撑可扩展且鲁棒的差分隐私联邦学习系统的构建?
  • RQ2如何在不降低模型准确率或系统性能的前提下,将差分隐私集成到联邦学习中?
  • RQ3哪些设计原则可确保在联邦学习全生命周期(包括客户端加入/移除和模型更新)中实现数据隐私?
  • RQ4在系统扩展、异步训练或客户端参与度变化的情况下,隐私保障如何保持不变?
  • RQ5哪些机制可确保在医学影像应用中隐私得到保护,同时不损害全局模型的效用?

主要发现

  • dPbD框架提供了一套全面、理论基础扎实的方法,从系统设计之初即嵌入差分隐私。
  • 该框架确保从不共享原始患者影像数据,仅传输模型参数或经噪声保护的更新。
  • 通过低全局敏感度函数和稳健的聚合策略,系统保持了可扩展性和鲁棒性。
  • 即使在客户端加入或退出系统,或模型架构发生变化时,隐私保护依然得以维持。
  • 通过受控的噪声注入和优化的系统参数,可实现隐私与效用之间的平衡权衡。
  • 该框架不仅适用于新冠状病毒病影像,还可扩展至联邦学习中其他敏感数据领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。