Skip to main content
QUICK REVIEW

[论文解读] Anonymizing Data for Privacy-Preserving Federated Learning

Olivia Choudhury, Aris Gkoulalas-Divanis|arXiv (Cornell University)|Feb 21, 2020
Privacy-Preserving Technologies in Data参考文献 39被引用 9
一句话总结

本文提出了一种新颖的联邦学习语法匿名化方法,在最大化模型效用的同时增强隐私保护,相较于差分隐私在医疗数据集上的F1得分表现更优。与基于噪声的方法不同,该方法采用k-匿名化技术对分布式各站点的准标识符进行泛化,确保符合GDPR/HIPAA规范,并提供可解释的隐私保障。

ABSTRACT

Federated learning enables training a global machine learning model from data distributed across multiple sites, without having to move the data. This is particularly relevant in healthcare applications, where data is rife with personal, highly-sensitive information, and data analysis methods must provably comply with regulatory guidelines. Although federated learning prevents sharing raw data, it is still possible to launch privacy attacks on the model parameters that are exposed during the training process, or on the generated machine learning model. In this paper, we propose the first syntactic approach for offering privacy in the context of federated learning. Unlike the state-of-the-art differential privacy-based frameworks, our approach aims to maximize utility or model performance, while supporting a defensible level of privacy, as demanded by GDPR and HIPAA. We perform a comprehensive empirical evaluation on two important problems in the healthcare domain, using real-world electronic health data of 1 million patients. The results demonstrate the effectiveness of our approach in achieving high model performance, while offering the desired level of privacy. Through comparative studies, we also show that, for varying datasets, experimental setups, and privacy budgets, our approach offers higher model performance than differential privacy-based techniques in federated learning.

研究动机与目标

  • 解决联邦学习中差分隐私的局限性,后者常因过度添加噪声而降低模型效用。
  • 开发一种隐私保护联邦学习框架,支持可证明且可解释的隐私保障,与GDPR和HIPAA保持一致。
  • 在不共享原始记录的前提下,实现对去中心化医疗数据的高性能机器学习。
  • 设计一种分布式匿名化流程,保留数据效用的同时确保跨多个站点的k-匿名性。
  • 通过实证验证,在相同隐私预算下,语法匿名化在模型性能上优于差分隐私。

提出的方法

  • 该方法在分布式各站点对准标识符应用k-匿名化,将其泛化为等价类以保护个体身份。
  • 引入一种分布式流程,基于其效用和隐私影响,在每个站点识别并匿名化具有区分性的特征。
  • 提取并共享语法映射(定义属性如何被泛化)至中央服务器,以保持一致性。
  • 在推理阶段,使用训练数据中最相似的匿名化映射转换测试实例,以确保兼容性。
  • 该方法遵循“先匿名化后挖掘”的范式,适用于关系型和事务型数据组件。
  • k值范围为3至50,k值越高表示隐私保护越强,依据北美及加拿大既定的去标识化实践。

实验结果

研究问题

  • RQ1语法匿名化方法在联邦学习中能否提供比差分隐私更强且可解释的隐私保障?
  • RQ2在真实世界医疗数据集上,语法匿名化方法在模型效用方面与差分隐私相比表现如何?
  • RQ3在分布式联邦学习环境中,k-匿名化参数的变化对模型准确率和隐私保护有何影响?
  • RQ4能否在不损害数据效用或隐私的前提下,有效协调多个站点之间的分布式匿名化?
  • RQ5所提出的方法在保持高性能模型的同时,能在多大程度上支持GDPR和HIPAA合规?

主要发现

  • 所提出的语法匿名化方法在所有测试数据集和分类算法中均实现了比差分隐私更高的F1得分。
  • 在相同隐私水平(以k和ε衡量)下,语法方法在模型效用方面始终优于ε-差分隐私,尤其在小规模站点环境(<1000个站点)中表现更优。
  • 当k=20时,该方法在确保符合HIPAA和GDPR合规的可辩护去标识化水平的同时,维持了高水平的模型性能。
  • 该方法使联邦学习模型在不共享原始数据的情况下,实现了与集中式学习相当的性能。
  • 即使在较高的k值(最高达50)下,该方法仍保持了显著的数据效用,展现出良好的可扩展性和鲁棒性。
  • 结果表明,语法匿名化为联邦学习中差分隐私提供了一种切实可行的替代方案,尤其在对效用和合规性要求极高的医疗领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。