Skip to main content
QUICK REVIEW

[论文解读] Sharing Models or Coresets: A Study based on Membership Inference Attack

Hanlin Lu, Changchang Liu|arXiv (Cornell University)|Jul 6, 2020
Privacy-Preserving Technologies in Data参考文献 17被引用 9
一句话总结

本文通过成员推理攻击(MIA)比较了联邦学习与基于核心集的学习在模型准确率、通信成本和隐私泄露方面的表现。该研究首次针对基于核心集的学习提出了MIA攻击方法,发现当追求全精度时,联邦学习在隐私保护方面表现更优;而当可接受适度精度损失时,核心集共享可在显著降低通信成本的同时减少隐私泄露,且保持相近的模型准确率。

ABSTRACT

Distributed machine learning generally aims at training a global model based on distributed data without collecting all the data to a centralized location, where two different approaches have been proposed: collecting and aggregating local models (federated learning) and collecting and training over representative data summaries (coreset). While each approach preserves data privacy to some extent thanks to not sharing the raw data, the exact extent of protection is unclear under sophisticated attacks that try to infer the raw data from the shared information. We present the first comparison between the two approaches in terms of target model accuracy, communication cost, and data privacy, where the last is measured by the accuracy of a state-of-the-art attack strategy called the membership inference attack. Our experiments quantify the accuracy-privacy-cost tradeoff of each approach, and reveal a nontrivial comparison that can be used to guide the design of model training processes.

研究动机与目标

  • 系统比较联邦学习与基于核心集的学习在模型准确率、通信成本和数据隐私方面的表现。
  • 利用成员推理攻击(MIA)这一前沿攻击方法,评估基于核心集学习的隐私泄露程度。
  • 量化分布式机器学习中准确率、通信成本与隐私泄露之间的权衡关系。
  • 通过识别在不同准确率与隐私约束下各方法的适用场景,为分布式学习的设计选择提供建议。

提出的方法

  • 提出一种专为基于核心集学习设计的新颖成员推理攻击(MIA),以训练轮次中的模型输出和梯度作为输入特征。
  • 采用基于影子模型的MIA框架,在联邦学习与核心集训练过程的中间模型状态上训练攻击模型。
  • 使用真实世界数据集(Locations 和 Purchase100)在受控环境下评估模型性能、通信成本与MIA准确率。
  • 对于联邦学习,分别训练100轮(全精度)与30轮(部分精度);对于核心集,构建不同大小的核心集以匹配目标模型准确率。
  • 通过MIA攻击准确率衡量隐私泄露——数值越高,表示成员推理风险越大。
  • 在两种数据聚合架构(分层与拼接)下比较两种方法,以评估结构设计对隐私的影响。

实验结果

研究问题

  • RQ1在相同目标模型准确率下,基于核心集学习的隐私泄露程度与联邦学习相比如何?
  • RQ2联邦学习与基于核心集的学习在通信成本、模型准确率与隐私泄露之间存在怎样的权衡关系?
  • RQ3当模型准确率相近时,共享核心集是否比共享模型更新在联邦学习中提供更好的隐私保护?
  • RQ4在何种准确率要求下,基于核心集的学习在隐私与通信成本方面优于联邦学习?
  • RQ5不同的数据聚合架构如何影响对基于核心集学习与联邦学习系统实施成员推理攻击的有效性?

主要发现

  • 在全精度场景(83.4%)下,尽管通信成本更高,联邦学习提供的隐私保护更优(MIA准确率:72.0%),而基于核心集的学习隐私泄露严重(MIA准确率:100%)。
  • 当准确率降低至约79.8%时,基于核心集的学习在保持相近模型性能的同时,通信成本显著降低(9.0M vs. 526.9M),且隐私泄露更低(MIA准确率:51.0% vs. 59.8%)。
  • 采用15,000个样本的核心集方法达到78.4%的测试准确率与51%的MIA准确率,在隐私与成本方面优于联邦学习在30轮训练下的表现。
  • 在分层架构下,当目标模型准确率达到约79%时,基于核心集的学习将MIA准确率降低至51%,表明其具备有效的隐私泄露缓解能力。
  • 在拼接架构下,基于核心集学习的攻击模型达到50%的MIA准确率,表明架构设计会影响攻击成功率,但其通信效率仍优于联邦学习。
  • 结果证实,联邦学习中的梯度会暴露成员信息,而核心集不会,这解释了为何尽管联邦学习具有隐私保护设计意图,却仍更易受MIA攻击。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。