Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Differential Privacy and Federated Learning for BERT Models

Priyam Basu, Tiasa Singha Roy|arXiv (Cornell University)|Jun 26, 2021
Privacy-Preserving Technologies in Data参考文献 37被引用 6
一句话总结

本论文针对基于 BERT 的模型在心理健康 NLP 应用中,对差分隐私(DP)和联邦学习(FL)进行了基准测试,评估了在抑郁和性骚扰 Twitter 数据集上,BERT、RoBERTa、ALBERT 和 DistilBERT 模型在不同隐私-效用权衡下的表现。结果表明,ALBERT 等小型模型在 DP 下性能下降更平缓,而具有非独立同分布(non-IID)数据的联邦学习导致效用损失更高,DP-FL 结合了隐私保护优势与可量化的性能权衡,具体表现取决于模型大小和数据分布。

ABSTRACT

Natural Language Processing (NLP) techniques can be applied to help with the diagnosis of medical conditions such as depression, using a collection of a person's utterances. Depression is a serious medical illness that can have adverse effects on how one feels, thinks, and acts, which can lead to emotional and physical problems. Due to the sensitive nature of such data, privacy measures need to be taken for handling and training models with such data. In this work, we study the effects that the application of Differential Privacy (DP) has, in both a centralized and a Federated Learning (FL) setup, on training contextualized language models (BERT, ALBERT, RoBERTa and DistilBERT). We offer insights on how to privately train NLP models and what architectures and setups provide more desirable privacy utility trade-offs. We envisage this work to be used in future healthcare and mental health studies to keep medical history private. Therefore, we provide an open-source implementation of this work.

研究动机与目标

  • 评估差分隐私(DP)和联邦学习(FL)对基于 BERT 的模型在心理健康应用中效用的影响。
  • 在集中式训练与联邦训练中应用 DP 的情况下,比较不同模型架构(BERT、RoBERTa、ALBERT、DistilBERT)的隐私-效用权衡。
  • 分析数据分布(IID 与非 IID)在联邦学习设置中应用 DP 时对模型性能的影响。
  • 为设计医疗领域中保护隐私的 NLP 系统提供实证洞察,尤其针对敏感的心理健康数据。
  • 发布一个开源框架,以支持 NLP 中 DP 与 FL 的可复现基准测试。

提出的方法

  • 本研究使用 Opacus 实现差分隐私,在训练过程中通过注入噪声对四种基于 BERT 的架构进行处理。
  • 在两个 Twitter 数据集(抑郁与性骚扰)上,评估了不同隐私预算(ε = 0.5, 5, 15, ∞)下的集中式训练与 DP。
  • 联邦学习采用 FedAvg 算法,共 10 个客户端,每个客户端持有数据的一个子集,且在每轮训练中在客户端本地应用 DP。
  • 评估了两种联邦学习数据分布场景:IID(数据均匀分布)与非 IID(非均匀、更贴近现实的分布),每个客户端包含 240 个样本。
  • 通过在保留的测试集上的测试准确率衡量模型性能,结果基于三个随机种子的平均值报告,并附带标准差。
  • 发布一个开源框架,以支持 DP 与 FL 在 NLP 领域中的可复现性与未来基准测试。

实验结果

研究问题

  • RQ1差分隐私对集中式训练中基于 BERT 的模型在心理健康文本分类任务中的效用有何影响?
  • RQ2在 DP 条件下,不同模型架构(如 BERT 与 ALBERT)在隐私-效用权衡方面如何比较?
  • RQ3在联邦学习中,数据分布(IID 与非 IID)对模型效用的影响如何,无论是否应用 DP?
  • RQ4将 DP 与联邦学习结合(DP-FL)相较于单独使用 DP 或 FL,对模型性能有何影响?
  • RQ5在医疗应用中,NLP 模型的最优隐私预算(ε)是多少,能够实现效用与隐私的平衡?

主要发现

  • 在差分隐私下,ALBERT 和 DistilBERT 等小型模型的性能下降更平缓,相比 BERT 和 RoBERTa 等大模型,展现出更优的隐私-效用权衡。
  • 在非 IID 的联邦学习设置中(反映现实中的医疗数据分布),效用损失平均高于 IID 设置,表明需要定制化训练算法。
  • 在抑郁数据集上,RoBERTa 在无 DP 条件下的基线准确率最高(83.56 ± 0.00),而 ALBERT 在应用 DP 后性能下降最小。
  • 在 DP-FL 设置中,非 IID 联邦学习场景下 BERT 达到最高测试准确率(72.44 ± 1.74),但仍低于非私有的联邦学习基线(76.28 ± 0.11)。
  • 随着 ε 从 0.5 增加到 15,测试准确率的标准差减小,表明性能更稳定,更接近非私有基线。
  • 在训练数据有限的情况下,DP 对模型效用的负面影响更加显著,尤其在低数据环境下,验证了先前关于 DP 噪声对数据敏感性的发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。