Skip to main content
QUICK REVIEW

[论文解读] Privacy-Preserving Graph Convolutional Networks for Text Classification

Timour Igamberdiev, Ivan Habernal|TUbilio (Technical University of Darmstadt)|Feb 10, 2021
Privacy-Preserving Technologies in Data参考文献 37被引用 5
一句话总结

本文提出了一种用于文本分类的图卷积网络(GCNs)的隐私保护框架,通过适配差分隐私随机梯度下降(SGD-DP)并引入一种新型差分隐私Adam优化器(Adam-DP),实现了隐私与效用之间的良好平衡。该方法采用随机图分割技术,提升了隐私-效用权衡,在多个英文和斯洛伐克语NLP数据集上,以ε=1.0的强隐私保障,实现了高达非私有F₁分数90%的性能表现。

ABSTRACT

Graph convolutional networks (GCNs) are a powerful architecture for representation learning on documents that naturally occur as graphs, e.g., citation or social networks. However, sensitive personal information, such as documents with people's profiles or relationships as edges, are prone to privacy leaks, as the trained model might reveal the original input. Although differential privacy (DP) offers a well-founded privacy-preserving framework, GCNs pose theoretical and practical challenges due to their training specifics. We address these challenges by adapting differentially-private gradient-based training to GCNs and conduct experiments using two optimizers on five NLP datasets in two languages. We propose a simple yet efficient method based on random graph splits that not only improves the baseline privacy bounds by a factor of 2.7 while retaining competitive F1 scores, but also provides strong privacy guarantees of epsilon = 1.0. We show that, under certain modeling choices, privacy-preserving GCNs perform up to 90% of their non-private variants, while formally guaranteeing strong privacy measures.

研究动机与目标

  • 为解决图卷积网络(GCNs)在文本分类中可能存在的隐私泄露问题,其中节点文本和图结构本身可能暴露敏感信息。
  • 将差分隐私(DP)优化方法——特别是SGD-DP和Adam-DP——适配至GCNs,因非独立同分布(non-i.i.d.)数据和图结构依赖性,此类方法在GCNs中尚未得到系统性研究。
  • 探究图划分与高级输入表示是否可缓解DP噪声在GCNs中通常导致的性能下降。
  • 在两种语言的多样化NLP数据集上,实证评估隐私-效用权衡,证明在不牺牲模型效用的前提下,可实现强隐私保障。

提出的方法

  • 提出一种随机图分割策略,将原始图划分为子图,以降低DP训练过程中的敏感度,避免对原始数据的额外查询。
  • 通过修改梯度裁剪和噪声注入过程,将差分隐私随机梯度下降(SGD-DP)适配至GCNs,以应对基于图的数据依赖性。
  • 提出Adam-DP,即Adam优化器的差分隐私变体,以加快收敛速度并减少训练轮次,从而提升隐私-效用权衡。
  • 采用从简单BoW和fastText到先进BERT嵌入的多种输入表示,以评估其对DP性能的影响。
  • 采用固定隐私预算(ε=1.0)的差分隐私训练,并在多个数据集和优化器上评估F₁分数。
  • 在五个NLP数据集——Cora、Citeseer、PubMed、Reddit和Pokec——上采用标准化评估协议,涵盖引用网络、社交媒体和用户兴趣分类任务。

实验结果

研究问题

  • RQ1尽管存在非独立同分布(non-i.i.d.)数据结构和图依赖性,差分隐私训练是否仍可有效应用于图卷积网络(GCNs)?
  • RQ2与标准DP训练相比,图分割是否能改善GCNs中的隐私-效用权衡?
  • RQ3在DP约束下,不同优化器(SGD-DP与Adam-DP)对GCNs中模型性能有何影响?
  • RQ4复杂输入表示(如BERT)在多大程度上可减少DP噪声在GCNs中引起的性能下降?
  • RQ5在GCNs用于文本分类时,是否可在保持强隐私保障(ε=1.0)的同时实现高模型效用?

主要发现

  • 所提出的图分割方法在所有数据集上均将基线隐私界限提升了2.7倍,同时保持了具有竞争力的F₁分数。
  • 结合图分割与BERT嵌入,模型在ε=1.0下实现了高达非私有F₁分数90%的性能,证明了优异的效用保持能力。
  • Adam-DP在隐私-效用权衡方面优于SGD-DP,尤其在结合复杂输入特征时,因其收敛更快、训练轮次更少。
  • 更复杂的输入表示(如BERT)在DP下导致的性能下降更小,BERT模型在DP下的性能下降最小(例如,Adam-DP在ε=2.0时F₁下降仅0.84)。
  • BoW表示在DP下性能下降最大(例如,SGD-DP在ε=2.0时F₁下降至0.62),证实简单特征对DP噪声更敏感。
  • 该方法在所有数据集上均实现了强隐私保障(ε=1.0),包括社交网络和用户兴趣画像等固有敏感数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。