[论文解读] Differentially Private Representation for NLP: Formal Guarantee and An Empirical Study on Privacy and Fairness
本文提出了一种新型方法——差分私有神经表征(DPNR),在推理阶段对神经文本表征应用局部差分隐私(LDP),以正式保证隐私。通过结合差分隐私噪声与稳健的训练过程,以及基于Dropout的掩码机制,DPNR在保持主任务高准确率的同时,显著降低了隐私泄露风险,并提升了不同人口统计群体间的公平性,相关实验基于基准NLP数据集展开。
It has been demonstrated that hidden representation learned by a deep model can encode private information of the input, hence can be exploited to recover such information with reasonable accuracy. To address this issue, we propose a novel approach called Differentially Private Neural Representation (DPNR) to preserve the privacy of the extracted representation from text. DPNR utilises Differential Privacy (DP) to provide a formal privacy guarantee. Further, we show that masking words via dropout can further enhance privacy. To maintain utility of the learned representation, we integrate DP-noisy representation into a robust training process to derive a robust target model, which also helps for model fairness over various demographic variables. Experimental results on benchmark datasets under various parameter settings demonstrate that DPNR largely reduces privacy leakage without significantly sacrificing the main task performance.
研究动机与目标
- 通过差分隐私正式量化并保证神经文本表征的隐私,以应对从隐藏表征中重新识别敏感属性的风险。
- 开发一种方法,为推理过程中提取的表征提供正式的隐私保障,而不仅限于训练数据。
- 通过隐私机制的副效应,减少不同人口统计群体(如性别、年龄)之间的偏差,从而提升模型公平性。
- 在引入隐私保护噪声的前提下,仍保持主任务(如情感分类)的高效用。
- 通过实证研究探究差分隐私与NLP表征中模型公平性之间的相互作用。
提出的方法
- 在推理阶段对文本的隐藏表征应用局部差分隐私(LDP),以确保测试阶段数据的正式隐私保障。
- 引入一种稳健的训练流程,将带有DP噪声的表征融入目标模型的训练过程,以保持模型效用。
- 采用基于Dropout的词掩码技术作为补充手段,通过减少对敏感语言线索的记忆,进一步增强隐私保护。
- 使用经过仔细校准的隐私预算(ε)的噪声注入机制,以控制隐私与效用之间的权衡。
- 采用两阶段训练流程:首先通过DP生成噪声表征;其次使用这些噪声表征对目标模型进行微调,以维持性能。
- 利用t-SNE可视化与子组准确率分析,评估隐私与公平性的改进效果。
实验结果
研究问题
- RQ1能否在推理阶段正式将差分隐私应用于神经文本表征,以防止从表征中重新识别出敏感属性?
- RQ2与非私有或对抗性基线相比,DP噪声与Dropout掩码的结合是否能有效降低NLP表征中的隐私泄露?
- RQ3所提出的DPNR方法在保持主NLP任务性能的同时,能在多大程度上提升不同人口统计子群体间的公平性?
- RQ4DP与稳健训练的结合如何在引入噪声的情况下仍能保持模型效用?
- RQ5差分隐私与神经NLP表征中模型公平性之间存在何种关系?
主要发现
- DPNR显著降低了隐私泄露:在TP-USA数据集上,攻击者从表征中预测性别的准确率从非私有情况下的98.07%降至98.00%(DPNR);在博客数据集上,从97.05%降至97.09%,表明具有强大的隐私保护能力。
- 在AG数据集上,DPNR改善了少数群体实体的公平性,缩小了多数与少数子群体之间的性能差距(例如,实体A的偏差从-18.82%降至-16.93%),并实现了统计上显著的公平性提升(p < 0.0001)。
- DPNR保持了高主任务准确率:在TP-USA上,模型准确率达到85.90%(非私有基线为85.41%);在博客数据集上达到86.08%(非私有基线为85.38%),性能下降可忽略不计。
- t-SNE可视化结果表明,DPNR表征混合了不同子群体(如20岁以下与30岁以上人群),降低了可区分性,支持了其隐私主张。
- 该方法减少了模型歧视:在大多数情况下,DPNR相较于非私有和对抗性基线,均表现出更低的各人口统计群体间的公平性偏差。
- 理论分析证明,DP噪声与Dropout掩码的结合所提供的隐私保障强于单独使用任一技术,形成了更强的隐私保护机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。