Skip to main content
QUICK REVIEW

[论文解读] DP-Rewrite: Towards Reproducibility and Transparency in Differentially Private Text Rewriting

Timour Igamberdiev, Thomas Arnold|arXiv (Cornell University)|Aug 22, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

DP-Rewrite 是一个开源、模块化的框架,用于可复现且透明的差分隐私文本重写,支持对隐私-效用权衡的严格评估。它检测到 ADePT 预训练阶段存在隐私泄露,表明即使修复了理论上的差分隐私缺陷,训练数据的记忆化仍会损害效用和隐私。

ABSTRACT

Text rewriting with differential privacy (DP) provides concrete theoretical guarantees for protecting the privacy of individuals in textual documents. In practice, existing systems may lack the means to validate their privacy-preserving claims, leading to problems of transparency and reproducibility. We introduce DP-Rewrite, an open-source framework for differentially private text rewriting which aims to solve these problems by being modular, extensible, and highly customizable. Our system incorporates a variety of downstream datasets, models, pre-training procedures, and evaluation metrics to provide a flexible way to lead and validate private text rewriting research. To demonstrate our software in practice, we provide a set of experiments as a case study on the ADePT DP text rewriting system, detecting a privacy leak in its pre-training approach. Our system is publicly available, and we hope that it will help the community to make DP text rewriting research more accessible and transparent.

研究动机与目标

  • 为解决当前差分隐私(DP)文本重写系统中普遍存在的透明度和可复现性不足问题,这些系统通常缺乏公开代码或验证机制。
  • 开发一个模块化、可扩展且可定制的开源框架,用于 DP 文本重写实验。
  • 检测并展示现有 DP 文本重写系统中的隐私泄露,特别是预训练过程中的问题。
  • 通过标准化评估流程,实现对 DP NLP 中隐私声明的实证验证,提升问责性。

提出的方法

  • DP-Rewrite 实现了 ADePT 的正确重实现作为基线,确保通过拉普拉斯噪声正确应用局部差分隐私。
  • 支持在多个数据集(如 ATIS、Snips)上进行预训练,使用自动编码器并通过裁剪和噪声注入实现 $ε$-DP 保证。
  • 该框架支持下游文本重写,可调节隐私预算 $varepsilon$,实现对 $varepsilon \in \{\infty, 1000, 100, 10, 1\}$ 的系统性评估。
  • 集成多种评估指标,包括宏平均 F1 分数,用于评估下游 NLU 任务中重写文本的效用。
  • 使用 $ell_1$-范数裁剪,确保在预训练和重写过程中具备理论隐私保证。
  • 系统支持受控实验,比较在相同数据集与不同数据集上进行预训练和重写的效果,以检测记忆化和隐私泄露。

实验结果

研究问题

  • RQ1模块化、开源的框架能否提升差分隐私文本重写研究中的透明度和可复现性?
  • RQ2ADePT 的预训练过程是否即使在修复其理论 DP 缺陷后,仍会导致训练数据的记忆化?
  • RQ3预训练数据集的选择如何影响下游重写文本的效用和隐私?
  • RQ4隐私预算 $varepsilon$ 的变化对 DP 文本重写系统中重写文本效用的影响如何?
  • RQ5现有 DP 文本重写系统中隐私保护声明在实证验证下在多大程度上成立?

主要发现

  • 使用在相同数据集上预训练的模型进行重写,F1 分数显著更高(例如,$varepsilon=1000$ 时达 0.94),而使用在不同数据集上预训练的模型则表现较差(例如,用 ATIS 预训练模型重写 Snips 数据时,F1 分数仅为 0.20)。
  • 即使在 $varepsilon=\infty$(无噪声)时,模型在数据集上预训练后仍会记忆其训练样本,导致重写输出与训练数据高度相似,而非与输入文本相似。
  • 在低隐私预算($varepsilon=10$ 和 $1$)下,由于潜在表示中噪声过多,所有配置的效用均急剧下降。
  • 使用 Snips 预训练模型重写 Snips 数据时,下游性能与原始 Snips 数据相当($varepsilon=\infty$ 时,F_1=0.94 vs. 0.95),表明当预训练和重写数据集一致时,效用很高。
  • 当使用 ATIS 预训练模型重写 ATIS 数据时,性能较低(F_1=0.73),低于原始 ATIS 数据(F_1=0.87),可能由于数据集较小,限制了有效预训练。
  • 该框架成功检测到 ADePT 的预训练策略存在信息泄露,因为即使修正了理论 DP 缺陷,重写输出仍强烈类似于预训练数据,而非输入文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。