Skip to main content
QUICK REVIEW

[论文解读] Generalised Differential Privacy for Text Document Processing

Natasha Fernandes, Mark Dras|arXiv (Cornell University)|Nov 26, 2018
Authorship Attribution and Profiling参考文献 4被引用 4
一句话总结

本文提出了一种用于文本文档混淆的广义差分隐私机制,可在保留语义内容的同时隐藏作者身份。通过使用地球移动距离(Earth Mover’s distance)作为相似性度量,对词袋表示应用拉普拉斯噪声,实现了可证明的隐私保障,并在主题分类任务中表现出较强的实用性,实验基于同人小说数据集进行验证。

ABSTRACT

We address the problem of how to "obfuscate" texts by removing stylistic clues which can identify authorship, whilst preserving (as much as possible) the content of the text. In this paper we combine ideas from "generalised differential privacy" and machine learning techniques for text processing to model privacy for text documents. We define a privacy mechanism that operates at the level of text documents represented as "bags-of-words" - these representations are typical in machine learning and contain sufficient information to carry out many kinds of classification tasks including topic identification and authorship attribution (of the original documents). We show that our mechanism satisfies privacy with respect to a metric for semantic similarity, thereby providing a balance between utility, defined by the semantic content of texts, with the obfuscation of stylistic clues. We demonstrate our implementation on a "fan fiction" dataset, confirming that it is indeed possible to disguise writing style effectively whilst preserving enough information and variation for accurate content classification tasks.

研究动机与目标

  • 解决在保留内容实用性的同时对文本文档进行作者混淆的挑战。
  • 通过广义差分隐私,为防止作者身份推断提供形式化隐私保障。
  • 在语义实用性(主题分类准确率)与风格混淆(作者匿名性)之间实现平衡。
  • 通过地球移动距离度量,将 $d_{\mathcal{X}}$-隐私扩展至非结构化文本数据。
  • 在真实世界文本数据(如同人小说)上展示该机制的可行性和有效性。

提出的方法

  • 该方法将文档建模为词袋表示,保留词频但丢弃词序。
  • 基于拉普拉斯概率密度函数的噪声机制被用于扰动词频。
  • 通过地球移动距离(EMD)作为文档间语义相似性度量,校准噪声尺度。
  • 该机制确保具有相似主题的文档(在 EMD 下)产生相似的噪声输出,无论其原始作者如何。
  • 通过 $E_{d_{\mathcal{X}}}$-隐私形式化隐私,这是一种基于地球移动距离作为底层距离的差分隐私扩展。
  • 该方法在词袋的实值向量表示上实现,并被证明满足隐私和实用性属性。

实验结果

研究问题

  • RQ1能否设计一种隐私机制,在有效隐藏文本文档作者身份的同时保留主题分类的实用性?
  • RQ2如何将广义差分隐私适配于使用语义相似性度量的非结构化文本数据?
  • RQ3使用地球移动距离作为度量在多大程度上能确保文本混淆中的隐私与实用性?
  • RQ4所提出的机制能否提供与结构化数据库中差分隐私相当的形式化、先验隐私保障?
  • RQ5在实践中,隐私(由 $\epsilon$ 控制)与实用性(主题分类准确率)之间的权衡如何体现?

主要发现

  • 所提出的机制在混淆后仍能有效保留主题分类准确率,证明了其强大的实用性保持能力。
  • 应用混淆机制后,作者身份推断的准确率显著下降,证实了风格的有效隐藏。
  • 该机制在地球移动距离基础上满足 $E_{d_{\mathcal{X}}}$-隐私,提供了形式化的隐私保障。
  • 通过 EMD 度量缩放的拉普拉斯噪声确保了相似主题的文档产生相似的噪声输出,无论其原始作者如何。
  • 在同人小说数据集上的实验评估表明,该方法在隐私与实用性之间实现了良好平衡,且可由隐私参数 $\epsilon$ 控制的可度量权衡。
  • 结果表明,从混淆后的词袋输出中重构出可读文本是可行的,为生成人类可读的私密文档开辟了道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。