Skip to main content
QUICK REVIEW

[论文解读] Auditing Data Provenance in Text-Generation Models

Congzheng Song, Vitaly Shmatikov|arXiv (Cornell University)|Nov 1, 2018
Privacy-Preserving Technologies in Data参考文献 44被引用 16
一句话总结

该论文提出了一种黑箱审计技术,通过利用词预测排名中的细微记忆模式,检测用户的个人文本数据是否被用于训练文本生成模型。该方法在未过拟合的通用化模型上实现了完美的审计性能(AUC = 1),通过向模型查询包含罕见词的序列,即使无法访问模型概率或参数。

ABSTRACT

To help enforce data-protection regulations such as GDPR and detect unauthorized uses of personal data, we develop a new \emph{model auditing} technique that helps users check if their data was used to train a machine learning model. We focus on auditing deep-learning models that generate natural-language text, including word prediction and dialog generation. These models are at the core of popular online services and are often trained on personal data such as users' messages, searches, chats, and comments. We design and evaluate a black-box auditing method that can detect, with very few queries to a model, if a particular user's texts were used to train it (among thousands of other users). We empirically show that our method can successfully audit well-generalized models that are not overfitted to the training data. We also analyze how text-generation models memorize word sequences and explain why this memorization makes them amenable to auditing.

研究动机与目标

  • 使个体用户能够审计其个人文本数据是否被用于已部署的文本生成模型的训练。
  • 解决在无法访问模型参数或置信度分数情况下的审计挑战。
  • 开发一种对高度泛化的模型有效的审计方法,这些模型不会出现过拟合,与以往的成员推断技术不同。
  • 研究文本生成模型如何无意中记忆训练数据,并利用此特性进行审计。
  • 评估方法在输入噪声和用户输入实际是否被用于训练的不确定性下的鲁棒性。

提出的方法

  • 该方法采用基于查询的黑箱方法,审计者向模型提交输入序列,并仅观察生成的输出标记。
  • 重点关注包含相对罕见词的序列,这些序列在检测记忆效应方面比随机选择的序列更有效。
  • 审计者计算目标词在模型输出分布中的预测排名,利用记忆导致的排名偏移。
  • 当训练数据分布未知时,利用辅助公开数据集对审计过程进行校准。
  • 采用跨领域训练,当目标模型的训练数据分布不完全已知时,提升检测性能。
  • 该方法对噪声和测试输入的微小变化具有鲁棒性,反映了现实世界中对用户输入是否被用于训练的不确定性。

实验结果

研究问题

  • RQ1在无法访问模型参数或置信度分数的情况下,黑箱审计方法能否检测用户个人文本是否被用于训练文本生成模型?
  • RQ2文本生成模型中的记忆现象——特别是词排名中的记忆——如何使对高度泛化模型的审计成为可能?
  • RQ3哪些类型的输入序列(如罕见词、特定上下文)在检测数据来源方面最为有效?
  • RQ4该审计方法对测试输入中的噪声和不确定性有多大的鲁棒性?
  • RQ5当训练数据分布未知时,辅助数据集能否提升审计性能?

主要发现

  • 所提出的审计方法在基于数百名用户数据训练的词预测、翻译和对话生成模型上实现了完美性能(AUC = 1)。
  • 包含相对罕见词的序列在审计中的有效性显著高于从用户数据中随机选择的序列。
  • 该方法对噪声和输入的微小变化具有鲁棒性,使其在实际应用中更具可行性,尤其是在无法精确匹配输入的情况下。
  • 文本生成模型的记忆效应并非体现为测试准确率下降,而是表现为词排名的偏移,尤其在熟悉上下文中更倾向于选择罕见词。
  • 即使经过差分隐私保护的模型在词预测中仍表现出可检测的模式,尽管它们生成罕见词的可能性较低,表明记忆效应有限。
  • 本研究证明,文本生成模型中的无意记忆可被用于审计数据来源,支持符合GDPR等法规的要求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。