Skip to main content
QUICK REVIEW

[论文解读] Text Embeddings Reveal (Almost) As Much As Text

John X. Morris, Volodymyr Kuleshov|arXiv (Cornell University)|Oct 10, 2023
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文提出Vec2Text,一种多步迭代方法,通过反复嵌入和修正,从密集文本嵌入中恢复完整文本。该方法在32个词元的输入中实现了92%的精确恢复,并从临床笔记中提取了89%的完整姓名,表明嵌入泄露了几乎与原始文本相当的私密信息。

ABSTRACT

How much private information do text embeddings reveal about the original text? We investigate the problem of embedding extit{inversion}, reconstructing the full text represented in dense text embeddings. We frame the problem as controlled generation: generating text that, when reembedded, is close to a fixed point in latent space. We find that although a naïve model conditioned on the embedding performs poorly, a multi-step method that iteratively corrects and re-embeds text is able to recover $92\%$ of $32 ext{-token}$ text inputs exactly. We train our model to decode text embeddings from two state-of-the-art embedding models, and also show that our model can recover important personal information (full names) from a dataset of clinical notes. Our code is available on Github: \href{https://github.com/jxmorris12/vec2text}{github.com/jxmorris12/vec2text}.

研究动机与目标

  • 调查密集文本嵌入是否泄露足够信息以重建原始输入文本。
  • 解决第三方向量数据库存储嵌入而非原始文本所引发的隐私威胁。
  • 开发一种无需访问模型权重即可反转最先进的文本嵌入的实用方法。
  • 证明现实世界检索模型的嵌入可被反转以恢复敏感信息(如姓名)。
  • 确立嵌入应被视为与原始文本同等敏感,因其存在相当的隐私泄露风险。

提出的方法

  • 将嵌入反转问题建模为受控生成问题:生成其嵌入与目标嵌入接近的文本。
  • 使用条件语言模型,通过最大似然学习从其嵌入重建输入文本,学习分布 p(x|e;θ)。
  • 应用迭代优化:生成假设文本,将其嵌入,计算假设嵌入与目标之间的余弦相似度,并根据差异对文本进行修正。
  • 使用束搜索结合校正模块,在多轮迭代中逐步改进假设。
  • 利用对嵌入模型的黑盒访问,查询每个假设的嵌入,以指导优化。
  • 在两种最先进的编码器生成的嵌入上进行训练,并在未见领域和临床数据上评估泛化能力。

实验结果

研究问题

  • RQ1在多大程度上可以从未知的密集嵌入中重建完整的、有序的文本序列?
  • RQ2在无梯度或模型权重访问的情况下,能否通过黑盒嵌入模型反转恢复精确的输入文本?
  • RQ3与直接生成相比,迭代修正在从嵌入中恢复文本方面的有效性如何?
  • RQ4在向量数据库中存储嵌入而非原始文本的隐私风险是什么?
  • RQ5能否从临床笔记嵌入中提取出如完整姓名等敏感个人信息?

主要发现

  • Vec2Text通过迭代优化和黑盒嵌入查询,实现了92%的32词元文本输入的精确恢复。
  • 在32词元输入上,该方法BLEU得分为97.3,表明重建质量近乎完美。
  • 该模型在BEIR基准未见领域的文本类型上泛化良好,完美恢复了各类文本输入。
  • 在MIMIC的临床笔记嵌入中,89%的完整姓名被成功恢复,凸显医疗数据中的风险。
  • 结果表明,文本嵌入泄露的私密信息几乎与原始文本相当,因此需要同等的隐私保护措施。
  • 本研究证明,由于存在相当的隐私泄露风险,嵌入应被视为与原始文本同等敏感的个人数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。