[论文解读] Text Embeddings Reveal (Almost) As Much As Text
本文提出Vec2Text,一种多步迭代方法,通过反复嵌入和修正,从密集文本嵌入中恢复完整文本。该方法在32个词元的输入中实现了92%的精确恢复,并从临床笔记中提取了89%的完整姓名,表明嵌入泄露了几乎与原始文本相当的私密信息。
How much private information do text embeddings reveal about the original text? We investigate the problem of embedding extit{inversion}, reconstructing the full text represented in dense text embeddings. We frame the problem as controlled generation: generating text that, when reembedded, is close to a fixed point in latent space. We find that although a naïve model conditioned on the embedding performs poorly, a multi-step method that iteratively corrects and re-embeds text is able to recover $92\%$ of $32 ext{-token}$ text inputs exactly. We train our model to decode text embeddings from two state-of-the-art embedding models, and also show that our model can recover important personal information (full names) from a dataset of clinical notes. Our code is available on Github: \href{https://github.com/jxmorris12/vec2text}{github.com/jxmorris12/vec2text}.
研究动机与目标
- 调查密集文本嵌入是否泄露足够信息以重建原始输入文本。
- 解决第三方向量数据库存储嵌入而非原始文本所引发的隐私威胁。
- 开发一种无需访问模型权重即可反转最先进的文本嵌入的实用方法。
- 证明现实世界检索模型的嵌入可被反转以恢复敏感信息(如姓名)。
- 确立嵌入应被视为与原始文本同等敏感,因其存在相当的隐私泄露风险。
提出的方法
- 将嵌入反转问题建模为受控生成问题:生成其嵌入与目标嵌入接近的文本。
- 使用条件语言模型,通过最大似然学习从其嵌入重建输入文本,学习分布 p(x|e;θ)。
- 应用迭代优化:生成假设文本,将其嵌入,计算假设嵌入与目标之间的余弦相似度,并根据差异对文本进行修正。
- 使用束搜索结合校正模块,在多轮迭代中逐步改进假设。
- 利用对嵌入模型的黑盒访问,查询每个假设的嵌入,以指导优化。
- 在两种最先进的编码器生成的嵌入上进行训练,并在未见领域和临床数据上评估泛化能力。
实验结果
研究问题
- RQ1在多大程度上可以从未知的密集嵌入中重建完整的、有序的文本序列?
- RQ2在无梯度或模型权重访问的情况下,能否通过黑盒嵌入模型反转恢复精确的输入文本?
- RQ3与直接生成相比,迭代修正在从嵌入中恢复文本方面的有效性如何?
- RQ4在向量数据库中存储嵌入而非原始文本的隐私风险是什么?
- RQ5能否从临床笔记嵌入中提取出如完整姓名等敏感个人信息?
主要发现
- Vec2Text通过迭代优化和黑盒嵌入查询,实现了92%的32词元文本输入的精确恢复。
- 在32词元输入上,该方法BLEU得分为97.3,表明重建质量近乎完美。
- 该模型在BEIR基准未见领域的文本类型上泛化良好,完美恢复了各类文本输入。
- 在MIMIC的临床笔记嵌入中,89%的完整姓名被成功恢复,凸显医疗数据中的风险。
- 结果表明,文本嵌入泄露的私密信息几乎与原始文本相当,因此需要同等的隐私保护措施。
- 本研究证明,由于存在相当的隐私泄露风险,嵌入应被视为与原始文本同等敏感的个人数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。