Skip to main content
QUICK REVIEW

[论文解读] Language Model Inversion

John X. Morris, Wenting Zhao|arXiv (Cornell University)|Nov 22, 2023
Topic Modeling被引用 4
一句话总结

本文提出了一种新颖的语言模型反演方法,通过从下一个标记的概率分布中恢复隐藏提示,利用微调的编码器-解码器模型重建输入文本。在 Llama-2 7B 上,该方法在 BLEU 得分为 59、标记级别 F1 达 78% 的情况下,即使在访问受限的场景(如仅文本输出或 top-K 概率)下,也能实现 27% 的提示完全恢复。

ABSTRACT

Language models produce a distribution over the next token; can we use this information to recover the prompt tokens? We consider the problem of language model inversion and show that next-token probabilities contain a surprising amount of information about the preceding text. Often we can recover the text in cases where it is hidden from the user, motivating a method for recovering unknown prompts given only the model's current distribution output. We consider a variety of model access scenarios, and show how even without predictions for every token in the vocabulary we can recover the probability vector through search. On Llama-2 7b, our inversion method reconstructs prompts with a BLEU of $59$ and token-level F1 of $78$ and recovers $27\%$ of prompts exactly. Code for reproducing all experiments is available at http://github.com/jxmorris12/vec2text.

研究动机与目标

  • 探究语言模型的下一个标记概率分布是否泄露了足够信息以重建原始输入提示。
  • 开发一种方法,在仅部分或间接访问概率的情况下,反演语言模型输出以恢复隐藏提示。
  • 评估在不同访问模式(包括完整概率向量、top-K 输出和离散文本生成)下提示恢复的鲁棒性。
  • 评估反演模型在同一系列语言模型架构之间的可迁移性。
  • 衡量在提示反演过程中,私人信息(如姓名、日期、国籍)的保留或泄露程度。

提出的方法

  • 提出两阶段反演框架:首先将下一个标记概率向量表示为稠密嵌入;其次使用微调的编码器-解码器 Transformer 将该嵌入解码为自然语言提示。
  • 使用重建损失在合成提示-概率对上训练反演模型,以最小化原始提示与重建提示之间的差异。
  • 通过模拟完整概率访问、top-K 概率检索和离散文本生成等场景,实现不同访问约束下的反演。
  • 当仅获得部分输出时,利用基于迭代查询的概率估计方法重建缺失的概率分量。
  • 利用迁移学习,将基于一个模型(如 Llama-2 7B)训练的反演模型应用于同一系列中的另一个模型(如 Llama-chat 7B)。
  • 通过在包含姓名、日期和国籍的合成提示上微调,将反演方法应用于私有属性恢复。

实验结果

研究问题

  • RQ1大型语言模型的下一个标记概率分布能否被反演以高保真度恢复原始输入提示?
  • RQ2在模型访问受限的情况下(如仅观察离散文本输出或 top-K 概率),提示反演的效率如何?
  • RQ3在反演过程中,私人信息(如姓名、日期、国籍)的保留程度如何?
  • RQ4该反演方法是否能在同一架构家族的不同模型之间泛化,例如 Llama-2 和 Llama-chat?
  • RQ5在存在 RLHF 对齐技术的情况下,反演性能与基于文本的越狱攻击相比如何?

主要发现

  • 在 Llama-2 7B 上,该反演方法实现了 59 的 BLEU 得分和 78% 的标记级别 F1,表明输入提示的重建质量很高。
  • 即使提示未直接对用户可见,该方法仍能实现 27% 的提示完全恢复。
  • 在 synthbio 数据集上,国家和国籍等私有属性的精确匹配准确率分别为 87.2% 和 64.5%。
  • 在 synthbio 数据集上,对个体日期和年份的重建准确率较低,年份的准确率仅为 1.0%。
  • 当仅能获得离散文本输出时,反演依然有效,因为迭代查询可实现足够概率估计以完成重建。
  • 与基于文本的越狱攻击不同,该反演方法对 RLHF 对齐技术具有鲁棒性,后者通常受此类对齐策略的抑制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。