[论文解读] Text Revealer: Private Text Reconstruction via Model Inversion Attacks against Transformers
Text Revealer 提出了一种针对微调后的基于 Transformer 的文本分类模型的首个模型反演攻击,用于重建私有文本数据。通过利用领域特定的公开数据预训练一个 GPT-2 生成器,并利用目标模型的反馈迭代扰动其隐藏状态,该方法在基准数据集上实现了 84.29% 的重建率和 34.22% 的准确率,实现了高保真度的私有训练文本重建。
Text classification has become widely used in various natural language processing applications like sentiment analysis. Current applications often use large transformer-based language models to classify input texts. However, there is a lack of systematic study on how much private information can be inverted when publishing models. In this paper, we formulate \emph{Text Revealer} -- the first model inversion attack for text reconstruction against text classification with transformers. Our attacks faithfully reconstruct private texts included in training data with access to the target model. We leverage an external dataset and GPT-2 to generate the target domain-like fluent text, and then perturb its hidden state optimally with the feedback from the target model. Our extensive experiments demonstrate that our attacks are effective for datasets with different text lengths and can reconstruct private texts with accuracy.
研究动机与目标
- 研究通过模型反演攻击,从微调后的基于 Transformer 的文本分类模型中能够重建多少私有信息。
- 弥补现有视觉和表格数据研究中对文本模型反演攻击系统性研究的不足,特别是针对 Transformer 模型的研究空白。
- 开发一种方法,仅通过目标模型的预测结果,无需访问训练数据,即可重建流畅且有意义的私有文本。
- 评估该攻击在不同文本长度、模型架构(BERT、TinyBERT)和数据集(Emotion、Yelp)上的有效性。
提出的方法
- 收集与私有数据集相同领域的公开数据集,以确保分布相似性。
- 对公开数据集进行 n-gram 分析,提取高频短语作为文本生成的模板。
- 在公开数据集上微调 GPT-2 语言模型,以生成流畅且符合领域的文本。
- 利用目标模型的预测得分反馈,对 GPT-2 输出的隐藏状态进行迭代扰动。
- 使用目标模型输出与期望标签分布之间的交叉熵损失来优化扰动。
- 使用主成分分析(PCA)可视化并比较反演文本与真实文本嵌入的语义相似性。
实验结果
研究问题
- RQ1仅通过白盒访问目标模型的预测结果,能在多大程度上从微调后的 Transformer 模型中重建私有训练文本?
- RQ2生成模板的长度如何影响重建私有文本的质量和准确性?
- RQ3该攻击在不同 Transformer 架构(如 BERT 与 TinyBERT)和文本分类数据集上的有效性如何?
- RQ4反演生成的文本在语义和分布特性上与原始私有训练数据的匹配程度如何?
- RQ5公开数据集与私有数据集的相似性在多大程度上影响了成功重建的能力?
主要发现
- Text Revealer 在 BERT 和 TinyBERT 作为目标模型的 Emotion 和 Yelp 数据集上,实现了 84.29% 的重建率(RR)和 34.22% 的准确率(Acc)。
- 该攻击在不同文本长度下均保持高性能,随着模板长度缩短,重建准确率下降——较长模板可获得更优结果。
- 公开数据集与私有数据集之间的 Kendall tau 距离显示,顶级 10 个词的词频具有极强相关性(相关系数为 0.99),支持使用公开数据生成模板。
- 微调模型在公开与私有数据集上表现出显著的准确率差距(例如,BERT 在私有数据集上达到 99.66%,在公开数据集上为 91.25%),表明模型对训练数据存在记忆现象。
- 攻击生成的反演样本语义连贯,且在上下文中与真实样本接近,如表 5 所示的 PCA 可视化和句级对比结果所示。
- 与 Gumbel softmax 和改进的交叉熵损失等替代损失函数相比,该方法在重建率和准确率上均表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。