[论文解读] Evaluating the Susceptibility of Pre-Trained Language Models via Handcrafted Adversarial Examples
本文评估了预训练语言模型(PLMs)在保持低标记级扰动的同时,对人工构造的对抗性样本所导致的语义误分类的敏感性。研究发现,广泛使用的距离度量和n-gram指标无法检测出显著的语义不匹配,暴露了GPT-3和BERT系列模型在微调前存在的关键安全漏洞。
Recent advances in the development of large language models have resulted in public access to state-of-the-art pre-trained language models (PLMs), including Generative Pre-trained Transformer 3 (GPT-3) and Bidirectional Encoder Representations from Transformers (BERT). However, evaluations of PLMs, in practice, have shown their susceptibility to adversarial attacks during the training and fine-tuning stages of development. Such attacks can result in erroneous outputs, model-generated hate speech, and the exposure of users' sensitive information. While existing research has focused on adversarial attacks during either the training or the fine-tuning of PLMs, there is a deficit of information on attacks made between these two development phases. In this work, we highlight a major security vulnerability in the public release of GPT-3 and further investigate this vulnerability in other state-of-the-art PLMs. We restrict our work to pre-trained models that have not undergone fine-tuning. Further, we underscore token distance-minimized perturbations as an effective adversarial approach, bypassing both supervised and unsupervised quality measures. Following this approach, we observe a significant decrease in text classification quality when evaluating for semantic similarity.
研究动机与目标
- 调查预训练语言模型(PLMs)在微调前对人工构造的对抗性样本的鲁棒性。
- 揭示公开发布的GPT-3模型(尤其是GPT-3 Playground)中存在的漏洞,这些漏洞允许在极小输入扰动下引发语义误分类。
- 评估标准距离度量和n-gram指标(如BLEU、BERTScore)在检测模型输出中显著语义差异方面的失败。
- 证明标记级扰动可在不被常见质量评估方法察觉的情况下,彻底改变分类结果。
- 倡导采用考虑语义级扰动的对抗性训练和微调方法,以改进模型评估。
提出的方法
- 作者通过精心设计的手动标记级扰动构造对抗性样本,旨在改变语义含义,同时最小化表面标记序列的变化。
- 采用多种距离度量评估模型性能:在标记和序列两个层级上计算Levenshtein、Sørensen-Dice、Jaccard和余弦距离。
- 研究使用BERTScore(精确率、召回率、F1)和BLEU-1/BLEU-4评估文本生成质量以及自然输入与对抗性输入之间的相似性。
- 将模型输出与标准参考答案进行比较,以衡量在对抗性条件下的分类质量。
- 分析涵盖BERT、RoBERTa和ALBERT模型在零样本掩码语言建模和分类任务中的表现。
- 通过人工验证确认自然输入与对抗性扰动输入之间的语义不匹配,确保对抗性样本在语义上具有显著差异。
实验结果
研究问题
- RQ1人工构造的对抗性样本是否能在不触发标准度量检测的情况下,成功诱导GPT-3和BERT等预训练语言模型发生语义误分类?
- RQ2BLEU和BERTScore等常见文本质量度量在多大程度上无法检测出由极小标记级扰动引起的模型输出中显著的语义差异?
- RQ3基于距离的度量(如Levenshtein、Jaccard等)在标记级和序列级上对自然输入与对抗性输入之间的语义偏离捕捉能力如何?
- RQ4为何尽管模型输出存在显著的语义差异,多个模型的中位距离得分仍接近零?
- RQ5这些发现对模型可解释性、公平性以及当前预训练语言模型评估基准的可靠性有何影响?
主要发现
- 对抗性输入与自然输入之间的中位Levenshtein、Sørensen-Dice、Jaccard和余弦距离得分接近于零(例如,BERT中余弦距离为0.010411),表明在序列层级上几乎无法检测到变化。
- 尽管存在显著的语义差异,BERTScore的F1值仍保持较高水平(例如,BERT为0.6855,RoBERTa为0.9061),表明相似性评估中存在严重误报。
- 所有模型的BLEU-1和BLEU-4得分均高于0.98,表明n-gram度量无法检测出语义退化。
- 标记级距离度量的值显著高于序列级度量,揭示语义偏离在标记层级上更具可检测性。
- ALBERT在标准化距离度量中得分最高(例如,Levenshtein为0.6210),但在序列层级上仍无法捕捉语义差异,其中位得分接近于零。
- 结果表明,当前标准度量无法有效检测出显著改变语义含义的对抗性扰动,暴露了模型评估中的关键缺陷。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。