[论文解读] Gradient-based Analysis of NLP Models is Manipulable
本文表明,通过引入一个产生误导性梯度的“Facade”模型,可以高度操纵NLP中的基于梯度的可解释性方法,该模型可与任意目标模型合并。尽管保留了原始模型的预测结果,但合并后模型的梯度却倾向于无关的标记(例如停用词或首个标记),导致显著性图、输入缩减和对抗性攻击失效且具有欺骗性——这破坏了在对抗性环境下基于梯度分析的可信度。
Gradient-based analysis methods, such as saliency map visualizations and adversarial input perturbations, have found widespread use in interpreting neural NLP models due to their simplicity, flexibility, and most importantly, their faithfulness. In this paper, however, we demonstrate that the gradients of a model are easily manipulable, and thus bring into question the reliability of gradient-based analyses. In particular, we merge the layers of a target model with a Facade that overwhelms the gradients without affecting the predictions. This Facade can be trained to have gradients that are misleading and irrelevant to the task, such as focusing only on the stop words in the input. On a variety of NLP tasks (text classification, NLI, and QA), we show that our method can manipulate numerous gradient-based analysis techniques: saliency maps, input reduction, and adversarial perturbations all identify unimportant or targeted tokens as being highly important. The code and a tutorial of this paper is available at http://ucinlp.github.io/facade.
研究动机与目标
- 研究在对抗性操纵下,基于梯度的NLP可解释性方法的鲁棒性。
- 证明模型梯度可被操纵,以误导可解释性技术,而无需改变模型预测结果。
- 揭示广泛使用的基于梯度的分析工具(如显著性图、输入缩减和对抗性扰动)的脆弱性。
- 强调模型开发者可能通过梯度操纵隐藏模型偏见的风险。
- 推动开发更鲁棒且可信的可解释性技术。
提出的方法
- 训练一个“Facade”模型,使其生成强烈但误导性的梯度(例如,聚焦于停用词或首个标记),同时对任务生成低且均匀的预测。
- 通过合并两者的层,将Facade模型与目标模型进行融合,从而保留原始模型的logits和预测结果。
- 合并后的模型继承了目标模型的预测行为,但其梯度模式完全由Facade主导。
- 该方法在多个NLP任务中进行了验证:文本分类、自然语言推理(NLI)和问答(QA)。
- 在合并后的模型上评估基于梯度的分析技术(包括显著性图、输入缩减和HotFlip对抗性攻击),以评估操纵的影响。
- 该方法假设具备白盒访问权限,即攻击者可控制模型的内部结构,并能在训练或微调过程中插入Facade模型。
实验结果
研究问题
- RQ1是否可以操纵基于梯度的可解释性方法,使其在不改变模型预测的前提下,错误地将重要性归因于无关的输入标记?
- RQ2当梯度被误导性的Facade模型主导时,显著性图、输入缩减和对抗性攻击在多大程度上仍保持可靠性?
- RQ3能否构建一个Facade模型,使梯度聚焦于停用词或首个标记,同时保持原始模型的输出不变?
- RQ4梯度操纵如何影响NLP中广泛使用的可解释性工具的可信度?
- RQ5此类操纵是否能隐藏模型偏见(如职业分类中的性别偏见)免受基于梯度的审计?
主要发现
- 合并后的模型与原始模型的预测结果几乎完全一致,证实了在梯度被操纵的情况下,目标行为仍被完整保留。
- 在合并模型上生成的显著性图错误地将停用词或首个标记识别为最重要,即使它们与预测结果无关。
- 在合并模型上应用的输入缩减技术始终识别并移除不重要的标记(如停用词),导致生成无意义的缩减输入。
- 在合并模型上执行的HotFlip对抗性攻击主要扰动停用词或首个标记,未能针对有意义的输入特征。
- 该操纵成功隐藏了在职业分类任务中模型的性别偏见,使基于梯度的分析无法察觉其偏见行为。
- 在评估的基于梯度的技术中,InteGrad(一种通过在多个输入上平均梯度的梯度方法)对这种操纵表现出最强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。