Skip to main content
QUICK REVIEW

[论文解读] What do Deep Networks Like to Read?

Jonas Pfeiffer, Aishwarya Kamath|arXiv (Cornell University)|Sep 10, 2019
Topic Modeling参考文献 36被引用 4
一句话总结

该论文提出SIFT(通过微调进行敏感性识别),一种新颖的生成式方法,通过使用固定分类器的梯度微调自编码器,揭示自然语言处理中深度神经网络的偏好。该方法在无需先验假设的情况下,揭示了模型特有的偏好和人工制品(如引发偏见的术语),与已知数据人工制品表现出强相关性,并在多个模型和任务中发现了新的人工制品。

ABSTRACT

Recent research towards understanding neural networks probes models in a top-down manner, but is only able to identify model tendencies that are known a priori. We propose Susceptibility Identification through Fine-Tuning (SIFT), a novel abstractive method that uncovers a model's preferences without imposing any prior. By fine-tuning an autoencoder with the gradients from a fixed classifier, we are able to extract propensities that characterize different kinds of classifiers in a bottom-up manner. We further leverage the SIFT architecture to rephrase sentences in order to predict the opposing class of the ground truth label, uncovering potential artifacts encoded in the fixed classification model. We evaluate our method on three diverse tasks with four different models. We contrast the propensities of the models as well as reproduce artifacts reported in the literature.

研究动机与目标

  • 为解决现有研究在理解神经网络偏好方面仅限于抽取式理由或预定义探针任务的不足。
  • 开发一种自下而上的、生成式方法,揭示分类器本质上‘偏好阅读’的内容,而无需施加先验知识。
  • 利用统一框架识别并分析预训练分类器中编码的模型特异性偏见和人工制品。
  • 在不同架构(LSTM、CNN、DAN)和任务(情感分析、自然语言推理、PubMed分类)之间比较模型偏好。
  • 评估该方法生成反事实输入以反转分类器预测的能力,方法是针对编码的人工制品进行干预。

提出的方法

  • 通过直通Gumbel-Softmax估计器,利用固定预训练分类器的梯度对自编码器(AE)进行微调。
  • 利用AE以保留分类器认为有用的信息的方式重建输入序列,从而揭示其偏好。
  • 将该方法应用于句子级和句子对分类任务(如SST-2、SNLI、PubMed),以提取模型偏好。
  • 引入重构损失,通过惩罚原始和生成句子嵌入之间的余弦距离来确保一致性。
  • 在微调过程中翻转真实标签,以生成使分类器预测相反类别的输入,从而暴露编码的人工制品。
  • 将SIFT提取的术语与PMI(点互信息)结果进行比较,评估其与数据层面人工制品的一致性及模型层面编码的匹配程度。

实验结果

研究问题

  • RQ1不同神经网络架构在进行预测时,偏好哪些语言模式或术语?
  • RQ2分类器在多大程度上编码了影响预测的数据层面人工制品(如特定词语或短语)?
  • RQ3像SIFT这样的生成式、无监督方法是否能在无需先验假设的情况下揭示模型特异性的偏见和偏好?
  • RQ4SIFT生成的反事实输入与先前研究中报告的已知人工制品在多大程度上一致?
  • RQ5SIFT是否揭示了传统统计方法(如PMI)未能识别出的新类型人工制品?

主要发现

  • SIFT成功识别出与架构相关的模型特异性偏好,例如LSTM模型倾向于使用‘love’或‘bad’等情感相关术语。
  • 在SST-2情感分析任务中,SIFT术语与PMI术语的加权Kendall等级相关系数为0.486,表明与已知数据层面人工制品高度一致。
  • 在PubMed分类任务中,SIFT发现了上下文相关的术语(如‘objective’→‘conclusion’),这些术语与PMI无显著相关性,表明其编码了预训练过程中形成的深层语义模式。
  • 在SNLI任务中,SIFT识别出已知人工制品如‘sleeping’、‘cats’和‘cat’具有显著影响,与PMI的相关系数为0.366,证实其对已知偏见的敏感性。
  • 在标签翻转设置下,该方法在生成使分类器预测反转的输入方面达到了98–99%的准确率,证明其在激发模型行为方面的有效性。
  • SIFT表明,模型不仅编码表面关键词,还编码语义和上下文线索,尤其在大规模无标注数据上预训练后更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。