Skip to main content
QUICK REVIEW

[论文解读] Generating Token-Level Explanations for Natural Language Inference

James Thorne, Andreas Vlachos|arXiv (Cornell University)|Apr 24, 2019
Topic Modeling参考文献 18被引用 5
一句话总结

本文提出一种白盒方法,利用多实例学习(MIL)对神经网络模型中的注意力分布进行正则化,以生成自然语言蕴涵(NLI)任务的粒度级别(token-level)解释。与简单的注意力阈值化方法相比,该MIL方法显著提升了与人工标注解释的一致性——在假设句解释的精确率上提升6.68%,在召回率上提升28.05%;同时,其推理速度比LIME和Anchor等黑盒方法快几个数量级。

ABSTRACT

The task of Natural Language Inference (NLI) is widely modeled as supervised sentence pair classification. While there has been a lot of work recently on generating explanations of the predictions of classifiers on a single piece of text, there have been no attempts to generate explanations of classifiers operating on pairs of sentences. In this paper, we show that it is possible to generate token-level explanations for NLI without the need for training data explicitly annotated for this purpose. We use a simple LSTM architecture and evaluate both LIME and Anchor explanations for this task. We compare these to a Multiple Instance Learning (MIL) method that uses thresholded attention make token-level predictions. The approach we present in this paper is a novel extension of zero-shot single-sentence tagging to sentence pairs for NLI. We conduct our experiments on the well-studied SNLI dataset that was recently augmented with manually annotation of the tokens that explain the entailment relation. We find that our white-box MIL-based method, while orders of magnitude faster, does not reach the same accuracy as the black-box methods.

研究动机与目标

  • 在无需为解释生成提供标注的情况下,生成NLI模型的粒度级别解释。
  • 评估基于注意力的解释是否与人类对蕴涵任务中显著词元的判断一致。
  • 将白盒MIL-based注意力正则化方法与黑盒方法(LIME、Anchor)及完全监督基线方法进行比较。
  • 评估NLI解释生成中解释质量与计算效率之间的权衡。
  • 探究注意力机制本身是否能够生成可靠且与人类一致的句子对蕴涵解释。

提出的方法

  • 使用基于简单LSTM的NLI模型,对前提和假设分别独立编码,并通过跨句子注意力机制进行交互。
  • 通过注意力阈值化生成基线粒度级别解释。
  • 提出一种新颖的白盒方法,利用多实例学习(MIL)对注意力分布进行正则化,使其聚焦于人工标注的显著词元。
  • 采用MIL目标函数,将每个句子对视为一个词元袋(bag of tokens),以促使注意力关注相关词元。
  • 将MIL方法与黑盒解释技术(LIME和Anchor)进行比较,后者通过扰动输入并训练代理模型来生成解释。
  • 在e-SNLI数据集上评估所有方法,该数据集提供了用于蕴涵理由说明的人工标注词元高亮。

实验结果

研究问题

  • RQ1在不显式监督解释生成的情况下,能否改进NLI模型中基于注意力的解释,使其与人工标注的显著词元更加一致?
  • RQ2与LIME和Anchor等黑盒解释方法相比,MIL正则化注意力在与人类判断的一致性方面表现如何?
  • RQ3所提出的白盒方法是否在保持计算效率的同时,实现了优于简单注意力阈值化的解释质量?
  • RQ4为何NLI模型中的注意力机制通常无法突出人类认为对蕴涵重要的词元?
  • RQ5模型中前提与假设编码的独立性在多大程度上限制了基于注意力的解释质量?

主要发现

  • 与简单注意力阈值化相比,MIL正则化注意力方法在假设句解释的F1值上,精确率提升6.68%,召回率提升28.05%。
  • 黑盒方法(LIME和Anchor)在与人类判断的一致性方面优于所有基于注意力的方法,其中LIME达到最高的F1分数。
  • 完全监督基线方法表现出高精确率但低召回率,倾向于选择常见词如'man'、'woman'、'dog',而非与标签相关联的上下文特定词元。
  • 基于注意力的解释显著不如黑盒方法可靠,LIME和Anchor的F1分数更高,表明注意力与特征重要性之间存在较弱对应关系。
  • 黑盒解释方法的推理速度比白盒MIL方法慢几个数量级(每实例64秒 vs. 每实例0.01秒),凸显了白盒方法在效率上的显著优势。
  • 注意力在前提句上表现不佳,归因于模型对前提和假设的独立编码机制,该机制无法捕捉成对语义依赖关系(如同义词或蕴涵模式)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。