Skip to main content
QUICK REVIEW

[论文解读] Generating Hierarchical Explanations on Text Classification via Feature Interaction Detection

Hanjie Chen, Guangtao Zheng|arXiv (Cornell University)|Apr 4, 2020
Explainable Artificial Intelligence (XAI)参考文献 40被引用 11
一句话总结

该论文提出Hedge,一种模型无关的方法,通过检测多个粒度下的特征交互,生成文本分类的层次化解释。通过递归识别并基于交互强度分割文本片段,Hedge 生成忠实且可解释的解释,揭示词语和短语如何组合影响模型预测,在LSTM、CNN和BERT模型上的自动评估与人工评估中均优于基线方法。

ABSTRACT

Generating explanations for neural networks has become crucial for their applications in real-world with respect to reliability and trustworthiness. In natural language processing, existing methods usually provide important features which are words or phrases selected from an input text as an explanation, but ignore the interactions between them. It poses challenges for humans to interpret an explanation and connect it to model prediction. In this work, we build hierarchical explanations by detecting feature interactions. Such explanations visualize how words and phrases are combined at different levels of the hierarchy, which can help users understand the decision-making of black-box models. The proposed method is evaluated with three neural text classifiers (LSTM, CNN, and BERT) on two benchmark datasets, via both automatic and human evaluations. Experiments show the effectiveness of the proposed method in providing explanations that are both faithful to models and interpretable to humans.

研究动机与目标

  • 解决现有解释方法仅关注单个词语或短语的局限性,忽略其在决策过程中的相互作用。
  • 开发一种模型无关的方法,揭示影响模型预测的特征的层次化构成。
  • 通过可视化词语和短语组合在多个粒度层级上对预测的贡献,提升人类可解释性。
  • 通过自动化指标与人工评估,衡量解释的忠实度与可理解性。

提出的方法

  • Hedge采用自顶向下的分割方法,基于检测到的特征交互递归地划分文本片段。
  • 它使用评分函数量化每个文本片段对模型预测的贡献,基于扰动与预测变化。
  • 该方法在每一步检测最弱的交互,并据此分割片段,构建特征交互的层次树。
  • 该层次结构从粗粒度到细粒度捕获交互,从完整句子逐步细化到单个词语。
  • 该方法为模型无关,仅需模型预测结果与输入文本,适用于任何黑箱分类器。
  • 通过选择最多五个词的顶级特征,限制解释长度,提升人工评估的可用性。

实验结果

研究问题

  • RQ1特征交互检测能否提升文本分类中解释的忠实度与可解释性?
  • RQ2与平面的、基于词级别的解释相比,层次化解释结构在揭示模型预测的组合逻辑方面表现如何?
  • RQ3所提出的方法在人工评估中是否优于现有的模型无关解释技术?
  • RQ4该方法在LSTM、CNN和BERT等不同神经网络架构上的表现如何?
  • RQ5是否存在模型准确率与解释连贯性之间的权衡,特别是在BERT等高性能模型上?

主要发现

  • 在LSTM模型的IMDB数据集上,Hedge的连贯性得分为0.89,高于所有基线方法,包括LIME(0.85)和SampleShapley(0.78)。
  • 在BERT上,Hedge保持了较强的性能,连贯性得分为0.75,尽管BERT的准确率更高(0.97),表明可能存在准确率与可解释性之间的权衡。
  • 人工评估者更有可能从Hedge生成的解释中正确推断出模型的预测结果,证实了其可解释性的提升。
  • Hedge成功捕捉了BERT中的复杂交互,如否定(例如,'not a bad'),解释了为何其能做出正确预测,而LSTM则失败。
  • 层次结构揭示了'good'等词语被更强的交互(如'waste of good')所主导,提供了比平面解释更深入的模型推理洞察。
  • 在SST和IMDB数据集上的实验结果确认,Hedge的解释既忠实于模型行为,又易于人类理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。