Skip to main content
QUICK REVIEW

[论文解读] Towards Faithful Model Explanation in NLP: A Survey

Qing Lyu, Marianna Apidianaki|arXiv (Cornell University)|Sep 22, 2022
Topic Modeling被引用 12
一句话总结

本综述通过忠实性(即解释是否准确反映模型推理过程)的视角,对超过110种NLP模型解释方法进行了全面分析。它将方法划分为五大类,评估其忠实性,并识别出实现NLP中可靠、可信模型可解释性的关键挑战与未来方向。

ABSTRACT

End-to-end neural Natural Language Processing (NLP) models are notoriously difficult to understand. This has given rise to numerous efforts towards model explainability in recent years. One desideratum of model explanation is faithfulness, i.e. an explanation should accurately represent the reasoning process behind the model's prediction. In this survey, we review over 110 model explanation methods in NLP through the lens of faithfulness. We first discuss the definition and evaluation of faithfulness, as well as its significance for explainability. We then introduce recent advances in faithful explanation, grouping existing approaches into five categories: similarity-based methods, analysis of model-internal structures, backpropagation-based methods, counterfactual intervention, and self-explanatory models. For each category, we synthesize its representative studies, strengths, and weaknesses. Finally, we summarize their common virtues and remaining challenges, and reflect on future work directions towards faithful explainability in NLP.

研究动机与目标

  • 为解决NLP中对可靠、忠实模型解释的迫切需求,当前方法往往缺乏对模型推理过程的正式依据。
  • 阐明忠实性的概念,并将其与相关但不同的原则(如合理性)区分开来。
  • 系统性地构建一个包含110种解释方法的分类体系,分为五类:基于相似性的方法、内部结构分析、基于反向传播的方法、反事实干预方法以及自解释模型。
  • 从忠实性角度批判性评估现有方法的优势与不足,识别评估实践中常见的缺陷与不一致性。
  • 提出实现真正忠实、可靠且标准化的NLP模型解释所面临的开放性挑战与未来研究方向。

提出的方法

  • 提出一种五类解释方法的分类体系:基于相似性的方法、内部结构分析、基于反向传播的方法、反事实干预方法以及自解释模型。
  • 回顾梯度与传播方法的数学形式化,包括Integrated Gradients、SmoothGrad、LRP、DeepLift和Deep-Taylor分解。
  • 通过扰动方法(如LIME、SHAP和Anchors)分析反事实解释,评估输入修改下的预测表现。
  • 结合定性与定量指标评估忠实性,突出现有评估实践中的不一致性。
  • 整合工具与框架(如Captum、LIT、AllenNLP Interpret和What-if Tool),支持解释方法的实现与可视化。
  • 提出一种更精细、直观的分类体系,以解决术语模糊性,提升可解释性研究中的方法清晰度。

实验结果

研究问题

  • RQ1什么定义了NLP模型解释中的忠实性?它与合理性或其他可解释性原则有何区别?
  • RQ2不同解释方法(如基于梯度、注意力或反事实的方法)在忠实性方面表现如何?
  • RQ3当前NLP解释研究中,忠实性评估实践存在哪些主要不一致与局限?
  • RQ4哪些方法家族具有更强的内在忠实性?其关键技术与概念权衡是什么?
  • RQ5在实现真正忠实、可靠且标准化的NLP模型解释方面,最紧迫的挑战与未来研究方向是什么?

主要发现

  • 忠实性是NLP可解释性中的根本原则,但目前评估不足,常与合理性混淆,导致即使解释看似可信,仍可能具有误导性。
  • 在五类方法中,基于反向传播的方法(如Integrated Gradients和DeepLift)由于具有正式的公理基础,表现出相对更强的忠实性,但仍面临非线性与稀疏表示中的挑战。
  • 反事实方法(如LIME和SHAP)具有高可解释性,但在分布偏移或复杂输入结构下往往难以维持忠实性。
  • 自解释模型与基于相似性的方法在忠实性方面展现出潜力,但受限于对预定义原型或嵌入空间的依赖,可能无法反映模型的真实推理过程。
  • 忠实性评估缺乏共识,导致不同研究结果相互矛盾,削弱了可复现性与对可解释性声明的信任。
  • 本综述指出,亟需建立标准化、形式化的评估协议,并推动面向忠实性的方法设计,以确保高风险NLP应用中可信AI的实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。