Skip to main content
QUICK REVIEW

[论文解读] Post-hoc Interpretability for Neural NLP: A Survey

Andreas Nygaard Madsen, Siva Reddy|arXiv (Cornell University)|Aug 10, 2021
Explainable Artificial Intelligence (XAI)被引用 11
一句话总结

本综述对神经网络NLP模型的后训练可解释性方法进行了全面分类,按其向人类传达解释的方式组织,涵盖从输入特征到自然语言及全局概念的多种方式。综述回顾了关键方法,评估了验证实践,并倡导采用标准化、有原则的可解释性度量方法,以提升高风险NLP应用中的可靠性与问责性。

ABSTRACT

Neural networks for NLP are becoming increasingly complex and widespread, and there is a growing concern if these models are responsible to use. Explaining models helps to address the safety and ethical concerns and is essential for accountability. Interpretability serves to provide these explanations in terms that are understandable to humans. Additionally, post-hoc methods provide explanations after a model is learned and are generally model-agnostic. This survey provides a categorization of how recent post-hoc interpretability methods communicate explanations to humans, it discusses each method in-depth, and how they are validated, as the latter is often a common concern.

研究动机与目标

  • 为应对复杂神经网络NLP模型在医疗、刑事司法等高风险领域中日益增长的安全性、伦理性和问责性担忧。
  • 基于解释向人类传达的方式,系统性地对后训练可解释性方法进行分类,强调无需模型特定的、后训练的可解释性方法。
  • 分析并比较可解释性研究中使用的验证技术,突出当前缺乏标准化,亟需有原则的代理度量方法。
  • 倡导更多关注被忽视的解释类型,如类别级解释和序列到序列解释,并弥合内在可解释性与后训练可解释性方法之间的鸿沟。
  • 推动开发更稳健、标准化的可解释性评估框架,以确保该领域的可信度与可复现性。

提出的方法

  • 在表1中提出一种分类法,按沟通方式(如输入特征、对抗样本、自然语言)和信息来源(如梯度、注意力、影响函数)对后训练可解释性方法进行组织。
  • 沿抽象程度的光谱对方法进行分类,从局部、标记级解释到全局、基于概念或规则的解释,解释的可读性逐步提高。
  • 回顾了150余种方法,涵盖15个类别,包括LIME、SHAP、Grad-CAM、影响函数和原型网络,并在专门章节中详细讨论每种方法。
  • 强调无需微调或架构修改的模型无关型后训练方法,从而在多种NLP模型中具有广泛适用性。
  • 提出通过代理度量和公理(如功能基础性)评估可解释性的框架,由于缺乏标准答案,这是目前唯一可行的替代方案。
  • 讨论了结合内在与后训练方法的混合方法,如Kernel SHAP,其在训练期间依赖输入掩码,以及通过噪声注入提升解释质量。

实验结果

研究问题

  • RQ1后训练可解释性方法能否基于其沟通风格和信息来源系统性地分类?
  • RQ2不同类型的解释(如输入特征、反事实、自然语言解释)在向人类传达模型行为方面有何优势与局限性?
  • RQ3为何可解释性方法的验证特别具有挑战性?目前最具有原则性的代理度量有哪些?
  • RQ4为何类别级解释和序列到序列解释被严重忽视?它们如何提升现实世界NLP应用中的可解释性?
  • RQ5如何有意义地结合内在与后训练可解释性方法,以增强模型的透明度与可靠性?

主要发现

  • 后训练可解释性方法在沟通风格上差异显著,从局部标记级显著性图到全局概念基解释,尚无单一方法在所有场景下均占优。
  • 可解释性验证仍面临重大挑战,主要因缺乏标准答案;功能基础性常为唯一可行的代理度量,但其本身极难测量。
  • 类别级解释被严重忽视,但其提供了一个有价值的折中方案——比局部解释更具概括性,又比全局抽象更具体。
  • 序列到序列模型被广泛使用但解释不足;多数方法针对序列到分类任务设计,有效解释常需依赖交互式可视化。
  • 混合方法(如Kernel SHAP和噪声增强的输入掩码)表明,内在设计选择可显著提升后训练解释的质量。
  • 该领域缺乏标准化的可解释性评估基准,作者呼吁更加关注有原则、可复现的度量方法,以确保可信度与研究进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。