Skip to main content
QUICK REVIEW

[论文解读] Interpretation of Black Box NLP Models: A Survey

Shivani Choudhary, Niladri Chatterjee|arXiv (Cornell University)|Mar 31, 2022
Explainable Artificial Intelligence (XAI)被引用 11
一句话总结

本综述全面概述了黑箱NLP模型的可解释性方法,将技术分类为五种主要方法——特征重要性、对抗性样本、反事实解释、局部代理模型和因果方法。它强调了不同方法之间的协同作用,指出了缺乏标准化评估等关键挑战,并强调了在高风险领域中实现以用户为中心的可解释性,以支持伦理、可靠和公平的人工智能应用。

ABSTRACT

An increasing number of machine learning models have been deployed in domains with high stakes such as finance and healthcare. Despite their superior performances, many models are black boxes in nature which are hard to explain. There are growing efforts for researchers to develop methods to interpret these black-box models. Post hoc explanations based on perturbations, such as LIME, are widely used approaches to interpret a machine learning model after it has been built. This class of methods has been shown to exhibit large instability, posing serious challenges to the effectiveness of the method itself and harming user trust. In this paper, we propose S-LIME, which utilizes a hypothesis testing framework based on central limit theorem for determining the number of perturbation points needed to guarantee stability of the resulting explanation. Experiments on both simulated and real world data sets are provided to demonstrate the effectiveness of our method.

研究动机与目标

  • 为医疗、刑事司法和金融等高风险NLP应用中对可解释性的关键需求提供解决方案。
  • 识别并分类NLP中的可解释性方法,包括特征重要性、对抗性样本、反事实、代理模型和因果方法。
  • 审视当前可解释性技术的局限性,特别是缺乏标准化评估指标和以用户为中心的设计。
  • 强调偏见和公平性等伦理问题,尤其是在基于偏差或倾斜数据集训练的模型中。
  • 倡导支持人类理解、问责制和模型决策信任的可解释性方法。

提出的方法

  • 将可解释性方法分类为五类:特征重要性、对抗性样本、反事实解释、局部代理模型和因果方法。
  • 回顾基于梯度和显著性的方法(例如,Integrated Gradients、Grad-CAM),用于识别影响输入标记。
  • 研究对抗性样本(AE)作为输入空间中的扰动,用于测试模型鲁棒性,并通过输入扰动生成解释。
  • 探索使用掩码输入和控制指令(例如,否定)生成替代输入以改变预测结果的反事实解释(CE)。
  • 利用预训练语言模型如GPT-2和T5(例如,在Polyjuice和MiCE中)生成语义连贯的反事实。
  • 应用因果中介分析和探测技术,以隔离模型表征中特定特征或概念的影响。

实验结果

研究问题

  • RQ1如何以对不同专业水平的终端用户有意义的方式评估NLP模型的可解释性?
  • RQ2NLP中因果与非因果可解释性方法的关键差异是什么?它们与模型鲁棒性有何关联?
  • RQ3现有可解释性方法在多大程度上解决了模型预测中的偏见和公平性等伦理问题?
  • RQ4反事实和对抗性样本如何用于提升模型的透明度和可靠性?
  • RQ5为何缺乏标准化的可解释性定量评估指标?这一问题应如何解决?

主要发现

  • 目前尚无公认的可解释性定义或评估指标,导致各研究间的基准测试不一致。
  • 因果可解释性方法(如反事实和中介分析)在通过隔离特征影响来解释模型决策方面展现出强大潜力。
  • MiCE和Polyjuice等方法利用微调后的T5和GPT-2模型,生成高置信度且具可解释性的语义连贯反事实。
  • 对抗性样本和输入扰动揭示了模型的脆弱性,并有助于识别虚假相关性,例如在基于图像的NLP任务中出现的雪地斑块。
  • 自然语言解释和反事实比模型参数或注意力图更易于非专家用户理解。
  • 尽管已取得进展,但大多数可解释性方法仍聚焦于模型开发者而非终端用户,凸显了以用户为中心设计的缺失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。