Skip to main content
QUICK REVIEW

[论文解读] Model Explainability in Deep Learning Based Natural Language Processing

Shafie Gholizadeh, Nengfeng Zhou|arXiv (Cornell University)|Jun 14, 2021
Explainable Artificial Intelligence (XAI)参考文献 21被引用 10
一句话总结

本文评估了用于基于深度学习的自然语言处理(NLP)模型可解释性的逐层相关性传播(LRP)方法,展示了其在为词语分配局部相关性分数以及识别全局特征重要性方面的有效性。研究结果表明,LRP在通过在Yelp情感数据上的假正例和假负例分析检测模型弱点方面,优于基于梯度和置换的基线方法。

ABSTRACT

Machine learning (ML) model explainability has received growing attention, especially in the area related to model risk and regulations. In this paper, we reviewed and compared some popular ML model explainability methodologies, especially those related to Natural Language Processing (NLP) models. We then applied one of the NLP explainability methods Layer-wise Relevance Propagation (LRP) to a NLP classification model. We used the LRP method to derive a relevance score for each word in an instance, which is a local explainability. The relevance scores are then aggregated together to achieve global variable importance of the model. Through the case study, we also demonstrated how to apply the local explainability method to false positive and false negative instances to discover the weakness of a NLP model. These analysis can help us to understand NLP models better and reduce the risk due to the black-box nature of NLP models. We also identified some common issues due to the special natures of NLP models and discussed how explainability analysis can act as a control to detect these issues after the model has been trained.

研究动机与目标

  • 评估并比较NLP中的模型可解释性方法,尤其针对监管和风险管理目的。
  • 将逐层相关性传播(LRP)应用于文本分类模型,以推导局部和全局特征重要性分数。
  • 利用可解释性分析检测在假正例和假负例预测中的模型弱点。
  • 通过可解释性作为事后控制手段,识别NLP特有的常见问题,如未登录词(OOV)、代理特征和偏见。
  • 展示可解释性如何提升高风险NLP应用中的模型透明度并降低风险。

提出的方法

  • 将LRP应用于已训练的NLP分类器(SVM在Yelp情感数据集上),为单个预测计算每个词语的相关性分数。
  • 通过聚合所有实例的局部相关性分数,推导出模型的全局特征重要性。
  • 利用LRP分析假正例和假负例预测,识别误导性或虚假特征。
  • 通过相关性和性能影响指标,将LRP与基于梯度、置换和SHAP的可解释性方法进行比较。
  • 通过移除基于LRP分数排名靠前的词元进行基线比较和消融测试,以衡量性能下降程度。
  • 评估训练数据和测试数据之间相关性分数的相关性,以验证一致性和鲁棒性。

实验结果

研究问题

  • RQ1LRP在识别NLP模型中关键影响词语方面,与基于梯度、置换和SHAP等其他可解释性方法相比表现如何?
  • RQ2LRP在多大程度上能够揭示假正例和假负例预测中的模型弱点?
  • RQ3相关性分数在训练数据和测试数据之间是否稳定?这对模型可靠性意味着什么?
  • RQ4通过可解释性分析,可以检测到哪些常见的NLP特定问题,如OOV词、代理特征或人口统计偏见?
  • RQ5可解释性度量能否作为事后控制手段,用于检测与数据质量或偏见相关的模型缺陷?

主要发现

  • LRP在识别关键影响特征方面优于基于梯度和置换的方法,尤其在检测模型错误方面表现更优。
  • 移除按LRP分数排名前10%的词元导致召回率下降最大,表明其具有极高的预测影响力。
  • 训练数据和测试数据的相关性分数表现出高度相关性(尤其是LRP和SVM置换方法),表明特征重要性具有一致性。
  • GbSA与其他方法的相关性较低,表明其在特征归因方面可能存在不稳定性。
  • 可解释性分析有效识别出诸如依赖非英文词语、OOV术语以及人口统计代理等异常模式。
  • 本研究证实,可解释性可作为关键的事后控制机制,用于在监管环境中检测模型风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。