[论文解读] Local Interpretations for Explainable Natural Language Processing: A Survey
本综述对自然语言处理中的局部可解释性方法进行了全面分析,将其分类为特征重要性、自然语言解释和隐藏状态探测三类。文章指出了评估中的关键挑战,包括度量标准不一致以及过度依赖主观的人工评估,并呼吁建立统一的、以用户为中心的评估框架,以提升模型解释在正确和错误预测中的忠实度与可信度。
As the use of deep learning techniques has grown across various fields over the past decade, complaints about the opaqueness of the black-box models have increased, resulting in an increased focus on transparency in deep learning models. This work investigates various methods to improve the interpretability of deep neural networks for Natural Language Processing (NLP) tasks, including machine translation and sentiment analysis. We provide a comprehensive discussion on the definition of the term interpretability and its various aspects at the beginning of this work. The methods collected and summarised in this survey are only associated with local interpretation and are specifically divided into three categories: 1) interpreting the model's predictions through related input features; 2) interpreting through natural language explanation; 3) probing the hidden states of models and word representations.
研究动机与目标
- 系统性回顾自然语言处理中的局部可解释性方法,重点关注个体预测的可解释性,而非全局模型行为。
- 阐明在深度神经网络背景下,可解释性、可解释性与忠实度之间的区别。
- 识别当前评估实践中的关键局限,特别是对人工评估的过度依赖以及自动度量标准的不一致。
- 倡导开发全面的评估框架,以评估忠实度、稳定性和可理解性,涵盖正确与错误预测。
- 强调需要可解释的模型,不仅能解释正确决策,也能解释错误,以建立信任并实现自修正的AI系统。
提出的方法
- 将局部可解释性技术分为三类主要类型:特征重要性、自然语言解释(NLE)和隐藏状态及词表示的探测。
- 回顾特征重要性方法,如LIME和Grad-CAM,这些方法突出显示对预测最具影响力的输入标记。
- 研究自然语言解释生成,即模型使用序列到序列或提示驱动方法生成文本推理以支持预测。
- 分析探测技术,通过分析内部表示(如注意力头、隐藏状态)来解释模型推理过程。
- 评估现有的自动与人工评估方法,强调BLEU等NLE指标以及DFFOT/SUFF等忠实度指标在度量标准上的一致性问题与局限性。
- 提出一种未来评估框架,具备可复现性、以用户为中心,并能评估多种可解释性维度,涵盖不同类型的预测。
实验结果
研究问题
- RQ1如何对自然语言处理中的局部可解释性方法进行系统性分类与比较?
- RQ2在深度学习模型背景下,可解释性、可解释性与忠实度之间的关键区别是什么?
- RQ3为何可解释性方法的评估不一致?当前自动与人工评估方法的主要局限是什么?
- RQ4如何将可解释性方法扩展至解释不仅正确预测,也包括模型错误?
- RQ5稳健、可复现且以用户为中心的可解释性评估框架的关键组成部分是什么?
主要发现
- 当前用于可解释性的自动评估度量标准(如NLE的BLEU)往往无法捕捉语义忠实度,导致对解释质量的结论产生误导。
- DFFOT和SUFF等评估度量在相同模型和数据集上产生矛盾结果,表明自动评估在一致性和可靠性方面存在不足。
- 人工评估仍是评估可解释性的金标准,但其具有主观性、耗时且难以在不同研究中复现。
- 在评估可解释性维度(如稳定性和可信度)方面存在显著研究空白,这些维度在自动化框架中目前仍被严重忽视。
- 绝大多数可解释性研究仅关注解释正确预测,忽视了解释模型错误的迫切需求,从而限制了模型的信任度与可用性。
- 可解释人工智能的未来在于开发能够为正确和错误预测生成忠实、可理解且稳定的解释的模型,以实现自修正、可信的AI系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。