[论文解读] On quantitative aspects of model interpretability
本文提出了一套系统性的框架,通过将可解释性方法分解为特征提取器和可解释性模型,并引入简洁性、广泛性和保真度的度量指标,实现对模型可解释性方法的定量评估。实验表明,如Integrated Gradients等方法在广泛性和保真度方面表现更优,使从业者能够客观选择最适合特定任务的可解释性方法。
Despite the growing body of work in interpretable machine learning, it remains unclear how to evaluate different explainability methods without resorting to qualitative assessment and user-studies. While interpretability is an inherently subjective matter, previous works in cognitive science and epistemology have shown that good explanations do possess aspects that can be objectively judged apart from fidelity), such assimplicity and broadness. In this paper we propose a set of metrics to programmatically evaluate interpretability methods along these dimensions. In particular, we argue that the performance of methods along these dimensions can be orthogonally imputed to two conceptual parts, namely the feature extractor and the actual explainability method. We experimentally validate our metrics on different benchmark tasks and show how they can be used to guide a practitioner in the selection of the most appropriate method for the task at hand.
研究动机与目标
- 为解决在用户研究之外缺乏程序化、客观的可解释性评估方法的问题。
- 识别并量化可解释性的三个核心方面:简洁性、广泛性和保真度。
- 正式将可解释性方法分解为两个正交的组成部分:特征提取器和可解释性模型。
- 提供基于功能的度量指标,以指导从业者为特定任务选择最合适的可解释性方法。
- 通过使用定量标准预先筛选高潜力的解释方法,减轻用户研究的负担。
提出的方法
- 本文提出将可解释性方法在概念上分解为特征提取器(将输入数据转换为可解释表示)和可解释性模型(从该表示生成解释)的框架。
- 定义了可解释性的三个核心维度:非敏感性(对输入微小变化的鲁棒性)、事实准确性(解释的细节程度)和集成程度(通用适用性),三者共同定义了简洁性和广泛性。
- 对于保真度,使用原始特征与提取特征之间的互信息来度量信息保留程度,并引入基于扰动的测试以评估解释的鲁棒性。
- 应用单调性和扰动稳定性等度量指标,评估解释在输入修改下的泛化能力,特别针对文本分类任务进行评估。
- 在基准数据集上通过CNN等模型和LIME、Grad-CAM、Integrated Gradients等方法验证该框架,跨不同解释模态计算度量指标。
- 该方法支持正交评估:通过分别修改特征提取器或可解释性模型,可独立评估简洁性、广泛性和保真度的性能。
实验结果
研究问题
- RQ1如何在不依赖用户研究的情况下客观评估可解释性?
- RQ2简洁性、广泛性和保真度在模型可解释性方法中能在多大程度上实现定量测量?
- RQ3特征提取器和可解释性模型如何独立贡献于可解释性度量?
- RQ4能否设计出模块化且适用于不同解释模态(如归因、示例)的度量指标?
- RQ5当前最先进方法在这些定量可解释性维度上的表现如何比较?
主要发现
- Integrated Gradients在广泛性方面表现优异,在替换大量非关键词后仍能保持高预测稳定性。
- 扰动测试表明,IntGrad在大量扰动样本中仍能维持原始类别预测,证实其解释具有鲁棒性和泛化能力。
- 互信息度量显示,特征提取器显著影响保真度,互信息越高,表示相关输入信息保留得越好。
- 该方法识别出IntGrad的解释既高度通用又准确,在广泛性和保真度方面优于LIME和Grad-CAM。
- 研究证实,可通过独立优化特征提取器和可解释性模型来提升可解释性,验证了可解释性方法正交分解的有效性。
- 所提出的度量指标通过基于定量标准预先筛选高潜力解释方法,减少了对全面用户研究的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。