[论文解读] Sensitivity based Neural Networks Explanations
本文提出了一种快速、基于敏感度的神经网络预测解释方法,通过计算输出对输入的梯度来评估特征重要性。该方法可在多种架构(如全连接网络、卷积神经网络、循环神经网络)中实现全局和局部可解释性,速度远超LIME(25,000个样本下为0.5秒 vs. 6小时),且在可解释性方面与逻辑回归和决策树等内在可解释模型相当或更优。
Although neural networks can achieve very high predictive performance on various different tasks such as image recognition or natural language processing, they are often considered as opaque "black boxes". The difficulty of interpreting the predictions of a neural network often prevents its use in fields where explainability is important, such as the financial industry where regulators and auditors often insist on this aspect. In this paper, we present a way to assess the relative input features importance of a neural network based on the sensitivity of the model output with respect to its input. This method has the advantage of being fast to compute, it can provide both global and local levels of explanations and is applicable for many types of neural network architectures. We illustrate the performance of this method on both synthetic and real data and compare it with other interpretation techniques. This method is implemented into an open-source Python package that allows its users to easily generate and visualize explanations for their neural networks.
研究动机与目标
- 解决金融与医疗等高风险领域中对模型可解释性的迫切需求,克服黑箱模型面临的监管与信任障碍。
- 克服现有解释方法在应用于深度神经网络时存在的计算效率低下与可扩展性不足等局限。
- 开发一种统一、高效且可扩展的方法,用于生成适用于多种神经网络架构的全局与局部特征重要性解释。
- 证明基于敏感度的解释与内在可解释模型(如逻辑回归、决策树)的解释具有一致性,并能有效指导特征选择。
- 通过开源Python工具包实现可解释性的实用化部署,便于用户生成与可视化解释。
提出的方法
- 通过计算神经网络输出对每个输入特征的梯度来量化敏感度,作为特征重要性的代理指标。
- 利用所有输入样本的梯度L2范数,推导出全局特征重要性排序,以捕捉特征对预测的整体影响。
- 对单个预测应用相同的梯度计算,生成实例特定的解释,实现局部可解释性。
- 通过反向传播机制,将该方法适配至全连接网络、卷积神经网络和循环神经网络等多种架构。
- 未来工作将引入二阶敏感度(基于Hessian矩阵)以捕捉特征间的交互效应。
- 在开源Python包中实现该方法,支持从业者端到端的解释生成与可视化。
实验结果
研究问题
- RQ1基于梯度的敏感度是否能为深度神经网络提供一种比LIME和Shapley值等现有特征重要性方法更快、更可靠的替代方案?
- RQ2与逻辑回归和决策树等内在可解释模型的解释相比,该敏感度方法在准确性和一致性方面表现如何?
- RQ3基于敏感度的特征重要性在多大程度上可用于识别并移除冗余或非信息性输入特征,而不会降低模型性能?
- RQ4与现有方法相比,该敏感度方法在大规模数据集和复杂神经网络架构上的可扩展性如何?
- RQ5该方法是否可无需架构修改地推广至不同类型的神经网络(如全连接网络、CNN、RNN)?
主要发现
- 该敏感度方法在25,000个样本上计算全局特征重要性,速度比LIME快达7,200倍,仅需0.5秒,而LIME需6小时。
- 该方法的全局特征重要性排序与LIME的聚合排序高度一致,并在信用违约数据集上与逻辑回归和决策树的解释结果一致。
- 被识别出的前五大重要特征——PAY_0、PAY_AMT1、LIMIT_BAL、PAY_AMT2和PAY_3——在所有方法中均被高度排名,表明其结果具有鲁棒性。
- 基于敏感度排序选择前10个特征(解释了90%的重要性)构建的简化全连接网络,测试误差率为18.47% ± 0.000834,与原始模型的18.66% ± 0.000484相当。
- 在30次不同的随机权重初始化下,简化模型的性能与全模型无统计学差异,证实被移除的特征对预测能力贡献可忽略。
- 该方法能有效识别冗余特征,实现模型简化的同时保持预测准确性,支持其在模型压缩与特征选择中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。