[论文解读] Exact and Consistent Interpretation for Piecewise Linear Neural Networks: A Closed Form Solution
本文提出 $OpenBox$,一种闭式方法,通过将分段线性神经网络(PLNNs)转换为等效的局部线性分类器集合,实现对PLNNs的精确且一致的解释。该方法可在每个输入区域实现精确、全局一致的特征归因,其解释保真度和模型劫持任务表现优于局部近似方法。
Strong intelligent machines powered by deep neural networks are increasingly deployed as black boxes to make decisions in risk-sensitive domains, such as finance and medical. To reduce potential risk and build trust with users, it is critical to interpret how such machines make their decisions. Existing works interpret a pre-trained neural network by analyzing hidden neurons, mimicking pre-trained models or approximating local predictions. However, these methods do not provide a guarantee on the exactness and consistency of their interpretation. In this paper, we propose an elegant closed form solution named $OpenBox$ to compute exact and consistent interpretations for the family of Piecewise Linear Neural Networks (PLNN). The major idea is to first transform a PLNN into a mathematically equivalent set of linear classifiers, then interpret each linear classifier by the features that dominate its prediction. We further apply $OpenBox$ to demonstrate the effectiveness of non-negative and sparse constraints on improving the interpretability of PLNNs. The extensive experiments on both synthetic and real world data sets clearly demonstrate the exactness and consistency of our interpretation.
研究动机与目标
- 解决深度神经网络在医疗、金融等高风险领域中缺乏精确且一致的解释方法的问题。
- 克服现有解释方法(如隐藏神经元分析、模型蒸馏和局部近似)在准确性和一致性方面缺乏理论保证的局限性。
- 为PLNNs的全局行为提供数学上严谨的闭式解决方案,确保在感知相似输入间保持解释的一致性。
- 通过 $OpenBox$ 框架研究非负性和稀疏性约束如何提升PLNNs中的可解释性。
- 展示 $OpenBox$ 在模型调试和对抗样本分析中的实际应用价值。
提出的方法
- 证明PLNN在数学上等价于一组局部线性分类器(LLCs),每个LLC对应输入空间中的一个凸多面体。
- 通过隐藏神经元的激活状态和权重矩阵,形式化PLNN到其等效LLCs的转换过程。
- 推导出计算每个LLC系数的闭式解,实现无需近似的精确高效解释。
- 利用每个LLC的决策特征(权重)解释其对应多面体内任意输入实例的预测结果。
- 将 $OpenBox$ 应用于分析非负性和稀疏性约束对PLNNs中特征选择与可解释性的影响。
- 通过模型劫持实验验证该方法,结果表明基于 $OpenBox$ 的解释能生成比LIME更有效的扰动。
实验结果
研究问题
- RQ1我们能否在不依赖局部近似或模型蒸馏的前提下,为预训练的PLNN提供精确且一致的解释?
- RQ2如何从数学上将PLNN表示为一组局部线性分类器,以实现闭式解释?
- RQ3在PLNNs中使用非负性和稀疏性约束是否能带来更合理且可解释的特征表示?
- RQ4与LIME等局部近似方法相比,$OpenBox$在模型劫持有效性方面的可解释性质量如何?
- RQ5$OpenBox$能否通过揭示真实决策特征,用于诊断和调试PLNNs中的误分类问题?
主要发现
- $OpenBox$ 通过将PLNN转换为等效的局部线性分类器集合,实现对PLNN的精确且一致的解释,且无近似误差。
- 该方法确保同一凸多面体内感知相似的输入获得完全相同的解释,消除了局部方法中常见的不一致性问题。
- 在合成数据集和真实世界数据集上,$OpenBox$ 在模型劫持任务中均优于LIME,以更少的特征修改次数实现了更高的平均预测概率变化(CPP)和更多的标签变化(NLCI)。
- 在FMNIST-1数据集上,$OpenBox$ 的优势尤为显著,因为LIME受近1.0或0.0预测概率导致的梯度信息不足而表现受限。
- 采用非负性和稀疏性约束训练的PLNN生成了更具意义的特征选择,显著提升了可解释性,这一结果由 $OpenBox$ 揭示。
- 案例研究显示,$OpenBox$ 能够准确诊断误分类问题,通过识别真实决策特征(如将毛衣误分类为大衣时突出显示衣领和肩部图案)揭示模型误判原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。