[论文解读] YASENN: Explaining Neural Networks via Partitioning Activation Sequences
YASENN 是一种针对前馈神经网络的模型特定解释方法,通过逐层梯度提升决策树将激活序列划分为离散流。它将输入编码为树叶节点索引序列,使下游模型(如逻辑回归)能够进行可解释性分析,并揭示细微的决策模式(如对负面术语缺失的依赖),同时保持较低的计算成本和确定性训练。
We introduce a novel approach to feed-forward neural network interpretation based on partitioning the space of sequences of neuron activations. In line with this approach, we propose a model-specific interpretation method, called YASENN. Our method inherits many advantages of model-agnostic distillation, such as an ability to focus on the particular input region and to express an explanation in terms of features different from those observed by a neural network. Moreover, examination of distillation error makes the method applicable to the problems with low tolerance to interpretation mistakes. Technically, YASENN distills the network with an ensemble of layer-wise gradient boosting decision trees and encodes the sequences of neuron activations with leaf indices. The finite number of unique codes induces a partitioning of the input space. Each partition may be described in a variety of ways, including examination of an interpretable model (e.g. a logistic regression or a decision tree) trained to discriminate between objects of those partitions. Our experiments provide an intuition behind the method and demonstrate revealed artifacts in neural network decision making.
研究动机与目标
- 为医疗、金融和自动驾驶系统等高风险领域中对可解释深度学习的迫切需求提供支持,这些领域要求模型透明度具有法律和伦理意义。
- 克服现有解释方法的局限性——如基于梯度方法的不稳定性、模型无关方法缺乏模型特定洞察,以及内在可解释网络的架构限制。
- 开发一种利用神经网络内部机制以实现更准确和可信解释的方法,同时对网络架构保持无偏见。
- 即使在对解释错误容忍度极低的场景(如监管或安全关键应用)中,也能提供有意图的、人类可理解的解释。
- 通过激活序列的结构化划分,系统性地分析和描述神经网络中的决策模式。
提出的方法
- YASENN 使用逐层梯度提升决策树的集成方法蒸馏已训练的神经网络,其中每棵树对应一个隐藏层,并以该层的神经元激活作为输入。
- 对于每个输入样本,该方法收集所有树的叶子节点索引序列,形成唯一的编码,将输入空间划分为离散流或聚类。
- 由于唯一编码的数量有限,从而在输入空间中诱导出离散划分,每个划分对应于各层上不同的激活模式。
- 然后使用人类可理解的模型(如逻辑回归或决策树)对每个划分(编码)进行分析,训练其以区分不同划分中的样本。
- 该方法可通过分析蒸馏误差并优化编码选择,支持对特征空间修改和低容错解释任务的扩展。
- 由于使用了梯度提升树,该方法具有确定性和高效性,避免了其他蒸馏或基于采样的方法中常见的随机性。
实验结果
研究问题
- RQ1将激活序列空间划分为离散且可解释的流,是否能揭示神经网络决策中有意义且人类可理解的模式?
- RQ2与模型无关方法相比,YASENN 的模型特定蒸馏方法在保真度、稳定性和可解释性方面表现如何?
- RQ3YASENN 在多大程度上能够检测并解释细微的决策模式,如对负面术语缺失的依赖而非对正面术语存在的依赖?
- RQ4YASENN 是否能有效应用于多种数据类型和任务(包括表格数据和序列数据),且无需架构约束?
- RQ5在对解释错误容忍度极低的场景下,该方法表现如何?是否可通过引入误差感知的优化机制进一步增强?
主要发现
- YASENN 在文本分类任务中成功识别出两种不同的流,尽管模型对正类预测概率较高,但其底层推理机制不同:一种依赖于正面词汇的存在,另一种依赖于负面词汇的缺失。
- 该方法揭示,网络在某一路径上的决策并非基于显式的正面情感,而是基于负面术语的缺失,暗示其决策逻辑可能存在脆弱性。
- 在单一流上训练的一对多逻辑回归模型分别获得了 0.95 和 0.89 的 AUC 分数,证实了划分后的流具有判别性和意义。
- 由于蒸馏过程本身具有正则化作用,该方法对噪声具有鲁棒性,并能适应修改后的输入流形。
- YASENN 的确定性训练和决策树的使用实现了快速、可复现且低复杂度的解释,同时未牺牲模型特定的洞察力。
- 该方法揭示,不同层之间的激活模式可能导致相同的预测结果,强调了分析完整激活序列而非仅最终输出的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。