[论文解读] Under the Hood of Neural Networks: Characterizing Learned Representations by Functional Neuron Populations and Network Ablations
本文通过分析功能神经元群体和网络剪枝,研究神经网络的可解释性,以揭示学习表征的结构与分布方式。研究发现,特定类别的表征集中在不同的神经元群中,且对剪枝的鲁棒性因类别和特征类型而异;同时发现单一指标无法完全捕捉神经元的重要性,强调在可解释性和迁移学习中需采用多维度分析方法。
The need for more transparency of the decision-making processes in artificial neural networks steadily increases driven by their applications in safety critical and ethically challenging domains such as autonomous driving or medical diagnostics. We address today's lack of transparency of neural networks and shed light on the roles of single neurons and groups of neurons within the network fulfilling a learned task. Inspired by research in the field of neuroscience, we characterize the learned representations by activation patterns and network ablations, revealing functional neuron populations that a) act jointly in response to specific stimuli or b) have similar impact on the network's performance after being ablated. We find that neither a neuron's magnitude or selectivity of activation, nor its impact on network performance are sufficient stand-alone indicators for its importance for the overall task. We argue that such indicators are essential for future advances in transfer learning and modern neuroscience.
研究动机与目标
- 为了提高深度神经网络的透明度,特别是在医疗诊断和自动驾驶等安全关键应用中。
- 为了解决目前对单个神经元及其群体如何贡献于学习表征与网络性能的理解不足问题。
- 探究神经元选择性、激活幅度或剪枝影响是否能单独预测分类任务中的功能重要性。
- 探索人工神经网络组织结构与生物神经系统的类比,特别是功能神经元群体结构方面的相似性。
- 通过识别深度网络中知识表征的结构原则,为未来迁移学习与神经科学的发展提供依据。
提出的方法
- 在不同图像分类数据集上训练了三个神经网络(F-Net、M-Net、K-Net),以研究表征在各层中的演化过程。
- 通过分析特定输入下的神经元激活模式,识别出对刺激具有共同响应的功能神经元群体。
- 通过系统性地移除单个神经元并测量其对各类分类准确率的影响,执行网络剪枝。
- 使用UMAP嵌入可视化各层之间的激活空间可分性,以追踪网络深度下类别区分度的变化。
- 通过统计对特定类别响应最强的神经元数量来量化神经元选择性,并将其与基于UMAP的类别可分性(NH-score)进行相关性分析。
- 使用皮尔逊相关系数评估神经元选择性、剪枝影响与嵌入空间中类别可分性之间的关系。
实验结果
研究问题
- RQ1在训练好的神经网络中,特定类别的表征在各层和神经元群体中如何分布?
- RQ2神经元激活幅度与选择性在多大程度上能预测其在分类任务中的功能重要性?
- RQ3对单个神经元进行剪枝如何影响网络激活空间中的类别可分性?
- RQ4类别选择性神经元的数量与激活空间中类别可分性的程度之间存在何种关系?
- RQ5能否识别出在响应特定输入时协同作用的功能神经元群体?这些群体的大小在不同类别间如何变化?
主要发现
- 随着表征在网络深层逐步推进,类别特定的表征在激活空间中变得更加清晰且可分性更高。
- 早期层的网络剪枝对激活空间可分性影响甚微,但后期层的剪枝显著降低了可分性,导致类别重叠与误分类。
- 在F-Net中,类别选择性神经元数量与类别可分性(NH-score)之间存在显著正相关(r = 0.61, p = 0.06),但在M-Net和K-Net中未观察到此关系。
- 在F-Net中,剪枝影响最大的神经元与NH-score之间存在显著正相关(r = 0.68, p = 0.03),表明对性能最关键的神经元与更好的类别可分性密切相关。
- 单一指标(如激活幅度、选择性或剪枝影响)无法可靠预测神经元的功能重要性,表明需结合多种指标才能实现全面可解释性。
- 功能神经元群体的大小因在表征特定类别中的角色而显著不同,表明网络容量需求取决于类别特定的属性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。