[论文解读] Neural Activation Patterns (NAPs): Visual Explainability of Learned Concepts
本文提出了神经激活模式(NAPs),一种通过聚类神经元的完整激活分布而非仅关注高激活值,来识别深度神经网络中层级概念的方法。通过将具有相似多单元激活特征的输入分组,NAPs 揭示了复杂且分布式的概念,补充了现有的单元级可解释性技术,实现了对多种架构和数据集下学习表征的可视化内省。
A key to deciphering the inner workings of neural networks is understanding what a model has learned. Promising methods for discovering learned features are based on analyzing activation values, whereby current techniques focus on analyzing high activation values to reveal interesting features on a neuron level. However, analyzing high activation values limits layer-level concept discovery. We present a method that instead takes into account the entire activation distribution. By extracting similar activation profiles within the high-dimensional activation space of a neural network layer, we find groups of inputs that are treated similarly. These input groups represent neural activation patterns (NAPs) and can be used to visualize and interpret learned layer concepts. We release a framework with which NAPs can be extracted from pre-trained models and provide a visual introspection tool that can be used to analyze NAPs. We tested our method with a variety of networks and show how it complements existing methods for analyzing neural network activation values.
研究动机与目标
- 解决现有可解释性方法仅关注高激活值的局限性,揭示神经网络层中被忽略的复杂、分布式概念。
- 开发一种通过分析神经元间激活值的完整分布而非单个单元,来识别层级概念的方法。
- 通过提取并展示预训练模型中的 NAPs,构建一个框架以实现对学习表征的可视化与交互式解释。
- 通过识别层级上一致或差异化的概念表征,促进不同架构之间的模型比较。
- 补充现有的可解释性工具(如特征可视化和激活最大化),提供对多单元交互和分布式表征更敏感的方法。
提出的方法
- 将一组输入通过预训练的神经网络,从目标层提取激活向量。
- 对每个单元的激活值进行归一化,以确保每个神经元在聚类过程中贡献相等。
- 应用聚类算法(例如 k-means 或层次聚类),根据层中所有单元的完整激活特征相似性对输入进行分组。
- 将每个聚类(即 NAP)与对应的输入图像、预测结果和标签关联,以支持可视化解释。
- 开发一个交互式可视化界面,用于探索 NAPs,包括输入图像、激活分布和预测元数据。
- 将该方法扩展至多种网络架构(如 ResNet50、Inception V3)和数据类型(如 MNIST、ImageNet),以证明其通用性。
实验结果
研究问题
- RQ1通过聚类神经元间的完整激活分布,能否揭示出高激活值方法所遗漏的、有意义且可解释的层级概念?
- RQ2在不同神经网络架构中,NAPs 在概念一致性与表征多样性方面有何表现?
- RQ3通过激活聚类的可视化检查,NAPs 在多大程度上能揭示训练数据中的偏见或性能问题?
- RQ4NAPs 是否可用于识别和可视化跨多层的层次化概念学习,例如从简单特征中逐步演化出复杂特征(如“硫磺蝶”)?
- RQ5将 NAPs 与显著性方法结合后,能否提升对哪些输入特征驱动特定 NAPs 的可解释性?
主要发现
- NAPs 通过聚类完整的激活特征,成功识别出层级概念,揭示了特征可视化或最大激活方法无法捕捉的复杂、分布式表征。
- 该方法在不同架构中表现出一致的概念发现能力——例如,Inception V3 和 ResNet50 在“硫磺蝶”等高层级概念上显示出相似的 NAPs,表明不同架构在表征学习上趋于收敛。
- NAPs 能够通过揭示具有相似激活模式但预测错误的输入聚类,检测出模型的弱点,如偏见或泛化能力不足。
- 该框架通过可视化和对比不同架构的 NAPs,支持模型间的比较,揭示了概念表征在不同架构中的共识与差异。
- NAPs 为现有可解释性工具提供了互补视角,尤其在捕捉神经元间相互依赖关系方面具有优势,而这些关系在单独分析单个单元时是不可见的。
- 作者发布了公开框架与交互式可视化工具,支持在多种数据集和网络类型上对预训练模型中的 NAPs 进行可复现的提取与分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。