Skip to main content
QUICK REVIEW

[论文解读] Visualizing Deep Neural Networks for Speech Recognition with Learned Topographic Filter Maps

Andreas Krug, Sebastian Stober|arXiv (Cornell University)|Dec 6, 2019
Neural Networks and Applications参考文献 6被引用 4
一句话总结

本文通过在训练过程中强制相邻滤波器之间的空间相似性,提出在深度神经网络中学习拓扑滤波器图,从而以拓扑图的形式更直观地可视化神经元激活。主要贡献在于揭示了音素响应神经元并非局限于单一区域,而是分布在多个区域,尽管视觉直观性有所提升,但这种分布性限制了可解释性。

ABSTRACT

The uninformative ordering of artificial neurons in Deep Neural Networks complicates visualizing activations in deeper layers. This is one reason why the internal structure of such models is very unintuitive. In neuroscience, activity of real brains can be visualized by highlighting active regions. Inspired by those techniques, we train a convolutional speech recognition model, where filters are arranged in a 2D grid and neighboring filters are similar to each other. We show, how those topographic filter maps visualize artificial neuron activations more intuitively. Moreover, we investigate, whether this causes phoneme-responsive neurons to be grouped in certain regions of the topographic map.

研究动机与目标

  • 为解决深度神经网络层中神经元顺序不直观、排列杂乱的问题,该问题阻碍了对激活模式的视觉解读。
  • 将神经科学启发的拓扑映射技术(常用于EEG)应用于人工神经网络激活的更直观可视化。
  • 探究音素响应神经元是否在学习到的二维滤波器图中特定区域聚集,以判断是否存在功能组织。
  • 评估拓扑结构是否可通过优化输入生成,实现更可解释的特征可视化。

提出的方法

  • 为每个卷积层定义一个二维网格(例如,256个滤波器对应16×16,2048个滤波器对应64×32),以在滤波器上施加空间结构。
  • 应用正则化损失,以鼓励每个滤波器与其3×3邻域内邻居的相似性,权重基于到中心点的反向欧氏距离。
  • 通过最小化邻近滤波器权重之间的余弦相似性来约束,以促进拓扑组织,同时保持模型性能。
  • 使用梯度调整的神经元激活轮廓(GradNAPs)对同一音素或音位组的输入激活进行平均,并进行基线归一化。
  • 针对最敏感的3×3区域,使用激活最大化方法(Yosinski et al., 2015)生成最优输入,分别针对单个滤波器和联合邻域。
  • 通过非步长3×3平均池化操作生成平滑的拓扑图,以提升激活模式的视觉可解释性。

实验结果

研究问题

  • RQ1在深度语音识别网络中,音素响应神经元是否在学习到的二维滤波器图中特定区域聚集?
  • RQ2与标准的无序层可视化相比,拓扑滤波器图是否能提升人工神经元激活的视觉可解释性?
  • RQ3音素的分布式表征在拓扑图中跨多个区域在多大程度上得以保持?
  • RQ4针对最敏感区域优化输入是否能产生可解释的、具有音素特异性的模式?

主要发现

  • 音素响应神经元并非局限于单一区域,而是分布在拓扑图的多个区域,表明其为分布式表征。
  • 通过GradNAPs识别出的最敏感区域通常会遗漏完整分布式表征的其他部分,因为其他区域对同一音素也表现出强烈激活。
  • 在网格上直接可视化激活会导致非平滑、难以解读的模式,而对3×3窗口进行平均池化可生成视觉上连贯的拓扑图。
  • 针对最敏感区域中单个滤波器优化输入,无法揭示清晰的音素典型模式,表明表征并非局限于单个滤波器或小簇。
  • 当前的拓扑正则化策略未充分强制表征稀疏性,导致特征仍广泛分布在图的多个区域。
  • 研究结论认为,尽管拓扑图提升了视觉直观性,但仍需更强的正则化(可能作用于激活或引入全局相似性惩罚)以实现局部化、可解释的特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。