Skip to main content
QUICK REVIEW

[论文解读] A Measure of the Complexity of Neural Representations based on Partial Information Decomposition

David A. Ehrlich, Andreas C. Schneider|arXiv (Cornell University)|Sep 21, 2022
Neural Networks and Applications被引用 12
一句话总结

本文提出表征复杂度(representational complexity),这是一种基于部分信息分解(Partial Information Decomposition, PID)的新颖信息论度量,用于量化在深度神经网络中,分布在多个神经元之间的任务相关信息的访问难度。该方法解耦了冗余、唯一和协同的信息贡献,表明在量化MNIST和CIFAR10网络中,表征复杂度随网络层加深和训练过程而降低,为分析神经表征结构提供了一种有理论依据且可解释的工具。

ABSTRACT

In neural networks, task-relevant information is represented jointly by groups of neurons. However, the specific way in which this mutual information about the classification label is distributed among the individual neurons is not well understood: While parts of it may only be obtainable from specific single neurons, other parts are carried redundantly or synergistically by multiple neurons. We show how Partial Information Decomposition (PID), a recent extension of information theory, can disentangle these different contributions. From this, we introduce the measure of "Representational Complexity", which quantifies the difficulty of accessing information spread across multiple neurons. We show how this complexity is directly computable for smaller layers. For larger layers, we propose subsampling and coarse-graining procedures and prove corresponding bounds on the latter. Empirically, for quantized deep neural networks solving the MNIST and CIFAR10 tasks, we observe that representational complexity decreases both through successive hidden layers and over training, and compare the results to related measures. Overall, we propose representational complexity as a principled and interpretable summary statistic for analyzing the structure and evolution of neural representations and complex systems in general.

研究动机与目标

  • 为解决当前缺乏有理论依据且可解释的度量方法来量化分类标签信息在深层神经网络中神经元之间的分布问题。
  • 开发一种基于部分信息分解(PID)的方法,以解耦神经活动对任务相关信息的冗余、唯一和协同贡献。
  • 提出一种可计算且可解释的度量——表征复杂度,用于捕捉访问某条信息平均所需的神经元数量。
  • 通过子采样和粗粒化方法实现对大规模神经网络的分析,并提供理论保证。
  • 展示表征复杂度在追踪训练过程中和不同网络层间神经表征变化方面的实用性。

提出的方法

  • 使用部分信息分解(PID)将分类标签与神经激活之间的互信息分解为非重叠的组成部分:唯一贡献、冗余贡献和协同贡献。
  • 将表征复杂度定义为访问某条信息平均所需的神经元数量,该定义基于PID的组成部分及其协同水平。
  • 应用子采样和粗粒化技术以扩展方法至更大规模的网络层,并为粗粒化过程提供了理论保证。
  • 采用理论严谨、测度论上定义良好的协同项PID估计器,使该方法可应用于量化权重的网络。
  • 使用nninfo Python工具包计算并复现MNIST和CIFAR10模型(量化权重)的结果。
  • 同时分析整体表征复杂度及其按类别的演化,实现对表征动态的细粒度解释。

实验结果

研究问题

  • RQ1在深层神经网络中,关于分类标签的任务相关信息在神经元之间如何分布——具体而言,冗余、唯一和协同贡献各占多大比例?
  • RQ2访问给定信息平均需要多少神经元?该数值在不同网络层之间以及训练过程中如何变化?
  • RQ3表征复杂度能否高效计算于大规模神经网络层?子采样和粗粒化等近似方法具有哪些理论保证?
  • RQ4表征复杂度与现有神经网络表征结构度量相比表现如何?
  • RQ5某些类别是否表现出更高的或更低的表征复杂度?该复杂度在训练过程中的演化速率是否因类别而异?

主要发现

  • 在量化MNIST和CIFAR10网络中,表征复杂度随隐藏层逐层递减,表明信息访问效率逐步提高。
  • 表征复杂度在训练过程中持续降低,表明网络向更高效、更低复杂度的任务相关表征演化。
  • 所提出的子采样和粗粒化方法提供了表征复杂度的可靠近似,且具有理论保证,使该方法可应用于大规模网络。
  • 该方法揭示信息通过唯一、冗余和协同贡献的混合方式分布在神经元之间,其中协同作用在复杂表征中起关键作用。
  • 表征复杂度可按类别计算,结果表明某些类别的表征复杂度高于其他类别,且训练过程中的复杂度降低并非在所有类别中均匀发生。
  • 该度量具有可解释性,且基于信息论,为神经网络分析提供了一种有理论依据的替代方案,优于人为设定的稀疏性或复杂度度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。