[论文解读] On the Symmetries of Deep Learning Models and their Internal Representations
本文引入了内同群(intertwiner groups)——一种与深度学习架构内在相关的对称性群——将模型架构与学习到的内部表征中的对称性联系起来。通过证明这些群能够实现有效的神经缝合与表征比较,本研究表明ReLU网络的对称性在隐藏表征中得以保持,从而为聚焦于激活基而非任意线性组合的可解释性分析提供了理论依据。
Symmetry is a fundamental tool in the exploration of a broad range of complex systems. In machine learning symmetry has been explored in both models and data. In this paper we seek to connect the symmetries arising from the architecture of a family of models with the symmetries of that family's internal representation of data. We do this by calculating a set of fundamental symmetry groups, which we call the intertwiner groups of the model. We connect intertwiner groups to a model's internal representations of data through a range of experiments that probe similarities between hidden states across models with the same architecture. Our work suggests that the symmetries of a network are propagated into the symmetries in that network's representation of data, providing us with a better understanding of how architecture affects the learning and prediction process. Finally, we speculate that for ReLU networks, the intertwiner groups may provide a justification for the common practice of concentrating model interpretability exploration on the activation basis in hidden layers rather than arbitrary linear combinations thereof.
研究动机与目标
- 形式化深度学习模型中架构对称性与其学习到的内部表征对称性之间的联系。
- 识别并表征与常见非线性单元(如ReLU和批归一化)相关联的基本对称性群——内同群。
- 证明这些内同群可用作连接具有相同架构但不同权重的两个模型时的最小有效缝合层。
- 开发对内同群变换不变的新型表征相似性度量,以改进跨模型隐藏表征的比较。
- 为聚焦于ReLU网络中激活基的可解释性分析提供理论与实证支持。
提出的方法
- 将内同群 $ G_{\sigma_n} $ 定义为与特定非线性激活函数 $ \sigma $ 及其维度 $ n $ 相关的对称群,该群在权重变换下保持模型函数空间不变。
- 在定理4.2中证明:当连接两个架构相同的网络时,内同群是保持预测准确性的最小可行缝合层。
- 在Myrtle CNN和ResNet20上设计并评估 $ G_{\text{ReLU}} $-受限的1×1卷积缝合层,与全线性缝合层比较准确率损失。
- 提出 $ G_{\text{ReLU}} $-Procrustes 与 $ G_{\text{ReLU}} $-CKA 两种对 $ G_{\text{ReLU}} $ 变换不变的表征相似性度量,类比正交Procrustes与CKA。
- 通过在旋转的表征基上进行网络解剖实验,评估可解释性的稳定性,以IoU为基础的语义检测性能作为度量。
- 训练并比较包含一个无ReLU的ResNet-50变体的模型,以研究激活函数在表征对称性与可解释性中的作用。
实验结果
研究问题
- RQ1深度学习模型中的架构对称性——特别是与ReLU等非线性单元相关的对称性——如何在数据的内部表征中体现?
- RQ2内同群能否用于构建最小缝合层,以在连接两个架构相同但权重不同的网络时保持模型准确率?
- RQ3与正交不变度量相比,$ G_{\text{ReLU}} $-不变相似性度量(如 $ G_{\text{ReLU}} $-CKA)在多大程度上能更准确地捕捉表征相似性?
- RQ4当表征基被旋转时,隐藏表征的可解释性是否保持稳定,特别是在ReLU模型中?
- RQ5为何激活基在可解释性研究中被普遍采用?内同群能否为此提供理论依据?
主要发现
- 仅使用 $ G_{\text{ReLU}} $-受限的1×1卷积对CIFAR-10上的两个ResNet20进行缝合,准确率损失最多约为10%,接近全线性缝合层的性能。
- $ G_{\text{ReLU}} $-不变相似性度量 $ G_{\text{ReLU}} $-Procrustes 与 $ G_{\text{ReLU}} $-CKA 在隐藏表征在 $ G_{\text{ReLU}} $ 变换下一致时达到最大值,相较于正交不变度量,为ReLU模型提供了更合适的度量标准。
- 网络解剖实验表明,当表征基从激活基旋转后,可解释单元(如物体与场景检测器)的比例上升,尤其在残差输出中无ReLU的模型中更为明显。
- 无ReLU残差输出的ResNet-50变体在ImageNet上达到76.1%的top-1准确率,表明即使移除关键对称性诱导非线性,此类模型仍保持有效性。
- 实证结果表明,独立训练的网络中的神经元并非彼此的简单置换,即使采用 $ G_{\text{ReLU}} $-基缝合,仍存在非零准确率差距,支持分布式与多义表征的存在。
- 内同群 $ G_{\text{ReLU}} $ 为为何基于激活的可解释性有效提供了理论基础,因其保持了ReLU网络的对称性,并与观察到的表征结构一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。