[论文解读] Representation Topology Divergence: A Method for Comparing Neural Network Representations
该论文提出表示拓扑差异(RTD),一种通过测量具有一一对应关系的两个点云在多尺度下的拓扑不相似性,来比较神经网络表征的新方法,即使这些点云嵌入在不同的环境空间中。RTD在捕捉结构差异方面优于CKA、SVCCA和IMD,与模型预测不一致具有强相关性,并对聚类和空洞等拓扑特征敏感。
Comparison of data representations is a complex multi-aspect problem that has not enjoyed a complete solution yet. We propose a method for comparing two data representations. We introduce the Representation Topology Divergence (RTD), measuring the dissimilarity in multi-scale topology between two point clouds of equal size with a one-to-one correspondence between points. The data point clouds are allowed to lie in different ambient spaces. The RTD is one of the few TDA-based practical methods applicable to real machine learning datasets. Experiments show that the proposed RTD agrees with the intuitive assessment of data representation similarity and is sensitive to its topological structure. We apply RTD to gain insights on neural networks representations in computer vision and NLP domains for various problems: training dynamics analysis, data distribution shift, transfer learning, ensemble learning, disentanglement assessment.
研究动机与目标
- 为解决缺乏一种基于原理、具有拓扑意识的神经网络表征比较方法的问题,该方法不依赖下游任务性能。
- 开发一种对学习表征中的结构差异(如聚类、空洞和腔体)敏感的度量方法。
- 提供一种基于拓扑数据分析(TDA)的实用且可扩展的方法,适用于视觉和自然语言处理中的真实世界机器学习数据集。
- 在训练动态、分布偏移、迁移学习和表征解耦等多种场景下评估RTD。
提出的方法
- 该方法从两个具有一一对应关系的点云P和P̃构建R-交叉条形码(R-Cross-Barcode),以表示其在多个尺度下共享的拓扑特征。
- 使用持久同调(persistent homology)追踪在一系列距离阈值范围内变化的拓扑特征(如连通分量、环路、空洞)。
- 表示拓扑差异(RTD)得分通过计算R-交叉条形码向量之间差值的L2范数得出,量化了拓扑不相似性。
- 该方法对线性变换保持不变,但对非线性拓扑结构敏感,与基于CCA的方法不同。
- 允许点云位于不同的环境空间中,克服了先前拓扑比较方法的关键局限。
- 该方法实现高效且已开源,可应用于真实世界的深度学习基准测试。
实验结果
研究问题
- RQ1如何在不依赖线性或核方法相似性的情况下,比较神经网络表征,以捕捉其潜在的拓扑结构(如聚类和空洞)?
- RQ2RTD在多大程度上与人类或基于模型的表征相似性直觉相关,特别是在表征在结构上不同但线性相关性相似的情况下?
- RQ3RTD能否检测到训练过程、数据分布偏移或微调过程中表征拓扑结构的有意义变化,而其他度量方法无法捕捉?
- RQ4在生成模型的解耦性评估中,RTD的表现如何,特别是在沿可解释方向与随机方向比较潜在空间切片时?
- RQ5在视觉和自然语言处理任务中,RTD是否优于CKA、SVCCA和IMD等成熟度量,更好地捕捉表征的结构差异?
主要发现
- RTD与模型预测不一致具有高度相关性,表明其捕捉了影响泛化能力的表征中真正有意义的差异。
- 在训练动态分析中,RTD揭示了CKA无法捕捉的表征结构变化,例如空洞等拓扑特征的出现。
- 在CIFAR-100到CIFAR-10的微调任务中,RTD在检测表征偏移方面优于CKA、SVCCA和IMD。
- 在dSprites数据集的解耦性评估中,RTD在可解释因子(如形状、位置)方向上的差异性显著低于随机方向,证实其对有意义因子的敏感性。
- 在ResNet-50和ConvNeXt-tiny的逐层分析中,RTD比CKA或SVCCA更好地揭示了网络的模块化结构,凸显了架构设计在表征拓扑中的体现。
- 当应用于UMAP降维后的MNIST数据时,RTD在CKA类指标上表现较差,表明其捕捉到了线性或RBF-based CKA所忽略的拓扑不一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。