[论文解读] Grounding Representation Similarity with Statistical Testing
本文提出了一种统计检验框架,用于评估神经网络中表示相似性度量的性能,通过检验其对功能变化的敏感性以及对无关噪声的特异性。研究发现,广泛使用的度量方法如CKA和CCA在关键基准测试中表现不佳,而经典的正交普鲁斯特距离(Orthogonal Procrustes distance)在多种功能行为下均表现稳健,凸显了系统性评估相较于直觉驱动的度量选择的重要性。
To understand neural network behavior, recent works quantitatively compare different networks' learned representations using canonical correlation analysis (CCA), centered kernel alignment (CKA), and other dissimilarity measures. Unfortunately, these widely used measures often disagree on fundamental observations, such as whether deep networks differing only in random initialization learn similar representations. These disagreements raise the question: which, if any, of these dissimilarity measures should we believe? We provide a framework to ground this question through a concrete test: measures should have sensitivity to changes that affect functional behavior, and specificity against changes that do not. We quantify this through a variety of functional behaviors including probing accuracy and robustness to distribution shift, and examine changes such as varying random initialization and deleting principal components. We find that current metrics exhibit different weaknesses, note that a classical baseline performs surprisingly well, and highlight settings where all metrics appear to fail, thus providing a challenge set for further improvement.
研究动机与目标
- 为解决如CKA和CCA等表示相似性度量之间缺乏共识的问题,这些度量在基本比较中常常产生分歧。
- 建立正式标准——对功能变化的敏感性与对噪声的特异性——以评估这些度量。
- 通过探测准确率和分布外(OOD)鲁棒性等功能行为,构建一个全面的基准,以确立真实度量性能的基准。
- 识别所有度量均表现不优于随机猜测的系统性失败案例,为未来度量开发提供挑战集。
- 倡导系统性评估,反对基于直觉的度量选择,以对抗偏好新方法而忽视经典基线的近期性偏差。
提出的方法
- 将表示相似性定义为一个分类问题:判断两种表示在功能上是否相似或不同。
- 采用统计检验原则:度量应能敏感地检测影响模型行为的变化,并能特异性地忽略如随机初始化等不重要变化。
- 构建一个包含30,480个样本的基准,涵盖随机种子、层深度和低秩近似等变量。
- 通过探测准确率(句法信息)和分布外(OOD)性能来测量功能行为。
- 通过度量与实测功能差异的等级相关性进行评分,利用分布内表示预测分布外行为。
- 评估五种度量:CKA、CCA、PWCCA、正交普鲁斯特距离和向量空间对齐,重点关注其对主成分删除和随机初始化的敏感性。
实验结果
研究问题
- RQ1广泛使用的表示相似性度量(如CKA和CCA)是否能可靠检测影响功能行为的变化?
- RQ2这些度量是否具备足够的特异性,能够忽略如随机权重初始化等无关变化?
- RQ3表示相似性度量能否仅基于分布内表示预测分布外性能?
- RQ4是否存在所有度量均表现不优于随机猜测的系统性失败案例?
- RQ5经典度量如正交普鲁斯特距离是否在真实基准中优于现代替代方法?
主要发现
- CCA缺乏特异性:它会因随机初始化噪声而检测到虚假的相似性,甚至将相距较远的层也视为相似。
- CKA缺乏敏感性:它仅在前10个主成分中能检测到有意义的变化,无法捕捉中等大小的差异。
- 正交普鲁斯特距离在探测准确率和OOD性能基准中始终表现良好,优于CKA和CCA。
- 识别出一个挑战集,其中没有任何度量的OOD性能预测优于随机猜测,凸显了当前度量能力的关键缺口。
- 经典正交普鲁斯特距离表现出出人意料的强基线性能,提示新方法未必总是优于成熟方法。
- 表示相似性度量通常与功能差异不具相关性,尤其在信号-噪声比低的场景(如数值压力测试)下更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。