[论文解读] Do Self-Supervised and Supervised Methods Learn Similar Visual Representations?
该论文使用中心化核对齐(CKA)方法,在ResNet-50模型上对比了CIFAR-10数据集上自监督(SimCLR)与有监督学习的表示。结果表明,尽管中间层表示相似,但最终层表示出现显著差异:SimCLR学习到了数据增强的不变性,而有监督学习则拟合了类别结构。关键洞见是,SimCLR的成功源于类别信息丰富的中间特征,而非最终层的相似性。
Despite the success of a number of recent techniques for visual self-supervised deep learning, there has been limited investigation into the representations that are ultimately learned. By leveraging recent advances in the comparison of neural representations, we explore in this direction by comparing a contrastive self-supervised algorithm to supervision for simple image data in a common architecture. We find that the methods learn similar intermediate representations through dissimilar means, and that the representations diverge rapidly in the final few layers. We investigate this divergence, finding that these layers strongly fit to their distinct learning objectives. We also find that the contrastive objective implicitly fits the supervised objective in intermediate layers, but that the reverse is not true. Our work particularly highlights the importance of the learned intermediate representations, and raises critical questions for auxiliary task design.
研究动机与目标
- 探究自监督与有监督学习方法是否在全网络深度上学习到相似的视觉表示。
- 分析对比自监督与有监督训练中,表示在不同网络深度上发散的方式与原因。
- 评估自监督学习的成功是否源于最终表示的结构相似性,或源于共享的中间特征。
- 检查两种方法中对数据增强不变性与类别结构的隐式学习情况。
提出的方法
- 使用中心化核对齐(CKA)比较通过SimCLR(自监督)和有监督学习训练的ResNet-50各层表示的相似性。
- 采用线性探测器测量每层的类别线性可分性,评估下游表示质量。
- 通过计算每层上原始样本与增强样本表示之间的CKA,衡量增强不变性。
- 通过比较学习表示与真实类别单纯形结构之间的CKA,评估其与类别标签的对齐程度。
- 采用多种随机权重初始化,验证解的稳定性,避免初始化偏差对比较结果的影响。
- 分别分析奇数层与偶数层,以检测表示学习中的结构不对称性。
实验结果
研究问题
- RQ1自监督与有监督方法在全网络深度上是否学习到相似的视觉表示?
- RQ2SimCLR与有监督学习在最终层的表示在多大程度上发散?原因是什么?
- RQ3有监督学习是否隐式学习到增强不变性?还是SimCLR唯一捕捉到该特性?
- RQ4在类别信息量与结构相似性方面,中间表示如何比较?
- RQ5SimCLR的性能是源于最终层的相似性,还是源于共享的中间特征学习?
主要发现
- 残差连接后的表示在SimCLR与有监督学习之间相似,但残差块内部(残差层)的表示则不相似,表明优化路径不同。
- 初始残差层的表示相似,表明两种方法均学习到了共享的低级特征。
- 最终层迅速发散:SimCLR表现出强烈的增强不变性,而有监督学习则拟合类别结构,CKA与线性探测准确率结果均证实此现象。
- 有监督学习并未隐式学习到增强不变性,但若显式学习对SimCLR增强的不变性,则可诱导出更好的类别可分性。
- 表示结构在最终层迅速发散,表明SimCLR的成功源于类别信息丰富的中间特征,而非最终层的一致性。
- 类别结构对齐度在两种方法中均单调上升,但在有监督学习的最后块组中急剧加速,因其显式优化了该目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。