Skip to main content
QUICK REVIEW

[论文解读] Rethinking Evaluation Protocols of Visual Representations Learned via Self-supervised Learning

Jun Ho Lee, Do‐Young Yoon|arXiv (Cornell University)|Apr 7, 2023
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本文揭示了自监督视觉表征标准评估协议中的关键缺陷,表明线性探测(LP)和迁移学习(TL)性能对输入归一化和SSL权重衰减等超参数极为敏感。作者证明,在线性分类器前应用批量归一化以及采用最优的SSL权重衰减(0.04 → 0.2)可显著提升评估稳定性与迁移能力,揭示了当前指标未能检测到影响实际迁移性能的隐藏超参数依赖关系。

ABSTRACT

Linear probing (LP) (and $k$-NN) on the upstream dataset with labels (e.g., ImageNet) and transfer learning (TL) to various downstream datasets are commonly employed to evaluate the quality of visual representations learned via self-supervised learning (SSL). Although existing SSL methods have shown good performances under those evaluation protocols, we observe that the performances are very sensitive to the hyperparameters involved in LP and TL. We argue that this is an undesirable behavior since truly generic representations should be easily adapted to any other visual recognition task, i.e., the learned representations should be robust to the settings of LP and TL hyperparameters. In this work, we try to figure out the cause of performance sensitivity by conducting extensive experiments with state-of-the-art SSL methods. First, we find that input normalization for LP is crucial to eliminate performance variations according to the hyperparameters. Specifically, batch normalization before feeding inputs to a linear classifier considerably improves the stability of evaluation, and also resolves inconsistency of $k$-NN and LP metrics. Second, for TL, we demonstrate that a weight decay parameter in SSL significantly affects the transferability of learned representations, which cannot be identified by LP or $k$-NN evaluations on the upstream dataset. We believe that the findings of this study will be beneficial for the community by drawing attention to the shortcomings in the current SSL evaluation schemes and underscoring the need to reconsider them.

研究动机与目标

  • 探究为何自监督视觉表征的线性探测与迁移学习评估在不同超参数设置下表现出高度敏感性。
  • 识别当前评估协议中被忽视的因素,这些因素导致性能测量结果不一致且不稳定。
  • 证明输入归一化与SSL权重衰减是影响评估可靠性的关键隐藏超参数。
  • 倡导重新审视标准的SSL评估方案,以确保学习表征的鲁棒性与泛化能力。

提出的方法

  • 在LP与TL协议下,对最先进SSL模型进行广泛的跨超参数设置评估。
  • 在线性分类器前应用批量归一化,以评估其对性能稳定性及与k-NN指标一致性的影响。
  • 系统性地调整SSL预训练过程中的权重衰减超参数,并分析其对下游TL性能与收敛性的影响。
  • 使用二维可视化方法绘制损失曲面,比较不同SSL权重衰减设置下的泛化行为。
  • 采用中心化核对齐(CKA)度量微调前后表征的特征可重用性与迁移能力。
  • 对比不同SSL权重衰减值训练模型的验证损失曲线、损失曲面与CKA分数,以评估其鲁棒性与迁移能力。

实验结果

研究问题

  • RQ1为何在使用相同SSL模型的情况下,线性探测性能在不同超参数设置下仍存在显著差异?
  • RQ2输入归一化,特别是在线性头前应用批量归一化,能在多大程度上稳定LP与k-NN评估指标?
  • RQ3在SSL预训练过程中使用的权重衰减超参数如何影响迁移学习性能与超参数鲁棒性?
  • RQ4损失曲面分析能否揭示标准训练曲线中未显现的泛化性与鲁棒性差异?
  • RQ5通过CKA度量的特征可重用性是否与不同SSL权重衰减设置下的迁移能力提升相关?

主要发现

  • 在线性分类器前应用批量归一化可消除不同超参数设置下的性能波动,并解决LP与k-NN评估指标之间的不一致性。
  • SSL权重衰减超参数显著影响下游任务中的迁移能力,其中0.04 → 0.2的取值能产生最鲁棒且泛化能力最强的表征。
  • 采用0.04 → 0.2权重衰减的模型表现出更平坦的损失曲面,表明其具有更好的泛化能力与对下游超参数选择的鲁棒性。
  • CKA分析证实,使用0.04 → 0.2权重衰减预训练的模型在微调后,其早期至中期ViT块的表征具有更高的特征可重用性。
  • 尽管验证损失曲线相似,但采用更高SSL权重衰减(0.04 → 0.4)的模型收敛更快,但迁移能力更差,表明收敛速度本身并非迁移能力的可靠代理指标。
  • 本研究揭示,标准评估协议(LP与k-NN)未能检测到SSL权重衰减对下游性能的影响,暴露了当前评估方案中的关键缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。