Skip to main content
QUICK REVIEW

[论文解读] Weighted Ensemble Self-Supervised Learning

Yangjun Ruan, Saurabh Singh|arXiv (Cornell University)|Nov 18, 2022
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

该论文提出了一种轻量级、高效的集成方法用于自监督学习(SSL),在不修改表示主干网络的前提下,对多个投影头应用数据相关的加权交叉熵损失。通过基于不确定度或多样性动态调整集成头的权重,该方法提升了下游性能,尤其是在少样本设置下,相较于在 ImageNet-1K 上使用 DINO 和 MSN 的 SOTA 方法,1-shot 学习下准确率提升了 3.9 个百分点。

ABSTRACT

Ensembling has proven to be a powerful technique for boosting model performance, uncertainty estimation, and robustness in supervised learning. Advances in self-supervised learning (SSL) enable leveraging large unlabeled corpora for state-of-the-art few-shot and supervised learning performance. In this paper, we explore how ensemble methods can improve recent SSL techniques by developing a framework that permits data-dependent weighted cross-entropy losses. We refrain from ensembling the representation backbone; this choice yields an efficient ensemble method that incurs a small training cost and requires no architectural changes or computational overhead to downstream evaluation. The effectiveness of our method is demonstrated with two state-of-the-art SSL methods, DINO (Caron et al., 2021) and MSN (Assran et al., 2022). Our method outperforms both in multiple evaluation metrics on ImageNet-1K, particularly in the few-shot setting. We explore several weighting schemes and find that those which increase the diversity of ensemble heads lead to better downstream evaluation results. Thorough experiments yield improved prior art baselines which our method still surpasses; e.g., our overall improvement with MSN ViT-B/16 is 3.9 p.p. for 1-shot learning.

研究动机与目标

  • 通过一种无需修改表示主干网络架构的高效集成方法,提升自监督学习性能。
  • 通过引入针对集成头的数据相关加权方案,解决集成在 SSL 中尚未被充分探索的潜力。
  • 证明通过自适应加权提升集成多样性可带来更好的下游泛化性能。
  • 在训练和推理开销极低的前提下,尤其在低数据场景(如少样本学习)中实现显著性能提升。

提出的方法

  • 构建了一个框架,训练多个独立的投影头(集成成员)与共享的表示编码器并行,且不修改主干网络。
  • 提出了一类加权交叉熵损失,其中集成头的权重基于教师模型预测结果动态分配(例如,基于熵、方差或概率的加权)。
  • 使用未归一化的交叉熵和未归一化的 KL 散度推导损失函数,确保其联合凸性与可微性,从而实现稳定训练。
  • 采用基于熵的加权(Ent)和基于方差的加权,优先处理不确定或多样化的预测,增强模型鲁棒性。
  • 仅在训练阶段使用集成;推理时仅使用单个表示编码器,无运行时开销。
  • 采用加权损失函数:$\mathcal{L}^{\text{Ent}}_n(\theta) = \frac{1}{n}\sum_x \sum_i \text{softmax}_i(-\frac{1}{\gamma}\mathsf{H}[t_{i'}(Y|x)]) \cdot \mathsf{H}^\times[t_i(Y|x), s(Y|\theta_i,x)]$,其中重点关注高熵教师预测。

实验结果

研究问题

  • RQ1是否可以在不增加推理成本或修改表示主干网络的前提下,通过集成提升自监督学习性能?
  • RQ2针对集成头的不同数据相关加权方案如何影响模型多样性与下游性能?
  • RQ3通过自适应加权提升集成多样性是否能带来更好的泛化性能,尤其是在少样本学习中?
  • RQ4当应用于 DINO 和 MSN 时,该方法是否能超越当前 SOTA 的 SSL 基线?
  • RQ5熵、均匀和基于概率的加权方案对表示质量与不确定性估计有何影响?

主要发现

  • 该方法在 ImageNet-1K 上的 1-shot 线性评估中,相较于 MSN ViT-B/16 提升了 3.9 个百分点,显著优于之前的 SOTA 基线。
  • 采用基于熵的加权(Ent)的集成性能最佳,表明基于不确定性的加权可增强模型多样性与泛化能力。
  • 该方法在 DINO 上的 1-shot 学习中性能最高提升达 7.5 个百分点,且在 1-、2- 和 5-shot 设置下均保持一致增益。
  • 消融实验表明,促进多样性的加权方案(如 Ent、Var)比均匀或基于概率的加权带来更好的下游结果。
  • 该框架在极低训练成本和零推理开销下实现性能提升,因为推理时仅使用单一表示编码器。
  • 即使在基线方法通过标准技术改进后,该方法仍超越先前的 SOTA,表明集成机制本身具有显著有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。