[论文解读] BYOL works even without batch statistics
该论文表明,批量归一化(BN)对于自监督对比学习方法BYOL学习有效表征并非必要,因为BYOL在使用组归一化(GN)和权重标准化(WS)时,无需依赖批量统计信息,即可在ImageNet上达到73.9%的top-1准确率。结果反驳了BN通过梯度流产生隐式对比项以防止表征坍缩的假设。
Bootstrap Your Own Latent (BYOL) is a self-supervised learning approach for image representation. From an augmented view of an image, BYOL trains an online network to predict a target network representation of a different augmented view of the same image. Unlike contrastive methods, BYOL does not explicitly use a repulsion term built from negative pairs in its training objective. Yet, it avoids collapse to a trivial, constant representation. Thus, it has recently been hypothesized that batch normalization (BN) is critical to prevent collapse in BYOL. Indeed, BN flows gradients across batch elements, and could leak information about negative views in the batch, which could act as an implicit negative (contrastive) term. However, we experimentally show that replacing BN with a batch-independent normalization scheme (namely, a combination of group normalization and weight standardization) achieves performance comparable to vanilla BYOL ($73.9\%$ vs. $74.3\%$ top-1 accuracy under the linear evaluation protocol on ImageNet with ResNet-$50$). Our finding disproves the hypothesis that the use of batch statistics is a crucial ingredient for BYOL to learn useful representations.
研究动机与目标
- 探究批量归一化(BN)是否对BYOL避免表征坍缩并实现高性能至关重要。
- 检验BN是否通过跨批量样本的梯度流提供隐式对比项的假设。
- 评估替代归一化方法是否可在保持BYOL竞争力的同时替代BN。
- 确定仅通过合适的权重初始化是否足以弥补BYOL中BN的缺失。
- 评估是否可在不使用批量统计信息的情况下,弥合BN与无BN设置之间的性能差距。
提出的方法
- 将BYOL中所有批量归一化(BN)层替换为组归一化(GN)和权重标准化(WS),在训练过程中完全消除批量统计信息。
- 采用一种改进的权重初始化方法,通过基于初始批量统计信息初始化缩放和偏移参数来保留BN的缩放效应,但训练过程中不再计算这些统计量。
- 使用调整后的超参数进行训练:将预热周期增加至50轮,学习率衰减调整为3×10⁻⁸,基础初始速率调整为0.24,目标网络更新率调整为0.999。
- 在训练1000轮后,采用线性评估协议在ImageNet上评估性能。
- 对比四种变体的结果:原始BN、无归一化、无BN但使用改进初始化、无BN但使用GN+WS。
- 开展消融实验,以隔离BN在优化稳定性与表征质量中的作用。
实验结果
研究问题
- RQ1BN是否对BYOL避免表征坍缩至关重要?
- RQ2BN是否通过批量统计信息提供隐式对比信号,从而防止坍缩?
- RQ3组归一化和权重标准化等替代归一化方法是否可在不损失性能的前提下替代BYOL中的BN?
- RQ4合适的权重初始化在多大程度上可弥补BYOL中BN的缺失?
- RQ5BYOL是否可在训练过程中完全不依赖批量统计信息的前提下实现高性能?
主要发现
- 当完全移除BN并替换为改进的权重初始化方案时,BYOL在ImageNet上的线性评估top-1准确率达到65.7%,证明即使没有BN,表征坍缩也可被避免。
- 当用组归一化(GN)和权重标准化(WS)替代BN时,BN与无BN训练之间的性能差距显著缩小,准确率达到73.9%,与原始BYOL的74.3%非常接近。
- GN+WS变体在训练过程中不计算批量统计信息,证明通过批量统计信息实现的隐式对比项并非高性能所必需。
- 完全移除所有BN层后,模型性能坍缩至接近随机水平(top-1准确率仅0.1%),证实BN的作用不仅限于网络结构,而是对训练稳定性至关重要。
- 研究结果证实,BN在BYOL中的主要功能是稳定训练并改善优化动力学,而非提供隐式对比信号。
- 结果反驳了BN通过跨批量样本的梯度流产生隐式负样本项的假设,因为即使不存在此类梯度泄漏,性能依然保持高水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。