[论文解读] Exponential Moving Average Normalization for Self-supervised and Semi-supervised Learning
本文提出指数移动平均归一化(EMAN),作为学生-教师自监督与半监督学习框架中批量归一化(Batch Normalization)的即插即用替代方案。EMAN 将教师网络中的批量统计量替换为学生网络批量归一化统计量的指数加权平均,从而减少样本间依赖性并提升泛化能力。在仅使用 1% 和 10% 标注数据的 ImageNet 上,EMAN 将 MoCo 和 BYOL 的性能分别提升 4–6/1–2 个百分点,将 FixMatch 提升 7/2 个百分点,实现了新的 SOTA 结果。
We present a plug-in replacement for batch normalization (BN) called exponential moving average normalization (EMAN), which improves the performance of existing student-teacher based self- and semi-supervised learning techniques. Unlike the standard BN, where the statistics are computed within each batch, EMAN, used in the teacher, updates its statistics by exponential moving average from the BN statistics of the student. This design reduces the intrinsic cross-sample dependency of BN and enhances the generalization of the teacher. EMAN improves strong baselines for self-supervised learning by 4-6/1-2 points and semi-supervised learning by about 7/2 points, when 1%/10% supervised labels are available on ImageNet. These improvements are consistent across methods, network architectures, training duration, and datasets, demonstrating the general effectiveness of this technique. The code is available at https://github.com/amazon-research/exponential-moving-average-normalization.
研究动机与目标
- 解决学生-教师框架中批量归一化(BN)存在的样本间依赖性问题,该问题可能导致自监督与半监督学习中的‘作弊’现象。
- 解决由于异步更新导致的教师模型参数与 BN 统计量之间的不匹配问题。
- 开发一种简单、高效且可泛化的归一化方法,提升泛化能力,同时无需复杂的同步或通信机制。
- 在多种自监督与半监督学习方法、网络架构与数据集上提升性能。
- 通过轻量级、即插即用的 BN 替代方案,在极小标注数据下实现 ImageNet 上的 SOTA 准确率。
提出的方法
- EMAN 使用随时间累积的学生网络批量归一化统计量的指数加权平均值,替换教师网络中的批量统计量。
- 教师网络的归一化统计量(均值与方差)通过与模型参数平均相同的动量进行指数移动平均(EMA)更新。
- 该设计使教师的归一化与当前小批量解耦,消除了标准 BN 中固有的样本间依赖性。
- 该方法实现为一种简单的线性变换,无额外计算开销,因此高效且与现有框架兼容。
- EMAN 仅应用于教师网络,保留学生网络的标准 BN,且仅需极少代码修改。
- 该方法适用于多种自监督与半监督学习方法,包括 MoCo、BYOL 和 FixMatch。
实验结果
研究问题
- RQ1能否通过用指数加权平均统计量替换教师网络中的批量归一化,提升自监督与半监督学习的泛化能力?
- RQ2通过消除教师归一化中的样本间依赖性,是否能带来更优的表征学习与更高的准确率?
- RQ3EMAN 是否能在不修改网络架构或超参数的前提下,提升多种架构、训练时长与数据集上的性能?
- RQ4与 SyncBN 或 ShuffleBN 等复杂归一化方案相比,EMAN 在准确率与效率方面表现如何?
- RQ5EMAN 是否通过使归一化统计量与模型参数对齐,增强了 EMA-teacher 框架的鲁棒性?
主要发现
- 在仅使用 1% 和 10% ImageNet 标注数据时,EMAN 分别使 MoCo 和 BYOL 的性能提升 4–6 个与 1–2 个百分点,表明其在自监督学习中具有显著增益。
- 在仅使用 1% 和 10% 标注数据的 ImageNet 上,EMAN 将 FixMatch 的性能分别提升约 7 个与 2 个百分点,实现了 63.0% 和 74.0% 的新 SOTA 准确率(Top-1)。
- 性能增益在不同网络架构、训练时长与数据集上均保持一致,表明其具有广泛适用性。
- EMAN 不需要 GPU 间通信或同步,效率与标准批量归一化相当。
- 训练动态显示,使用 EMAN 时损失更高、实例判别准确率更低,表明其有效防止了模型‘作弊’,提升了表征质量。
- 最佳性能通常出现在训练约 90% 的训练周期时,提示使用 EMAN 时需谨慎选择检查点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。