Skip to main content
QUICK REVIEW

[论文解读] Split Batch Normalization: Improving Semi-Supervised Learning under Domain Shift

Michał Zając, Konrad Żołna|arXiv (Cornell University)|Apr 6, 2019
Domain Adaptation and Few-Shot Learning参考文献 22被引用 10
一句话总结

本文提出了一种分割批归一化(Split-BN)技术,该技术在半监督学习(SSL)中为有标签和无标签数据分别计算批归一化统计量,以提升在分布偏移下的鲁棒性。通过解耦归一化统计量,Split-BN 显著减少了当无标签数据分布与有标签数据不同时导致的性能下降,在 CIFAR-10 和 ImageNet 上针对多种分布偏移(包括噪声和颜色变换)实现了最先进性能。

ABSTRACT

Recent work has shown that using unlabeled data in semi-supervised learning is not always beneficial and can even hurt generalization, especially when there is a class mismatch between the unlabeled and labeled examples. We investigate this phenomenon for image classification on the CIFAR-10 and the ImageNet datasets, and with many other forms of domain shifts applied (e.g. salt-and-pepper noise). Our main contribution is Split Batch Normalization (Split-BN), a technique to improve SSL when the additional unlabeled data comes from a shifted distribution. We achieve it by using separate batch normalization statistics for unlabeled examples. Due to its simplicity, we recommend it as a standard practice. Finally, we analyse how domain shift affects the SSL training process. In particular, we find that during training the statistics of hidden activations in late layers become markedly different between the unlabeled and the labeled examples.

研究动机与目标

  • 解决当无标签数据分布与有标签数据不同时,半监督学习(SSL)性能下降的问题。
  • 探究在分布偏移下 SSL 失败的根本原因,尤其关注批归一化的作用。
  • 提出一种实用、即插即用的解决方案,无需架构修改即可增强 SSL 的鲁棒性。
  • 分析分布偏移如何影响深度网络在 SSL 训练过程中激活统计量与优化动态。

提出的方法

  • Split-BN 在训练过程中分别为有标签和无标签小批量数据计算独立的批归一化统计量(均值和方差)。
  • 在前向传播中,网络为有标签和无标签样本分别应用不同的归一化参数(α, β),这些参数基于其各自的批量统计量推导得出。
  • 推理阶段保持标准批归一化,使用为有标签和无标签数据分别维护的运行平均统计量。
  • 该方法与现有 SSL 框架(如 Mean Teacher 和虚拟对抗训练,VAT)兼容。
  • 该方法轻量化,除标准 SSL 设置外,无需模型微调或超参数调优。
  • 作者在多个分布偏移场景下验证了该方法的有效性,包括 CIFAR-10 和 ImageNet 上的灰度化、噪声、对比度变化和遮挡。

实验结果

研究问题

  • RQ1有标签与无标签数据之间的分布偏移如何影响半监督学习方法的性能?
  • RQ2为何批归一化会加剧分布偏移下的性能下降?这是否是根本原因?
  • RQ3将有标签与无标签数据的批归一化统计量分离,能否提升在分布偏移下的 SSL 鲁棒性?
  • RQ4在分布偏移下,隐藏层激活统计量在训练过程中如何演变?这对优化动态有何启示?
  • RQ5分布偏移导致的性能下降是由批归一化引起的,还是更普遍的优化问题?

主要发现

  • 在 CIFAR-10 和 ImageNet 上,Split-BN 在多种分布偏移下均实现显著性能提升,有效抵消了分布不匹配的负面影响。
  • 在 CIFAR-10 的灰度化分布偏移下,使用 Split-BN 的 Mean Teacher 达到 77.5% 的准确率,而未使用时仅为 73.5%,性能提升 4%。
  • 使用 Split-BN 后,SSL 训练中的辅助损失降低了一个数量级,表明对无监督目标的优化更加高效。
  • 在分布偏移下,深层网络中隐藏层的激活统计量在有标签与无标签样本之间显著分离,提示存在根本性的优化挑战。
  • 移除批归一化层并不能消除分布偏移下的性能下降,证明批归一化并非 SSL 不稳定的根本原因。
  • 在极端情况下(如精心构造的 8A8O-ImageNet 子集),没有任何 SSL 方法能有效利用无标签数据,凸显了分布偏移的严重性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。