Skip to main content
QUICK REVIEW

[论文解读] MixNorm: Test-Time Adaptation Through Online Normalization Estimation

Xuefeng Hu, Mustafa Gökhan Uzunbaş|arXiv (Cornell University)|Oct 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 31被引用 16
一句话总结

MixNorm 提出了一种新颖的测试时自适应方法,通过自适应融合全局与局部统计量,从单个测试样本中估计批量归一化统计量,从而消除对大批次或单一领域假设的依赖。该方法在任意批次大小和混合分布的真实世界设置中显著优于 SOTA 方法(如 TENT),同时在无源域自适应和零样本分类任务中也表现出更优性能。

ABSTRACT

We present a simple and effective way to estimate the batch-norm statistics during test time, to fast adapt a source model to target test samples. Known as Test-Time Adaptation, most prior works studying this task follow two assumptions in their evaluation where (1) test samples come together as a large batch, and (2) all from a single test distribution. However, in practice, these two assumptions may not stand, the reasons for which we propose two new evaluation settings where batch sizes are arbitrary and multiple distributions are considered. Unlike the previous methods that require a large batch of single distribution during test time to calculate stable batch-norm statistics, our method avoid any dependency on large online batches and is able to estimate accurate batch-norm statistics with a single sample. The proposed method significantly outperforms the State-Of-The-Art in the newly proposed settings in Test-Time Adaptation Task, and also demonstrates improvements in various other settings such as Source-Free Unsupervised Domain Adaptation and Zero-Shot Classification.

研究动机与目标

  • 为解决现有测试时自适应(TTA)方法中不切实际的假设,例如大在线批次和单一偏移测试分布。
  • 开发一种方法,仅从单个测试样本中估计准确的批量归一化统计量,从而实现实时、在线自适应。
  • 在测试样本以小批量或混合批次到达的真实世界分布偏移场景下,提升模型鲁棒性。
  • 在反映实际部署约束的新颖、真实的 TTA 基准上评估该方法。
  • 将 TTA 的优势拓展至分布偏移之外的任务,如无源域自适应和零样本分类。

提出的方法

  • MixNorm 用一种混合归一化层替代标准批量归一化层,该层结合了来自历史样本的移动平均统计量与当前输入及其空间增强版本的局部统计量。
  • 该方法采用加权融合方式,将全局(移动平均)与局部(当前样本 + 增强)统计量结合,使用可学习系数以平衡其贡献。
  • 它提出了一种新颖的在线估计机制,仅依赖单个输入样本实时更新归一化统计量,避免对批次的依赖。
  • 该方法利用输入的空间增强(如裁剪、翻转)来计算即使仅基于单一样本也能可靠的局部统计量。
  • 归一化层中保持固定的仿射参数(α, β),因为实验表明其性能提升有限,无法超越自适应统计估计的效果。
  • 该框架与标准深度学习模型兼容,可通过替换预训练模型中的批量归一化层直接应用,无需微调。

实验结果

研究问题

  • RQ1是否可以在不依赖大在线测试批次的情况下有效执行测试时自适应?
  • RQ2当测试样本来自多个分布或以小批量到达时,TTA 方法的性能会如何退化?
  • RQ3是否能通过自适应融合全局与局部统计量,从单个测试样本中准确估计批量归一化统计量?
  • RQ4MixNorm 是否能提升无源无监督域自适应和零样本分类任务中的泛化能力?
  • RQ5用于局部统计量估计的空间增强数量对稳定性与准确性有何影响?

主要发现

  • 在使用 ResNet-50 的 ImageNet-C 混合损坏数据集上,MixNorm 的错误率为 31.96%,显著优于 TENT 及其他基线方法,在真实评估协议下表现更优。
  • 当采用 80% 全局统计量与 20% 局部统计量融合时,MixNorm 在 ImageNet-C 上将错误率降低至 31.96%,证明了自适应融合的有效性。
  • 在零样本分类任务中,MixNorm 将 CLIP 在 CIFAR-100 上的准确率从 40.97% 提升至 45.13%,在 Stanford-Cars 上从 53.80% 提升至 54.01%,即使在大规模预训练模型上也实现了显著增益。
  • 在无源域自适应任务中,MixNormBN 在 SVHN→MNIST 上实现 7.95% 的错误率,显著优于 TENT(8.17%)和 BN(22.70%)。
  • 用于局部统计量估计的增强数量对性能影响极小,错误率在 1 至 15 种增强下变化不足 0.4%,表明方法具备鲁棒性与高效性。
  • 使用可学习仿射权重(α, β)并未带来可测量的性能提升,表明自适应统计估计本身已达到最优,无需额外可学习参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。