Skip to main content
QUICK REVIEW

[论文解读] Be Like Water: Robustness to Extraneous Variables Via Adaptive Feature Normalization

Aakash Kaku, Sreyas Mohan|arXiv (Cornell University)|Feb 10, 2020
Advanced Neural Network Applications参考文献 35被引用 7
一句话总结

本文提出自适应特征归一化以提升深度学习对额外变量(如外科医生身份、患者差异或图像损坏)的鲁棒性,这些变量会导致训练与推理时数据分布发生偏移。通过在推理时使用固定额外变量值(如每位外科医生或损坏类型)自适应计算归一化统计量,该方法减少了分布不匹配,使CIFAR-10C、JIGSAWS和StrokeRehab数据集在多种架构和统计类型下均获得10–15%的准确率提升。

ABSTRACT

Extraneous variables are variables that are irrelevant for a certain task, but heavily affect the distribution of the available data. In this work, we show that the presence of such variables can degrade the performance of deep-learning models. We study three datasets where there is a strong influence of known extraneous variables: classification of upper-body movements in stroke patients, annotation of surgical activities, and recognition of corrupted images. Models trained with batch normalization learn features that are highly dependent on the extraneous variables. In batch normalization, the statistics used to normalize the features are learned from the training set and fixed at test time, which produces a mismatch in the presence of varying extraneous variables. We demonstrate that estimating the feature statistics adaptively during inference, as in instance normalization, addresses this issue, producing normalized features that are more robust to changes in the extraneous variables. This results in a significant gain in performance for different network architectures and choices of feature statistics.

研究动机与目标

  • 解决当额外变量(与任务无关但影响数据分布)在训练与推理之间发生变化时,深度学习模型性能下降的问题。
  • 指出批归一化在此类分布偏移下会失效,因其使用从训练数据中估计的固定统计量。
  • 提出在推理时采用自适应归一化,利用固定额外变量值(如特定个体或类别)的批次中计算的统计量。
  • 在包含外科手势识别、中风患者运动分类和损坏图像识别等多种数据集上,展示一致的性能提升。
  • 评估特征对额外变量的不变性,表明自适应归一化可使特征对这些混杂因素的依赖性更低。

提出的方法

  • 在推理时自适应估计特征统计量(均值与标准差,或均方值),使用额外变量固定的批次数据。
  • 根据推理时是否具备额外变量标签,选择使用实例归一化或基于批次的自适应归一化。
  • 采用两阶段训练与推理流程:先使用标准批归一化进行训练,再在测试时使用已知额外变量值的保留数据,对特征进行自适应归一化。
  • 在倒数第二层特征上训练小型解码器网络,通过解码准确率来量化对额外变量的不变性。
  • 在多种架构和统计类型(均值/标准差、均方值)下,对比非自适应(批归一化)与自适应归一化方案。
  • 在三个真实世界数据集上评估性能:CIFAR-10C(图像损坏)、JIGSAWS(外科手势)、StrokeRehab(中风患者运动)。

实验结果

研究问题

  • RQ1当额外变量(如外科医生身份、图像损坏类型)在训练与推理之间变化时,非自适应批归一化是否无法正确归一化特征?
  • RQ2通过使用固定额外变量值的保留数据计算统计量,自适应归一化是否能在此类设置下提升分类准确率?
  • RQ3通过解码准确率衡量,使用自适应归一化学习到的特征在多大程度上对额外变量具有不变性?
  • RQ4在性能与不变性方面,不同归一化统计量(均值/标准差 vs. 均方值)与不同归一化方案(基于批次 vs. 实例)有何差异?
  • RQ5自适应归一化的性能增益是否在多种数据集与网络架构上保持一致?

主要发现

  • 在所有三个数据集(CIFAR-10C、JIGSAWS和StrokeRehab)上,自适应归一化相比非自适应批归一化均实现10–15%的绝对准确率提升。
  • 在JIGSAWS数据集中,基于批次的自适应归一化优于基于实例的归一化,表明可能存在除外科医生身份外的其他额外变量。
  • 在CIFAR-10C和StrokeRehab中,基于批次与基于实例的自适应归一化表现相似,表明无论采用何种自适应策略,性能增益均具有一致性。
  • 自适应归一化使特征更具不变性:与非自适应模型相比,自适应归一化模型的特征对额外变量(如外科医生身份)的解码准确率显著更低。
  • 该性能增益在不同网络架构和特征统计类型(均值/标准差与均方值)下均保持稳健,证实了该方法的泛化能力。
  • 归一化特征的直方图显示,在分布偏移下,非自适应归一化无法使均值集中在零或标准差集中在一,而自适应归一化能恢复正确的归一化效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。