Skip to main content
QUICK REVIEW

[论文解读] Mode Normalization

Lucas Deecke, Iain Murray|arXiv (Cornell University)|Oct 12, 2018
Domain Adaptation and Few-Shot Learning参考文献 30被引用 8
一句话总结

本文提出了一种名为模式归一化(Mode Normalization)的新归一化技术,通过检测并联合归一化在多个数据模式中共享共同特征的样本,扩展了批量归一化。通过在训练过程中动态学习多组均值和方差,该方法提升了多模态数据的训练稳定性和性能,在单任务与多任务学习基准测试中优于批量归一化及其他方法。

ABSTRACT

Normalization methods are a central building block in the deep learning toolbox. They accelerate and stabilize training, while decreasing the dependence on manually tuned learning rate schedules. When learning from multi-modal distributions, the effectiveness of batch normalization (BN), arguably the most prominent normalization method, is reduced. As a remedy, we propose a more flexible approach: by extending the normalization to more than a single mean and variance, we detect modes of data on-the-fly, jointly normalizing samples that share common features. We demonstrate that our method outperforms BN and other widely used normalization techniques in several experiments, including single and multi-task datasets.

研究动机与目标

  • 解决批量归一化在多模态数据分布中因单一均值归一化无法捕捉多样化数据模式而带来的局限性。
  • 开发一种自适应识别并归一化在多个数据模式中共享共同特征的样本的归一化方法。
  • 降低对学习率调度的依赖,提升深度网络中的训练稳定性和收敛性。

提出的方法

  • 模式归一化通过学习多组均值和方差而非单一均值与方差对,扩展了标准批量归一化。
  • 它在训练过程中使用类似聚类的机制对特征表示进行动态数据模式检测。
  • 样本根据共享特征被分组,并使用各模式特有的统计量进行归一化。
  • 该方法采用可微机制将样本分配至各模式,并以端到端可训练的方式更新模式统计量。
  • 通过限制模式数量并使用软分配机制,保持计算效率并保障梯度流动。
  • 该方法与标准深度学习架构兼容,可应用于单任务与多任务学习。

实验结果

研究问题

  • RQ1一种能够检测并适应多个数据模式的归一化方法,是否能提升深度网络的训练稳定性和性能?
  • RQ2在多模态数据集上,模式归一化与批量归一化及其他归一化技术相比表现如何?
  • RQ3所提出的方法是否能降低在单任务与多任务学习场景中对学习率调度的敏感性?

主要发现

  • 模式归一化在单任务与多任务学习数据集上均优于批量归一化及其他广泛使用的归一化技术。
  • 该方法实现了更快的收敛速度和更优的泛化性能,尤其在多模态数据分布设置下表现显著。
  • 其对学习率调度的依赖性显著降低,提升了训练鲁棒性。
  • 模型在多种架构和数据分布下均表现出一致的性能提升。
  • 能够检测并针对不同数据模式进行归一化,从而实现更稳定和高效的优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。