[论文解读] Nondeterminism and Instability in Neural Network Optimization
本文将随机梯度下降中的优化不稳定性识别为神经网络训练中运行间差异性的根本原因,表明即使初始权重仅发生 10^-11 的微小变化,其影响也与完全重新随机初始化相当。本文提出加速模型集成和推理时增强两种方法,以在不增加训练成本的前提下减少差异性,为可复现性和可靠模型评估提供了实用解决方案。
Nondeterminism in neural network optimization produces uncertainty in performance, making small improvements difficult to discern from run-to-run variability. While uncertainty can be reduced by training multiple model copies, doing so is time-consuming, costly, and harms reproducibility. In this work, we establish an experimental protocol for understanding the effect of optimization nondeterminism on model diversity, allowing us to isolate the effects of a variety of sources of nondeterminism. Surprisingly, we find that all sources of nondeterminism have similar effects on measures of model diversity. To explain this intriguing fact, we identify the instability of model training, taken as an end-to-end procedure, as the key determinant. We show that even one-bit changes in initial parameters result in models converging to vastly different values. Last, we propose two approaches for reducing the effects of instability on run-to-run variability.
研究动机与目标
- 隔离并量化神经网络训练中各种非确定性来源的独立影响。
- 探究为何不同来源的非确定性尽管机制不同,却产生相似水平的模型差异性。
- 识别优化不稳定性——对初始权重微小变化的敏感性——作为此类差异性的关键驱动因素。
- 提出并评估实用、低成本的方法,以在不增加训练时间的前提下减少运行间差异性。
提出的方法
- 作者设计了一套实验协议,以隔离单个非确定性来源,包括参数初始化、数据打乱、数据增强、Dropout、异步训练以及cuDNN库的随机性。
- 通过多种度量方法衡量模型多样性:预测相关性、集成下的功能变化,以及最先进的相似性方法(如Kornblith等人,2019年)。
- 一项关键的实验操作是将单个权重改变至可表示的最小量(≈6×10^-11),以模拟极端的初始化扰动。
- 在多种架构(ResNet、VGG、ShuffleNet)和数据集(CIFAR-10、MNIST、ImageNet)上评估这些扰动的影响。
- 提出并测试两种缓解策略:加速模型集成(在训练过程中早期进行集成)和推理时增强(TTA)在推理阶段应用。
- 所有实验均在受控随机种子和多次运行下进行,以确保统计稳健性,代码已公开发布。
实验结果
研究问题
- RQ1不同非确定性来源(如初始化、数据打乱、cuDNN)对模型性能差异性的影响是否相当?
- RQ2为何看似不同的非确定性来源会产生相似水平的模型多样性?
- RQ3优化过程本身的不稳定性是否是导致观察到的差异性的主要原因,无论其来源如何?
- RQ4能否在不增加训练时间或计算成本的前提下减少模型差异性?
- RQ5加速集成与推理时增强在不同架构和数据集上能在多大程度上减少运行间差异性?
主要发现
- 所有非确定性来源——包括随机初始化、数据打乱以及底层库的随机性——均产生几乎相同的模型多样性与性能差异性水平。
- 单个初始权重的1比特变化(≈6×10^-11)所引起的最终模型性能差异,与完全随机重新初始化的影响相当。
- 随机梯度下降的不稳定性是造成这种差异性的主要原因,因为初始参数的微小扰动会导致最终模型权重出现显著偏离。
- 加速模型集成与推理时增强在所有度量指标上均减少了模型差异性,尤其在成对多样性指标和更大模型上效果更显著。
- 在MNIST上,仅推理时增强显著降低了差异性,表明模型容量与过拟合可能调节缓解策略的有效性。
- 该发现适用于多种架构(ResNet-6、ResNet-14、VGG-11、ShuffleNet、ResNet-18)和数据集(CIFAR-10、MNIST、ImageNet),证实了该不稳定性现象的普遍性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。