Skip to main content
QUICK REVIEW

[论文解读] Non-Determinism in TensorFlow ResNets

Miguel Morin, Matthew Willetts|arXiv (Cornell University)|Jan 30, 2020
Advanced Neural Network Applications参考文献 3被引用 12
一句话总结

本文表明,即使在固定权重初始化和数据打乱的随机种子时,GPU非确定性仍是TensorFlow上ResNet训练中性能波动的主要来源,占测试准确率和损失方差的74–87%。作者主张采用完整性能分布而非单点准确率比较来评估深度学习模型,以确保模型的鲁棒性和可复现性。

ABSTRACT

We show that the stochasticity in training ResNets for image classification on GPUs in TensorFlow is dominated by the non-determinism from GPUs, rather than by the initialisation of the weights and biases of the network or by the sequence of minibatches given. The standard deviation of test set accuracy is 0.02 with fixed seeds, compared to 0.027 with different seeds---nearly 74\% of the standard deviation of a ResNet model is non-deterministic. For test set loss the ratio of standard deviations is more than 80\%. These results call for more robust evaluation strategies of deep learning models, as a significant amount of the variation in results across runs can arise simply from GPU randomness.

研究动机与目标

  • 隔离并量化GPU非确定性对TensorFlow上ResNet训练性能波动的贡献。
  • 证明GPU引入的随机性会压倒其他随机源(如权重初始化和小批量顺序)的影响。
  • 通过倡导基于性能分布的模型改进评估方式,挑战当前单点模型评估的常规做法。
  • 通过揭示基于种子的可复现性在GPU平台上的局限性,推动深度学习研究的可复现性。

提出的方法

  • 固定TensorFlow图级别、操作级别和NumPy的随机种子,以控制权重初始化和数据打乱中的随机性。
  • 使用GPU重置命令(如`nvidia-smi -rac`)以最小化训练运行之间的状态依赖性变异。
  • 在CIFAR-10上对ResNet-50进行50次训练,其中种子固定,另进行50次种子变化的训练,以隔离GPU非确定性的影响。
  • 通过比较固定种子与变化种子运行下测试准确率和损失的标准差,量化GPU的影响。
  • 对训练后模型权重和层参数进行相等性比较,以验证在固定种子下的可复现性。
  • 分析不同GPU架构和编译器间浮点数运算不一致作为非确定性的根本原因。

实验结果

研究问题

  • RQ1与其它随机源相比,GPU非确定性在TensorFlow上ResNet训练中对性能波动的贡献程度如何?
  • RQ2在GPU上,对权重初始化和小批量顺序使用固定随机种子是否能完全消除性能波动?
  • RQ3GPU级浮点数非确定性对测试准确率和损失标准差的定量影响是什么?
  • RQ4所观察到的非确定性如何影响深度学习研究中单点模型评估的可靠性?

主要发现

  • 在固定权重初始化和小批量顺序种子的情况下,50次运行的测试准确率标准差为1.995×10⁻²,表明仍存在由GPU非确定性引起的残余波动。
  • 当种子在运行间变化时,测试准确率的标准差上升至2.699×10⁻²,表明GPU非确定性贡献了73.9%的总方差。
  • 对于测试损失,固定种子与变化种子下的标准差比值为0.872,表明GPU非确定性占方差的80%以上。
  • 即使种子相同且随机数生成可复现,GPU运行仍因硬件和编译器实现间的浮点数运算不一致而表现出不同结果。
  • 所观察到的波动源于GPU上寄存器使用和浮点数累加顺序的非确定性,这些在不同系统和运行间存在差异,即使输入完全相同。
  • 作者得出结论:GPU非确定性是可复现性的主要障碍,建议采用性能分布而非单点指标来评估模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。