Skip to main content
QUICK REVIEW

[论文解读] Whitening and second order optimization both destroy information about the dataset, and can make generalization impossible

Neha S. Wadia, Daniel Duckworth|arXiv (Cornell University)|May 4, 2021
Stochastic Gradient Optimization Techniques参考文献 83被引用 7
一句话总结

本文表明,数据白化和某些二阶优化方法会破坏数据集中样本-样本二阶矩矩阵中的关键信息,而该信息对于全连接第一层模型的泛化能力至关重要。在高维设置下,这种信息损失可能导致泛化完全不可能,尽管正则化二阶优化提供了一种实用的折衷方案,能够在一定程度上保留泛化能力。

ABSTRACT

Machine learning is predicated on the concept of generalization: a model achieving low error on a sufficiently large training set should also perform well on novel samples from the same distribution. We show that both data whitening and second order optimization can harm or entirely prevent generalization. In general, model training harnesses information contained in the sample-sample second moment matrix of a dataset. For a general class of models, namely models with a fully connected first layer, we prove that the information contained in this matrix is the only information which can be used to generalize. Models trained using whitened data, or with certain second order optimization schemes, have less access to this information; in the high dimensional regime they have no access at all, resulting in poor or nonexistent generalization ability. We experimentally verify these predictions for several architectures, and further demonstrate that generalization continues to be harmed even when theoretical requirements are relaxed. However, we also show experimentally that regularized second order optimization can provide a practical tradeoff, where training is accelerated but less information is lost, and generalization can in some circumstances even improve.

研究动机与目标

  • 研究数据白化和二阶优化如何影响全连接第一层模型中可用于泛化的信息。
  • 识别样本-样本二阶矩矩阵在全连接第一层模型中作为泛化相关信息主要来源的作用。
  • 证明在高维情形下,这些技术会完全消除对这一关键信息的访问,导致泛化能力差甚至完全丧失。
  • 探索正则化二阶优化是否能在保持训练速度优势的同时,缓解信息损失。

提出的方法

  • 对具有全连接第一层的模型进行理论分析,以确立泛化能力仅依赖于样本-样本二阶矩矩阵中的信息。
  • 推导出数据白化和特定二阶优化方案(如自然梯度)如何减少或消除对这一矩阵的访问条件。
  • 采用高维渐近分析,表明在高维极限下,这些方法会完全丧失对二阶矩矩阵的访问。
  • 通过多种架构的实证验证,确认理论预测在白化和二阶优化下出现泛化失败。
  • 提出一种正则化二阶优化变体并进行测试,以评估其是否在加速训练的同时保留了足够的泛化信息。
  • 实验比较了在标准、白化和正则化二阶优化设置下,多种模型架构的泛化性能。

实验结果

研究问题

  • RQ1数据白化是否会消除全连接模型中泛化所必需的样本-样本二阶矩矩阵中的信息?
  • RQ2在高维设置下,如自然梯度等二阶优化方法是否会导致泛化能力完全丧失?
  • RQ3二阶矩信息的损失在多大程度上与深度学习模型中较差的测试性能相关?
  • RQ4正则化二阶优化能否在加速训练的同时保留足够的信息以实现泛化?
  • RQ5在何种条件下,通过正则化二阶优化可改善或维持泛化能力?

主要发现

  • 数据白化和某些二阶优化方法会破坏全连接第一层模型中唯一与泛化相关的信息源——样本-样本二阶矩矩阵的访问。
  • 在高维情形下,这些方法完全丧失对二阶矩矩阵的访问,导致泛化能力完全不可能实现。
  • 实证结果证实,无论在何种架构下,白化数据和标准二阶优化均导致泛化性能显著下降。
  • 即使放宽理论假设,泛化能力仍持续受损,表明该问题在实际设置中具有鲁棒性。
  • 正则化二阶优化提供了一种实用的折衷方案:它在加速训练的同时保留了足够的泛化信息,甚至在某些情况下提升了泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。