Skip to main content
QUICK REVIEW

[论文解读] Assessing Generalization of SGD via Disagreement

Yiding Jiang, Vaishnavh Nagarajan|arXiv (Cornell University)|Jun 25, 2021
Domain Adaptation and Few-Shot Learning参考文献 53被引用 19
一句话总结

本文提出使用在相同数据上但采用不同随机种子训练的两个深度神经网络之间的分歧率,作为仅基于未标注数据的测试误差的直接估计器。实验表明,该分歧率在多种架构和数据集上均与泛化误差高度一致;理论上证明,当SGD训练的模型集成具有良好校准性时,该等式成立,从而建立了泛化与校准之间的一种新联系。

ABSTRACT

We empirically show that the test error of deep networks can be estimated by simply training the same architecture on the same training set but with a different run of Stochastic Gradient Descent (SGD), and measuring the disagreement rate between the two networks on unlabeled test data. This builds on -- and is a stronger version of -- the observation in Nakkiran & Bansal '20, which requires the second run to be on an altogether fresh training set. We further theoretically show that this peculiar phenomenon arises from the \emph{well-calibrated} nature of \emph{ensembles} of SGD-trained models. This finding not only provides a simple empirical measure to directly predict the test error using unlabeled test data, but also establishes a new conceptual connection between generalization and calibration.

研究动机与目标

  • 探究在无需标注测试数据的情况下,未标注数据上的模型分歧是否能够预测泛化误差。
  • 确定先前工作中观察到的现象——分歧与测试误差相关——是否在两个模型均基于同一数据集但使用不同随机种子训练时依然成立。
  • 为观察到的分歧率与测试误差之间的一致性建立理论基础。
  • 探索分歧作为黑箱、隐私保护型泛化度量的实际应用价值。

提出的方法

  • 在相同训练数据集上,使用相同架构和超参数但不同随机种子(如不同的权重初始化和数据打乱顺序)训练两个深度神经网络。
  • 通过测量两个模型在未标注测试集上预测标签不同的样本比例,计算两者之间的分歧率。
  • 在相同未标注测试集上测量每个模型的泛化误差(测试误差),并与分歧率进行比较。
  • 理论上证明:若通过随机优化训练的模型集成具有良好校准性,则期望分歧率等于期望测试误差。
  • 使用校准图和置信度直方图,对SGD训练的集成模型的良好校准性进行经验验证。
  • 通过在不同数据划分、模型架构和超参数(如宽度、深度、批量大小)下进行消融研究,评估分歧-泛化关系的鲁棒性。

实验结果

研究问题

  • RQ1当两个模型均基于同一数据集但使用不同随机种子训练时,未标注数据上的模型分歧是否仍与测试误差相关,而非如先前工作所用的在不同数据集上训练?
  • RQ2分歧率能否作为无需标注测试数据或模型内部信息的可靠、直接的泛化误差估计器?
  • RQ3为何在实践中分歧率近似等于测试误差?SGD训练模型的何种潜在特性解释了这一现象?
  • RQ4分歧-泛化等式在何种条件下成立,特别是针对分布外数据时?
  • RQ5分歧与测试误差之间的关系是否对模型超参数(如宽度、深度、批量大小)的变化具有鲁棒性?

主要发现

  • 在所有模型对中,分歧率与测试误差的决定系数R²达0.986,肯德尔等级相关系数为0.858,表明分歧率与测试误差高度一致。
  • 即使在小幅度超参数变化(如宽度、深度、批量大小)下,分歧-泛化等式依然成立,表明对模型配置变化具有鲁棒性。
  • 该现象的理论解释在于SGD训练集成模型的良好校准性:当集成模型良好校准时,期望分歧率等于期望测试误差。
  • 在PACS数据集的部分领域中,该关系在分布外数据上依然成立,但并非普遍成立,表明对领域偏移具有敏感性。
  • 分歧度量可作为有效的黑箱、隐私保护型泛化估计器,仅需未标注数据,无需访问模型权重或梯度。
  • 使用多组模型对可提高估计精度,四组模型对的平均偏差降至0.034(与对角线测试误差=分歧率的偏差),优于单组模型对的0.112。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。