[论文解读] Ranking Deep Learning Generalization using Label Variation in Latent Geometry Graphs
该论文提出了一种基于潜在几何图(Latent Geometry Graphs, LGGs)和标签变化的深度神经网络泛化度量方法,在NeurIPS 2020 PGDL竞赛中获得第三名。通过从中间层表征构建基于相似性的图结构,并测量标签变化——即不同类别样本之间边权重的总和——该方法量化了潜在空间与分类任务的对齐程度,从而在无需验证集的情况下提供一个稳健的泛化代理指标。
Measuring the generalization performance of a Deep Neural Network (DNN) without relying on a validation set is a difficult task. In this work, we propose exploiting Latent Geometry Graphs (LGGs) to represent the latent spaces of trained DNN architectures. Such graphs are obtained by connecting samples that yield similar latent representations at a given layer of the considered DNN. We then obtain a generalization score by looking at how strongly connected are samples of distinct classes in LGGs. This score allowed us to rank 3rd on the NeurIPS 2020 Predicting Generalization in Deep Learning (PGDL) competition.
研究动机与目标
- 开发一种无需验证集的深度学习泛化性能代理指标。
- 解决传统基于验证集的泛化估计方法存在的局限性,即减少训练数据并可能降低模型性能。
- 探究通过LGG捕捉的潜在空间几何结构是否可作为泛化能力的可靠指标。
- 通过引入mixup增强数据,提升泛化预测在多种架构和超参数下的鲁棒性。
- 识别出与实际测试性能高度相关、同时最小化过拟合伪影的泛化得分。
提出的方法
- 通过余弦相似度或RBF相似度核函数,基于中间层表征的相似性连接数据样本,构建潜在几何图(LGGs)。
- 应用k近邻阈值化方法生成稀疏、局部连接的图结构,可选地通过度矩阵进行对称化和归一化。
- 将标签变化定义为标签信号与图拉普拉斯矩阵乘积的迹,用于度量不同类别样本之间边权重的总和。
- 利用mixup增强的训练样本生成更鲁棒的LGG,以减少泛化得分中的过拟合偏差。
- 通过计算多个LGG(|G|)的标签变化中位数,提升最终得分的稳定性和降低方差。
- 提出变异度每类中位数(VPM)得分作为主要的泛化代理指标,结合LGG、标签变化与mixup增强。
实验结果
研究问题
- RQ1潜在几何图中的标签变化能否作为深度学习泛化的可靠、无需验证集的代理指标?
- RQ2引入mixup增强数据在多类架构中如何提升标签变化得分的鲁棒性与泛化能力?
- RQ3基于多个LGG的标签变化得分中位数是否能降低方差,并提升公开集与开发集之间的一致性?
- RQ4不同的LGG构建策略(如相似度核函数、k-NN阈值化)如何影响与实际泛化性能的相关性?
- RQ5所提方法在无需验证集的前提下,对多种网络架构和训练超参数的泛化能力如何?
主要发现
- 所提出的VPM(变异度每类中位数)得分在NeurIPS 2020 PGDL竞赛最终测试集上取得平均分9.99,位列24个提交方案中的第3名。
- VPM得分在公开集与开发集之间表现出更好的平衡性,而基线得分如VR(变异率)和WCV(加权类别变异)则在公开集上出现过拟合。
- 使用mixup增强样本显著提升了标签变化度量的泛化能力,有效减少了高度过拟合模型中的过拟合伪影。
- 最终提交仅使用一个LGG(|G|=1)是由于时间限制,导致在公开集上的性能下降(从11.22降至6.26),表明增加图的数量可提升准确性。
- 任务特定结果表现出显著的变异性(如任务8得分为16.23,任务9得分为2.28),表明该方法性能对数据分布敏感,增加图的多样性可能有助于缓解这种方差。
- 该方法在多数任务上表现出高度一致性,最终解决方案的运行时间不足时间预算的10%,表明其具有出色的计算效率和可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。