[论文解读] Representation Based Complexity Measures for Predicting Generalization in Deep Learning
本文提出了一种基于深度神经网络表征质量的后验复杂度度量方法——具体为一致性、鲁棒性和可分性——以预测泛化性能。通过使用 Davies-Bouldin 指数衡量一致性,采用基于标签的 Mixup 方法衡量鲁棒性,利用边际分布衡量可分性,作者在 NeurIPS 2020 深度学习泛化竞赛中取得了最先进性能,展示了在多种架构和超参数设置下具有高度预测能力,且计算成本极低。
Deep Neural Networks can generalize despite being significantly overparametrized. Recent research has tried to examine this phenomenon from various view points and to provide bounds on the generalization error or measures predictive of the generalization gap based on these viewpoints, such as norm-based, PAC-Bayes based, and margin-based analysis. In this work, we provide an interpretation of generalization from the perspective of quality of internal representations of deep neural networks, based on neuroscientific theories of how the human visual system creates invariant and untangled object representations. Instead of providing theoretical bounds, we demonstrate practical complexity measures which can be computed ad-hoc to uncover generalization behaviour in deep models. We also provide a detailed description of our solution that won the NeurIPS competition on Predicting Generalization in Deep Learning held at NeurIPS 2020. An implementation of our solution is available at https://github.com/parthnatekar/pgdl.
研究动机与目标
- 为解决在过参数化深度神经网络中缺乏实用的后验度量以预测泛化性能的问题。
- 弥合神经科学中关于人类视觉表征不变性的理论与深度学习泛化之间的差距。
- 设计直观且计算高效的复杂度度量,对架构和超参数变化具有鲁棒性。
- 在真实世界基准上,超越现有理论和经验边界,更有效地预测泛化差距。
提出的方法
- 使用 Davies-Bouldin 指数衡量表征一致性,该指标量化了内部层激活中的类内紧凑性与类间分离度。
- 通过一种基于标签的 Mixup 技术评估鲁棒性,该技术对特征和标签进行插值,无需外部数据扰动即可探测表征的不变性。
- 利用预测类别得分与真实类别得分之间的边际分布评估可分性,其扰动变体增强了表达能力。
- 将尺度不变度量(DB 指数与基于标签的 Mixup)组合为乘积得分,以提升泛化预测性能。
- 在 NeurIPS 2020 竞赛数据上验证该方法,仅使用 1% 的训练样本进行估计,以确保计算效率。
- 基于数据与架构知识优化设计选择,在公开和私有测试集上均取得高分。
实验结果
研究问题
- RQ1基于表征质量的度量——特别是一致性、鲁棒性和可分性——是否能在多种架构和超参数下有效预测深度神经网络的泛化性能?
- RQ2人类视觉系统中关于不变性与解耦表征的神经科学原理,与深度学习中的泛化有何关联?
- RQ3是否可以设计出既直观又有效的后验复杂度度量,供实践者使用,而无需访问训练超参数?
- RQ4相对于谱范数或尖锐度等绝对度量,尺度不变的相对度量在泛化预测中表现是否更优?
- RQ5是否仅使用少量训练数据(如 1%)即可通过基于表征的复杂度度量可靠估计泛化性能?
主要发现
- 所提出的复杂度度量,特别是 Davies-Bouldin 指数与基于标签的 Mixup 的乘积,在 NeurIPS 2020 深度学习泛化预测竞赛的最终任务中取得了最高分。
- 基于表征质量的度量——包括一致性、鲁棒性和可分性——在广泛模型架构和超参数设置下均能有效预测泛化差距。
- 仅使用 1% 的训练样本即可生成可靠的泛化性能估计,证明了极高的计算效率。
- 基于标签的 Mixup 变体在探测表征鲁棒性与不变性方面表现优异,其诊断效用优于标准 Mixup。
- 扰动后的边际分布相比标准边际分布,能更充分地捕捉泛化行为。
- 在 CIFAR-10 和 SVHN 数据集上,该方法的互信息得分优于谱范数和尖锐度等基线度量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。