[论文解读] NeurIPS 2020 Competition: Predicting Generalization in Deep Learning
该 NeurIPS 2020 竞赛挑战研究人员开发能够预测深度学习泛化性能的复杂度度量。参赛者提交代码,从训练好的模型中计算标量得分,评估由中心统一处理——实现公平、可复现的基准测试,无需进行大量训练或依赖计算基础设施,即可对理论与经验泛化预测器进行评估。
Understanding generalization in deep learning is arguably one of the most important questions in deep learning. Deep learning has been successfully adopted to a large number of problems ranging from pattern recognition to complex decision making, but many recent researchers have raised many concerns about deep learning, among which the most important is generalization. Despite numerous attempts, conventional statistical learning approaches have yet been able to provide a satisfactory explanation on why deep learning works. A recent line of works aims to address the problem by trying to predict the generalization performance through complexity measures. In this competition, we invite the community to propose complexity measures that can accurately predict generalization of models. A robust and general complexity measure would potentially lead to a better understanding of deep learning's underlying mechanism and behavior of deep models on unseen data, or shed light on better generalization bounds. All these outcomes will be important for making deep learning more robust and reliable.
研究动机与目标
- 建立一个标准化、可访问的平台,用于评估预测深度神经网络泛化的复杂度度量。
- 通过消除参赛者训练模型或管理计算资源的需求,降低测试理论泛化假设的门槛。
- 实现对各种架构和超参数下多样化复杂度度量的直接、公平比较。
- 通过快速反馈循环,加速对深度学习泛化理论基础的研究。
- 支持开发出更具鲁棒性、可靠性与效率的深度学习模型,具备更强的泛化保证。
提出的方法
- 参赛者提交的代码接收一个训练好的 Keras 模型(使用 TensorFlow 2.x)及其训练数据作为输入,并输出一个实数标量得分。
- 评估框架在大规模、精心筛选的完全训练好的模型数据集上运行这些代码,涵盖多种架构和超参数。
- 所有模型均训练至接近完美的训练准确率(插值区间),以消除训练收敛性对泛化差距的干扰。
- 框架为每个模型计算泛化差距(测试准确率减去训练准确率),并将其作为评估的真实标签。
- 使用相关性度量(如斯皮尔曼等级相关系数)将得分与真实泛化差距进行对比,以评估预测性能。
- 公开排行榜每日更新,提供实时反馈,支持复杂度度量的迭代优化与改进。
实验结果
研究问题
- RQ1在多种架构和超参数下,哪些复杂度度量最能准确预测深度神经网络的泛化差距?
- RQ2统一且可访问的评估框架是否能够使更广泛的社区参与泛化理论的测试,而无需大规模训练?
- RQ3在受控、大规模条件下评估时,现有理论复杂度度量(如尖锐性、基于范数的界)在实践中表现如何?
- RQ4能否发现实用且经验有效的复杂度度量,即使它们不必然基于正式的统计学习理论?
- RQ5复杂度度量在深度学习模型的协变量偏移和架构变化下,其鲁棒性在多大程度上保持不变?
主要发现
- 该竞赛框架成功将复杂度度量的开发与模型训练解耦,使研究人员能够专注于度量设计。
- 每日更新的公开排行榜提供了实时反馈,显著加快了所提出度量的迭代与优化进程。
- 评估基础设施确保了所有提交结果之间的公平透明比较,消除了不同计算配置带来的偏差。
- 该竞赛表明,许多传统复杂度度量在受控、大规模评估下表现不佳,证实了先前对混杂因素的担忧。
- 该框架促进了新型、经验有效的复杂度度量的发现,这些度量在缺乏集中评估的情况下可能难以被测试。
- 结果强调了标准化基准在推进深度学习泛化理论理解方面的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。