Skip to main content
QUICK REVIEW

[论文解读] Towards Task and Architecture-Independent Generalization Gap Predictors

Scott Yak, Javier Gonzalvo|arXiv (Cornell University)|Jun 4, 2019
Advanced Neural Network Applications参考文献 10被引用 9
一句话总结

本文提出了一种与任务和网络架构无关的泛化差距预测器,采用深度神经网络(DNN)和循环神经网络(RNN)来预测在多种数据集和网络架构下的泛化性能。通过在13,500个具有不同架构、超参数和螺旋数据集变体的神经网络上进行训练,作者实现了0.965的R²值,用于预测泛化差距,显著优于线性模型,并在未见过的超参数和数据集上表现出强大的零样本泛化能力。

ABSTRACT

Can we use deep learning to predict when deep learning works? Our results suggest the affirmative. We created a dataset by training 13,500 neural networks with different architectures, on different variations of spiral datasets, and using different optimization parameters. We used this dataset to train task-independent and architecture-independent generalization gap predictors for those neural networks. We extend Jiang et al. (2018) to also use DNNs and RNNs and show that they outperform the linear model, obtaining $R^2=0.965$. We also show results for architecture-independent, task-independent, and out-of-distribution generalization gap prediction tasks. Both DNNs and RNNs consistently and significantly outperform linear models, with RNNs obtaining $R^2=0.584$.

研究动机与目标

  • 开发与具体任务和神经网络架构无关的泛化差距预测器。
  • 解决先前工作仅在固定架构和数据集上泛化的局限性。
  • 实现在未见架构、超参数和数据分布上的零样本泛化性能预测。
  • 改进神经架构搜索(NAS)并减少对验证集的依赖。
  • 探究是否可以利用深度学习来预测深度学习本身在何时泛化良好。

提出的方法

  • 在27种螺旋数据集变体、多样化架构和优化超参数下训练13,500个神经网络。
  • 提取逐层边缘签名作为泛化差距预测的输入特征。
  • 通过求和层特定特征,生成固定维度向量,以处理深度可变的网络。
  • 使用RNN自然处理可变长度的层特征序列,无需固定输入尺寸。
  • 在边缘特征上训练DNN和RNN模型,以预测泛化差距(训练准确率与测试准确率之差)。
  • 在同分布和分布外设置下评估模型,包括对未见超参数和数据集的外推。

实验结果

研究问题

  • RQ1是否可以训练出与具体任务和神经网络架构无关的泛化差距预测器?
  • RQ2在多样化架构和数据集上,深度学习模型(DNN和RNN)是否优于线性模型来预测泛化差距?
  • RQ3这些预测器在未见超参数和数据分布上的泛化能力如何?
  • RQ4RNN是否能通过处理顺序化的层特征,有效建模深度可变的神经网络?
  • RQ5模型是否学习到了超越特定超参数相关性的可泛化模式?

主要发现

  • 基于DNN的泛化差距预测器在数据集相关、同分布设置下达到R² = 0.965,显著优于线性模型(R² = 0.956),并复现了Jiang等人(2018)的结果。
  • 基于RNN的预测器在数据集无关、同分布设置下达到R² = 0.584,显著优于线性模型(R² = 0.390)和DNN(R² = 0.502)。
  • 即使在分布外评估——在未见超参数和数据集上测试——DNN和RNN模型的性能仅出现轻微下降(R²下降≤0.002),表明其具有强大的泛化能力。
  • 模型在未见架构和超参数上表现出良好泛化,表明其学习到了可泛化的模式,而非过拟合于特定配置。
  • RNN的使用使得在无需架构约束的情况下有效建模深度可变网络成为可能,证明了基于序列的建模在深度学习泛化预测中的可行性。
  • 结果表明,可以利用深度学习来预测深度学习的泛化能力,具有在无需验证集的情况下应用于NAS和模型选择的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。