Skip to main content
QUICK REVIEW

[论文解读] Learning to Rank Learning Curves

Martin Wistuba, Tejaswini Pedapati|arXiv (Cornell University)|Jun 5, 2020
Machine Learning and Data Classification参考文献 23被引用 5
一句话总结

该论文提出 LCRankNet,一种基于迁移学习的方法,利用成对排序损失来预测并根据其他数据集的学习曲线对模型配置进行早期终止排序。该方法将神经架构搜索的速度提升了高达100倍,且性能下降极小,优于现有的曲线外推和点对点排序方法。

ABSTRACT

Many automated machine learning methods, such as those for hyperparameter and neural architecture optimization, are computationally expensive because they involve training many different model configurations. In this work, we present a new method that saves computational budget by terminating poor configurations early on in the training. In contrast to existing methods, we consider this task as a ranking and transfer learning problem. We qualitatively show that by optimizing a pairwise ranking loss and leveraging learning curves from other datasets, our model is able to effectively rank learning curves without having to observe many or very long learning curves. We further demonstrate that our method can be used to accelerate a neural architecture search by a factor of up to 100 without a significant performance degradation of the discovered architecture. In further experiments we analyze the quality of ranking, the influence of different model components as well as the predictive behavior of the model.

研究动机与目标

  • 为解决自动化机器学习中计算成本过高的问题,通过早期终止不具前景的模型配置来实现。
  • 克服现有学习曲线外推方法的局限性,这些方法需要较长或大量曲线才能实现可靠预测。
  • 通过建模一个配置优于另一个配置的相对可能性,而非预测绝对性能,从而提升排序性能。
  • 通过利用其他数据集的迁移学习,即使在学习曲线极短或为零的情况下,也能实现有效的早期停止。
  • 证明该方法在加速神经架构搜索和超参数优化方面的有效性。

提出的方法

  • LCRankNet 采用成对排序损失,直接优化一个模型配置优于另一个配置的概率。
  • 整合多种输入模态:部分学习曲线、模型架构嵌入和数据集元数据,以支持预测。
  • 通过在多样化数据集的学习曲线上进行训练,实现迁移学习,使模型能够泛化到具有极少或没有观测曲线的新数据集。
  • 从模型结构中学习架构嵌入,并将其与曲线特征结合,以提高早期预测的准确性。
  • 该方法与多种优化框架兼容,包括 TPE、正则化演化和强化学习,适用于神经架构搜索和超参数调优。
  • 消融研究验证了每个组件的贡献,包括元数据、架构和曲线特征,并对比了成对与点对点排序损失。

实验结果

研究问题

  • RQ1与点对点回归相比,成对排序损失是否能提升模型配置排序中的早期停止性能?
  • RQ2从其他数据集迁移学习在实现极短或无观测训练轮次的学习曲线准确排序方面,其有效程度如何?
  • RQ3架构嵌入和元数据在模型跨不同数据集和模型类型泛化能力方面起到何种作用?
  • RQ4学习曲线长度对排序模型预测性能有何影响?
  • RQ5LCRankNet 是否能显著加速神经架构搜索,同时不降低最终模型性能?

主要发现

  • LCRankNet 在神经架构搜索中实现了高达100倍的速度提升,与完整训练相比性能下降可忽略不计。
  • 成对排序损失优于点对点回归,尤其在学习曲线变长时表现更优;但点对点损失在极短曲线情况下表现更佳。
  • 元数据和架构嵌入对模型稳定性和性能至关重要,尤其在学习曲线数据稀缺时。
  • 学习曲线特征、架构嵌入和元数据的组合带来了最佳性能,各组件对最终结果的贡献呈正交性。
  • LCRankNet 在多个方法中均提升了优化速度,包括 TPE、正则化演化和强化学习,在图像分类和表格回归基准测试中均表现优异。
  • 消融研究证实,所有组件——学习曲线、架构和元数据——均至关重要,即使在部分或零长度曲线情况下,模型也表现出强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。