Skip to main content
QUICK REVIEW

[论文解读] Inductive Transfer for Neural Architecture Optimization

Martin Wistuba, Tejaswini Pedapati|arXiv (Cornell University)|Mar 8, 2019
Neural Networks and Applications参考文献 41被引用 6
一句话总结

本文提出了两种基于归纳迁移的方法以加速神经架构搜索:IT-NAS 通过利用先前数据集的迁移知识,实现更快的架构选择;IT-LCE 通过跨数据集迁移,提升学习曲线外推性能。该方法在 8 小时内即在 CIFAR-10 和 CIFAR-100 上达到最先进性能,通过早期停止实现 16 倍加速,并节省约 350 个 GPU 小时。

ABSTRACT

The recent advent of automated neural network architecture search led to several methods that outperform state-of-the-art human-designed architectures. However, these approaches are computationally expensive, in extreme cases consuming GPU years. We propose two novel methods which aim to expedite this optimization problem by transferring knowledge acquired from previous tasks to new ones. First, we propose a novel neural architecture selection method which employs this knowledge to identify strong and weak characteristics of neural architectures across datasets. Thus, these characteristics do not need to be rediscovered in every search, a strong weakness of current state-of-the-art searches. Second, we propose a method for learning curve extrapolation to determine if a training process can be terminated early. In contrast to existing work, we propose to learn from learning curves of architectures trained on other datasets to improve the prediction accuracy for novel datasets. On five different image classification benchmarks, we empirically demonstrate that both of our orthogonal contributions independently lead to an acceleration, without any significant loss in accuracy.

研究动机与目标

  • 降低神经架构搜索的计算成本,因为目前该过程需要数千个 GPU 小时。
  • 解决现有方法在每个新数据集上均从零开始重新发现架构特征所导致的低效问题。
  • 通过从先前数据集迁移知识,提升学习曲线外推的准确性,减少对大量训练数据的依赖。
  • 通过元知识迁移和早期停止,实现更快、更高效的架构搜索。
  • 证明归纳迁移可显著加速自动化神经架构优化,而不会牺牲性能。

提出的方法

  • 将神经架构选择建模为迁移学习问题,利用预测性贝叶斯模型从先前元知识(如架构拓扑和学习曲线)中提取潜在表征。
  • 利用学习到的潜在表征指导新数据集上的架构选择,避免冗余探索。
  • 提出一种基于贝叶斯迁移学习的学习曲线外推方法(IT-LCE),通过利用多个源数据集的学习曲线,仅用极少的观测数据即可预测新数据集上的性能。
  • 通过预测网络训练是否应提前终止来应用早期停止,从而减少训练时间。
  • 采用固定架构评估序列,并在早期停止决策前强制执行至少 30 个周期,以避免过早终止。
  • 将两种方法整合到统一框架(IT-NAS)中,结合架构选择的知识迁移与增强学习曲线预测的早期停止。

实验结果

研究问题

  • RQ1是否可以利用归纳迁移,通过复用先前数据集的知识来加速神经架构搜索?
  • RQ2是否可以通过跨数据集的知识迁移,而非依赖同一数据集的数据,来改进学习曲线外推?
  • RQ3将归纳迁移用于架构选择与增强学习曲线预测相结合,是否能实现更快收敛且精度损失最小?
  • RQ4基于迁移学习曲线的早期停止是否能显著减少训练时间,同时不降低最终模型性能?
  • RQ5所提出方法在准确率和搜索效率方面,是否与最先进 NAS 方法相比具有竞争力或更优表现?

主要发现

  • 所提出的 IT-NAS 方法在 CIFAR-10 和 CIFAR-100 上的搜索时间少于 8 小时,达到最先进准确率,优于 ENAS 和其他基线方法。
  • IT-LCE 是首个将归纳迁移用于学习曲线外推的方法,仅需在新数据集上观测少量训练周期即可实现高精度预测。
  • 在五个图像分类基准上,IT-NAS 与 IT-LCE 的早期停止结合使用,将总搜索时间减少了 16 倍,平均节省 350 个 GPU 小时。
  • 与不使用早期停止的随机搜索相比,该方法的准确率损失可忽略不计,所有数据集上性能均无显著下降。
  • 即使在候选架构空间较小时,该方法依然稳健,因为元知识迁移可弥补搜索空间缩小的不足。
  • 创建元知识的计算成本(1,866 个 GPU 小时)为一次性投入,可带来长期显著节省,并可被研究人员和 AutoML 服务共享。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。