Skip to main content
QUICK REVIEW

[论文解读] Deep Neural Architecture Search with Deep Graph Bayesian Optimization

Lizheng Ma, Jiaxu Cui|arXiv (Cornell University)|May 14, 2019
Machine Learning and Data Classification参考文献 17被引用 5
一句话总结

该论文提出NASGBO,一种基于图贝叶斯优化的框架,采用贝叶斯图神经网络(GNN)作为代理模型,自动提取神经架构搜索(NAS)中的架构特征。通过将神经网络建模为属性图,并利用GNN捕捉结构和基于特征的表征,NASGBO在收敛速度和性能方面优于现有的贝叶斯优化与进化方法,尤其在降低计算成本的同时发现更优架构。

ABSTRACT

Bayesian optimization (BO) is an effective method of finding the global optima of black-box functions. Recently BO has been applied to neural architecture search and shows better performance than pure evolutionary strategies. All these methods adopt Gaussian processes (GPs) as surrogate function, with the handcraft similarity metrics as input. In this work, we propose a Bayesian graph neural network as a new surrogate, which can automatically extract features from deep neural architectures, and use such learned features to fit and characterize black-box objectives and their uncertainty. Based on the new surrogate, we then develop a graph Bayesian optimization framework to address the challenging task of deep neural architecture search. Experiment results show our method significantly outperforms the comparative methods on benchmark tasks.

研究动机与目标

  • 为解决基于高斯过程的贝叶斯优化在神经架构搜索中的局限性,特别是对人工设计的相似性度量的依赖以及可扩展性差的问题。
  • 开发一种代理模型,能够自动从神经架构结构中学习有意义的表征,而无需人工设计的特征。
  • 通过用线性时间的贝叶斯图神经网络替代立方时间的高斯过程,降低贝叶斯优化在NAS中的计算成本。
  • 通过利用图表示学习和不确定性感知预测,实现对更大搜索空间的高效探索。
  • 通过集成进化策略与可学习、可扩展的代理模型,提升NAS的搜索效率和准确性。

提出的方法

  • 将神经架构建模为属性图,其中节点表示层,边表示连接,特征编码层类型和超参数。
  • 使用图神经网络(GNN)从属性图中学习节点和边的嵌入,捕捉结构和语义关系。
  • 应用池化层将节点和边的嵌入聚合为整个架构的全局图表征。
  • 将全局表征输入多层感知机(MLP),以预测架构的性能(例如准确率或损失)。
  • 在MLP之上集成一个贝叶斯线性回归(BLR)层,以估计预测不确定性,从而支持贝叶斯优化中的主动采集。
  • 构建一个图贝叶斯优化框架,通过不确定性感知的采集函数,迭代选择最具前景的架构,并使用贝叶斯GNN作为代理模型。

实验结果

研究问题

  • RQ1可学习的、数据驱动的代理模型是否能在神经架构搜索的贝叶斯优化中超越人工设计的相似性度量?
  • RQ2图神经网络是否能有效从深度神经网络中提取有意义的架构特征以用于性能预测?
  • RQ3用贝叶斯图神经网络替代高斯过程是否能显著提升贝叶斯优化在NAS中的可扩展性和效率?
  • RQ4与最先进方法相比,所提出的框架是否能以更少的评估次数发现更优的神经架构?
  • RQ5所学习的架构嵌入如何影响NAS的收敛速度和最终性能?

主要发现

  • NASGBO在Cifar10、Fashion-MNIST、MNIST和Slice数据集上均取得了最佳测试集性能,优于NASBOT、TreeBO和SEAS。
  • 在Fashion-MNIST数据集上,NASGBO发现了一种仅含两个残差块的更简单架构,其分类误差低于NASNM(五个残差块)和NASBOT(无残差块)。
  • 在Slice数据集上,NASGBO生成了一种更紧凑的架构,具有最优的跳跃连接,其RMSE在所有对比方法中最低。
  • NASGBO在CNN和MLP基准上均比NASBOT收敛更快,尤其在Cifar10和Slice数据集上表现出显著提升的样本效率。
  • 贝叶斯GNN代理模型将训练和预测时间从高斯过程的O(N³)降低至线性时间,实现了对更大搜索空间的可扩展探索。
  • 该方法在多种架构和任务中表现出鲁棒性,始终在准确率和样本效率方面优于最先进方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。