[论文解读] Neural Architecture Optimization with Graph VAE
该论文提出NGAE,一种基于梯度的神经架构搜索框架,利用图变分自编码器(GVAE)与图神经网络将神经架构嵌入连续潜在空间。通过端到端联合训练性能预测器与复杂度预测器,NGAE 实现了对高精度与低计算成本架构的高效优化,在CIFAR-10上取得了最先进性能,精度损失极小,复杂度显著降低。
Due to their high computational efficiency on a continuous space, gradient optimization methods have shown great potential in the neural architecture search (NAS) domain. The mapping of network representation from the discrete space to a latent space is the key to discovering novel architectures, however, existing gradient-based methods fail to fully characterize the networks. In this paper, we propose an efficient NAS approach to optimize network architectures in a continuous space, where the latent space is built upon variational autoencoder (VAE) and graph neural networks (GNN). The framework jointly learns four components: the encoder, the performance predictor, the complexity predictor and the decoder in an end-to-end manner. The encoder and the decoder belong to a graph VAE, mapping architectures between continuous representations and network architectures. The predictors are two regression models, fitting the performance and computational complexity, respectively. Those predictors ensure the discovered architectures characterize both excellent performance and high computational efficiency. Extensive experiments demonstrate our framework not only generates appropriate continuous representations but also discovers powerful neural architectures.
研究动机与目标
- 解决现有基于梯度的NAS方法在建模架构结构与计算复杂度方面存在的局限性。
- 通过使用图VAE与GNN学习平滑且解耦的潜在空间,实现神经架构在连续空间中的高效优化。
- 通过端到端训练性能预测器与复杂度预测器,联合优化模型性能与计算效率。
- 通过将预测模型直接集成到VAE框架中,避免独立的训练流程,从而提升泛化能力与搜索效率。
提出的方法
- 采用基于图神经网络(GNN)的编码器,将离散的神经架构表示映射到连续潜在空间。
- 使用带有KL正则化的变分自编码器(VAE)框架,确保潜在空间平滑且结构良好,以利于优化。
- 以端到端方式训练两个独立的回归模型(预测器):一个用于预测模型精度,另一个用于预测FLOPs(计算复杂度)。
- 使用随机梯度上升法优化潜在表示,以最大化性能预测器与复杂度预测器输出的综合结果。
- 使用基于GNN的解码器,从优化后的潜在向量中重建出有效的神经架构。
- 通过反向传播联合训练编码器、解码器以及两个预测器,确保在整个搜索空间中保持一致性与泛化能力。
实验结果
研究问题
- RQ1基于GNN的图VAE能否有效学习到用于神经架构表示的连续、平滑且解耦的潜在空间?
- RQ2在潜在空间中对性能与复杂度预测器进行端到端训练,是否能相比独立训练方式带来更优的架构搜索效率与泛化能力?
- RQ3将计算复杂度作为预测目标引入,是否能在不牺牲性能的前提下提升所发现架构的实际可用性?
- RQ4潜在空间的平滑性如何支持基于梯度的神经架构搜索的有效优化?
- RQ5所提出的框架能否在标准基准上发现新颖、高性能且高效的架构,超越现有NAS方法?
主要发现
- 经过300个训练周期后,图VAE的重建准确率从82.83%提升至99.99%,表明潜在空间学习质量极高。
- 精度预测模型拟合效果良好,预测值与真实值高度一致(R²接近1),如在测试集评估中所示。
- 性能预测器的RMSE在训练集与测试集上均收敛至极小值,证实其具备强大的泛化能力。
- 在推理过程中使用随机梯度上升法进行预测精度优化时,结果在多轮迭代中表现出稳定收敛,优于以往方法采用的一次更新策略。
- NGAE在CIFAR-10上发现的架构达到Top-3性能,其精度与未引入复杂度预测器的NGAE相当,但FLOPs显著降低。
- 消融实验表明,联合训练VAE与预测器相比分别训练(如使用贝叶斯优化的D-VAE)能显著提升搜索质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。