[论文解读] Efficient Forward Architecture Search
该论文提出 Petridish,一种前向神经架构搜索(NAS)算法,通过在中间层上使用类似梯度提升的更新方式,迭代地添加跳跃连接来逐步构建神经网络。通过联合训练所有候选跳跃连接并应用 L1 正则化进行选择,Petridish 在少数 GPU 天内实现了具有竞争力的性能——在细胞搜索和宏观搜索设置下均达到或超越当前最先进结果,尤其在热启动和终身学习场景中表现优异。
We propose a neural architecture search (NAS) algorithm, Petridish, to iteratively add shortcut connections to existing network layers. The added shortcut connections effectively perform gradient boosting on the augmented layers. The proposed algorithm is motivated by the feature selection algorithm forward stage-wise linear regression, since we consider NAS as a generalization of feature selection for regression, where NAS selects shortcuts among layers instead of selecting features. In order to reduce the number of trials of possible connection combinations, we train jointly all possible connections at each stage of growth while leveraging feature selection techniques to choose a subset of them. We experimentally show this process to be an efficient forward architecture search algorithm that can find competitive models using few GPU days in both the search space of repeatable network modules (cell-search) and the space of general networks (macro-search). Petridish is particularly well-suited for warm-starting from existing models crucial for lifelong-learning scenarios.
研究动机与目标
- 为解决现有 NAS 方法存在的高计算成本和低效率问题,特别是那些依赖于独立训练候选架构的方法。
- 实现高效、增量式的模型扩展,支持从现有模型进行热启动以及终身学习,而无需从头开始训练。
- 证明基于特征选择思想的前向搜索方法可与或优于传统的反向搜索或基于采样的 NAS 方法。
- 表明当结合高效搜索策略时,通常被认为劣于细胞搜索的宏观搜索也能实现具有竞争力的性能。
- 通过利用候选连接的联合训练与稀疏性诱导正则化,减少搜索时间并提高样本效率。
提出的方法
- 该算法通过在现有层之间添加跳跃连接,逐步构建网络,模拟前向阶段式线性回归过程。
- 在每个阶段,所有可能的跳跃连接均使用共享模型联合训练,从而实现对架构空间的高效探索。
- 对候选跳跃连接的权重施加 L1 正则化,以促进稀疏性并选择最有效的连接。
- 该方法受 LARS(最小角回归)算法启发,并将梯度提升原理应用于中间特征层。
- 该方法同时支持细胞搜索(重复学习到的细胞模式)和宏观搜索(自由形式的连接模式),在两者中均表现出一致的性能。
- 通过参数共享技术,同时训练所有候选架构的并集,从而减少对每个候选架构独立训练的需求。
实验结果
研究问题
- RQ1基于中间层梯度提升的前向架构搜索策略,是否能在显著降低搜索成本的前提下实现具有竞争力的性能?
- RQ2在准确率和效率方面,前向 NAS 与现有基于采样和超图的 NAS 方法相比表现如何?
- RQ3当结合高效搜索算法时,传统上被认为劣于细胞搜索的宏观搜索能否实现最先进性能?
- RQ4初始模型质量在多大程度上影响搜索过程的最终性能?
- RQ5所提出方法是否能自然生成一系列复杂度与准确率各异的模型,适用于终身学习和迁移学习?
主要发现
- 在细胞搜索设置下,Petridish 在 CIFAR-10 上仅用 2.8M 参数和 10.5 GPU 天即达到 2.88% 的测试误差率,显著优于以往方法的性价比表现。
- Petridish 的宏观搜索变体在 ImageNet 上以 4.3M 参数和 511M 次乘加操作达到 28.7% 的 top-1 错误率,与最先进的人工设计模型相当。
- 经迁移的 Petridish 细胞搜索模型在 ImageNet 上达到 26.3% 的错误率,参数量为 4.8M,乘加操作为 598M,与现有最佳结果相当。
- 多次独立的 Petridish 细胞搜索运行结果一致(平均误差 2.88% ± 0.15),表明其对随机初始化和超参数变化具有鲁棒性。
- 该算法找到了一组复杂度与准确率各异的模型,形成自然的性能谱系,适用于不同硬件约束下的部署。
- 与早期 NAS 方法(如 NASNet 和 AmoebaNet)相比,Petridish 将搜索时间减少了 1 至 2 个数量级,后者需独立训练每个架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。