[论文解读] Automatic Configuration of Deep Neural Networks with EGO
本文提出一种并行高效全局优化(EGO)框架,通过完全可配置的全卷积神经网络(All-CNN)设计,自动配置卷积神经网络(CNN)架构。通过支持多个架构的并行评估,并仅在超参数和层配置上进行优化,该方法仅用10–50次训练周期和200次评估,就在MNIST和CIFAR-10上实现了最先进(SOTA)的准确率,优于未使用数据增强的手动设计模型。
Designing the architecture for an artificial neural network is a cumbersome task because of the numerous parameters to configure, including activation functions, layer types, and hyper-parameters. With the large number of parameters for most networks nowadays, it is intractable to find a good configuration for a given task by hand. In this paper an Efficient Global Optimization (EGO) algorithm is adapted to automatically optimize and configure convolutional neural network architectures. A configurable neural network architecture based solely on convolutional layers is proposed for the optimization. Without using any knowledge on the target problem and not using any data augmentation techniques, it is shown that on several image classification tasks this approach is able to find competitive network architectures in terms of prediction accuracy, compared to the best hand-crafted ones in literature. In addition, a very small training budget (200 evaluations and 10 epochs in training) is spent on each optimized architectures in contrast to the usual long training time of hand-crafted networks. Moreover, instead of the standard sequential evaluation in EGO, several candidate architectures are proposed and evaluated in parallel, which saves the execution overheads significantly and leads to an efficient automation for deep neural network design.
研究动机与目标
- 为解决手动设计深度神经网络架构所面临的挑战,即由于高维异构搜索空间导致耗时且次优。
- 通过在有限评估预算下采用贝叶斯优化方法,降低在超参数和架构搜索过程中训练深度网络的计算负担。
- 通过在每次EGO迭代中支持多个候选架构的并行评估,提升神经架构搜索的效率,减少执行开销。
- 证明自动化架构配置可实现与手工设计模型相当的性能,即使在无数据增强或任务先验知识的情况下亦成立。
提出的方法
- 设计了一种可配置的All-CNN架构,仅包含卷积层,支持对深度、宽度、卷积核大小和激活函数的灵活配置。
- 对EGO算法进行改进,使每次迭代可并行生成多个候选架构,而非顺序生成,从而加速搜索过程。
- 使用高斯过程代理模型,基于先前评估结果预测验证准确率,指导对有前景架构的选择。
- 优化过程采用有限的训练预算(MNIST为10个周期,CIFAR-10为50个周期),且不使用数据增强。
- 搜索空间定义在超参数上,如层数、滤波器大小和激活函数,不引入任何架构归纳偏置。
- 该方法被应用于基准图像分类任务以及塔塔钢铁公司实际的钢板表面缺陷检测问题。
实验结果
研究问题
- RQ1基于并行EGO的方法能否在极少人工干预和极小训练预算下自动发现高性能的CNN架构?
- RQ2在标准图像分类基准上,自动配置的All-CNN性能与手工设计的最先进模型相比如何?
- RQ3所提出的方法在无任务特定数据增强的情况下,对实际工业应用(如钢板表面缺陷检测)的泛化能力如何?
- RQ4与串行EGO相比,并行EGO策略在减少神经架构搜索总执行时间方面有多高效?
- RQ5该方法是否能在每个候选网络仅训练10–50个周期的情况下仍实现高准确率?
主要发现
- 在真实世界的钢板表面缺陷检测任务中,所提方法实现了接近90%的真正例率和仅0.5%的假正例率,显著优于手工设计的基线模型。
- 在MNIST数据集上,优化后的All-CNN仅用10次训练周期和200次评估即达到具有竞争力的准确率,且未使用数据增强。
- 在CIFAR-10上,优化后的架构仅用50次训练周期和200次评估即达到高准确率,展现出在极小训练预算下的强大泛化能力。
- 与串行EGO相比,并行EGO策略显著降低了执行开销,实现了对高性能架构的更快收敛。
- 针对钢板缺陷检测任务优化的网络展现出更好的泛化能力,且在重训练和验证过程中几乎无需领域特定知识。
- 该方法成功发现了有效的架构,且未依赖对数据集的先验知识或数据增强技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。