Skip to main content
QUICK REVIEW

[论文解读] HyperNOMAD: Hyperparameter optimization of deep neural networks using mesh adaptive direct search

Dounia Lakhmiri, Sébastien Le Digabel|arXiv (Cornell University)|Jul 3, 2019
Machine Learning and Data Classification参考文献 55被引用 10
一句话总结

HyperNOMAD 提出了一种基于 NOMAD 软件中 Mesh Adaptive Direct Search(MADS)算法的无导数超参数优化框架,用于深度神经网络的超参数优化。该框架可同时调整网络架构与优化超参数(包括分类变量),在 MNIST 上实现了 99.61% 的最先进测试准确率,在 CIFAR-10 上实现了 92.54% 的最先进测试准确率,优于贝叶斯优化和随机搜索,尤其在存在不可行配置的复杂搜索空间中表现更优。

ABSTRACT

The performance of deep neural networks is highly sensitive to the choice of the hyperparameters that define the structure of the network and the learning process. When facing a new application, tuning a deep neural network is a tedious and time consuming process that is often described as a "dark art". This explains the necessity of automating the calibration of these hyperparameters. Derivative-free optimization is a field that develops methods designed to optimize time consuming functions without relying on derivatives. This work introduces the HyperNOMAD package, an extension of the NOMAD software that applies the MADS algorithm [7] to simultaneously tune the hyperparameters responsible for both the architecture and the learning process of a deep neural network (DNN), and that allows for an important flexibility in the exploration of the search space by taking advantage of categorical variables. This new approach is tested on the MNIST and CIFAR-10 data sets and achieves results comparable to the current state of the art.

研究动机与目标

  • 自动化深度神经网络中的超参数调优过程,该过程常因其复杂性和耗时性而被称为‘黑暗艺术’。
  • 解决深度学习中混合整数与分类超参数(包括网络架构与优化器设置)的优化挑战。
  • 开发一种灵活的无导数优化框架,可在不依赖梯度信息的前提下探索复杂、非凸的搜索空间。
  • 通过确保在高维、组合型搜索空间中的可行性与收敛性,超越现有超参数优化方法。

提出的方法

  • HyperNOMAD 扩展了 NOMAD 软件,应用 Mesh Adaptive Direct Search(MADS)算法,实现对深度神经网络超参数的无导数优化。
  • 该框架将整个训练与评估流程视为单一黑箱函数,封装了网络构建、训练、验证与测试的完整流程。
  • 支持混合变量优化,包括实数、整数和分类超参数,从而能够探索多样化的网络架构与学习策略。
  • MADS 算法采用网格细化策略,通过结构化、直接搜索的方式生成并评估试验点,迭代改进解。
  • 通过将搜索步长限制在可行区域内,确保算法在搜索过程中避免不可行配置(如卷积层中导致特征图大小为零的配置)。
  • HyperNOMAD 集成 PyTorch 与 Caffe,支持灵活部署,并可与其他超参数优化工具进行对比。

实验结果

研究问题

  • RQ1无导数优化框架能否有效实现对深度神经网络架构与训练超参数的同步调优?
  • RQ2在收敛速度与最终模型准确率方面,HyperNOMAD 相较于贝叶斯优化与随机搜索表现如何?
  • RQ3在单次优化运行中,分类超参数在探索多样化神经网络架构方面的潜力有多大?
  • RQ4MADS 算法如何在存在约束的高维、组合型超参数空间中维持搜索的可行性?
  • RQ5在随机搜索与贝叶斯优化频繁生成不可行配置的复杂场景中,HyperNOMAD 是否能超越现有方法?

主要发现

  • 在 MNIST 数据集上,HyperNOMAD 经过 100 次黑箱评估后达到 99.61% 的测试准确率,优于 TPE(99.17%),而随机搜索未能从初始点提升性能。
  • 在 CIFAR-10 上使用默认初始点时,HyperNOMAD 达到 77.6% 的测试准确率,显著优于 TPE(64.12%)与随机搜索(初始准确率为 28.3%,未提升)。
  • 当从 VGG-13 架构初始化时,HyperNOMAD 在 CIFAR-10 上实现最终 92.54% 的测试准确率,而 TPE 与随机搜索均未提升性能,且在 100 次评估中仅生成 50 个可行配置。
  • HyperNOMAD 展现出更优的可行性控制能力,所有 50 个评估点均保持有效,而 TPE 与随机搜索因同时改变多个超参数,频繁采样到不可行架构。
  • 该框架在两个数据集上均持续优于所有基线方法,展现出在复杂混合变量超参数搜索空间中的鲁棒性与高效性。
  • 结果表明,基于 MADS 的直接搜索在深度学习超参数优化中极为有效,尤其在约束复杂度高且目标函数不可微的场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。