Skip to main content
QUICK REVIEW

[论文解读] A Practical Bandit Method with Advantages in Neural Network Tuning.

Tianyu Wang, Dawei Geng|arXiv (Cornell University)|Jan 26, 2019
Advanced Bandit Algorithms Research参考文献 23被引用 4
一句话总结

本文提出了一种实用的随机多臂赌博机方法,通过自适应地对超参数、模型上下文和训练资源(例如迭代次数)的联合空间进行划分,以改进神经网络超参数调优。通过动态聚焦于有前景的区域并整合资源分配,该方法在基准数据集上实现了最先进水平的准确率,同时与现有方法相比将训练资源使用量减少了50%以上。

ABSTRACT

Stochastic bandit algorithms can be used for challenging non-convex optimization problems. Hyperparameter tuning of neural networks is particularly challenging, necessitating new approaches. To this end, we present a method that adaptively partitions the combined space of hyperparameters, context, and training resources (e.g., total number of training iterations). By adaptively partitioning the space, the algorithm is able to focus on the portions of the hyperparameter search space that are most relevant in a practical way. By including the resources in the combined space, the method tends to use fewer training resources overall. Our experiments show that this method can surpass state-of-the-art methods in tuning neural networks on benchmark datasets. In some cases, our implementations can achieve the same levels of accuracy on benchmark datasets as existing state-of-the-art approaches while saving over 50% of our computational resources (e.g. time, training iterations).

研究动机与目标

  • 解决深度神经网络中非凸超参数调优的挑战,其中传统方法效率低下且缺乏适应性。
  • 克服现有赌博机算法的局限性,这些算法未在统一的优化空间中考虑训练资源分配。
  • 开发一种方法,能够自适应地将搜索重点集中于联合超参数与资源空间中最具前景的区域。
  • 在不牺牲基准数据集上模型性能的前提下,降低整体计算成本(以训练迭代次数或时间衡量)。

提出的方法

  • 该方法将超参数、模型上下文(例如架构或数据集)和训练资源(例如训练迭代次数)联合建模于单一搜索空间中。
  • 它采用自适应划分方法,根据观测到的性能将联合空间划分为多个区域,从而实现对高性能区域的聚焦探索。
  • 该算法采用随机多臂赌博机框架,在划分后的空间中平衡探索与利用。
  • 资源分配被整合到优化过程中,使该方法能够优先在无产出的区域进行较短的训练运行,在高潜力区域进行更长的训练运行。
  • 每次配置的性能反馈被用于迭代更新划分和分配决策。
  • 该方法根据观测到的性能方差和收敛趋势,动态调整划分的粒度。

实验结果

研究问题

  • RQ1是否能够通过将训练资源纳入搜索空间的统一赌博机框架,在准确率和效率两方面均优于最先进水平的超参数调优方法?
  • RQ2对联合超参数-资源空间进行自适应划分,在不降低模型性能的前提下,能在多大程度上减少所需的训练迭代次数?
  • RQ3在搜索空间中引入上下文信息(例如数据集或模型类型)如何影响调优过程的收敛性和鲁棒性?
  • RQ4在何种场景下,该方法能够实现超过50%的计算资源减少,同时保持或提升模型准确率?

主要发现

  • 所提出的方法在基准神经网络数据集上实现了最先进水平的测试准确率,性能与现有方法相当或更优。
  • 在多个基准数据集上,该方法在保持相同准确率的前提下,将所需训练迭代次数减少了50%以上,优于基线方法。
  • 将训练资源整合到搜索空间中,实现了更高效的资源分配,避免了在无前景配置中进行浪费性的长时间训练。
  • 自适应划分使算法能够将计算资源集中于超参数空间的高性能区域,从而加快收敛速度。
  • 该方法在不同神经网络架构和数据集上表现出鲁棒性,表明其具有广泛的适用性。
  • 该方法显著降低了超参数调优的总体计算成本,使其在真实世界深度学习工作流中更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。