Skip to main content
QUICK REVIEW

[论文解读] AUTOMATA: Gradient Based Data Subset Selection for Compute-Efficient Hyper-parameter Tuning

Krishnateja Killamsetty, Guttu Sai Abhishek|arXiv (Cornell University)|Mar 15, 2022
Machine Learning and Data Classification被引用 10
一句话总结

本文提出 Automata,一种基于梯度的数据子集选择框架,通过在小型、具有代表性的数据子集上训练而非完整数据集,加速超参数调优。通过利用梯度信息选择代表性样本,Automata 在仅损失 2% 性能的情况下,相比完整数据调优实现了 3×–30× 的加速,显著减少了视觉、文本和表格基准下的训练时间、能耗和二氧化碳排放。

ABSTRACT

Deep neural networks have seen great success in recent years; however, training a deep model is often challenging as its performance heavily depends on the hyper-parameters used. In addition, finding the optimal hyper-parameter configuration, even with state-of-the-art (SOTA) hyper-parameter optimization (HPO) algorithms, can be time-consuming, requiring multiple training runs over the entire dataset for different possible sets of hyper-parameters. Our central insight is that using an informative subset of the dataset for model training runs involved in hyper-parameter optimization, allows us to find the optimal hyper-parameter configuration significantly faster. In this work, we propose AUTOMATA, a gradient-based subset selection framework for hyper-parameter tuning. We empirically evaluate the effectiveness of AUTOMATA in hyper-parameter tuning through several experiments on real-world datasets in the text, vision, and tabular domains. Our experiments show that using gradient-based data subsets for hyper-parameter tuning achieves significantly faster turnaround times and speedups of 3$\ imes$-30$\ imes$ while achieving comparable performance to the hyper-parameters found using the entire dataset.

研究动机与目标

  • 降低深度学习中超参数调优带来的高计算和环境成本。
  • 解决现有超参数优化(HPO)方法中随机数据子集选择效率低下的问题。
  • 开发一种基于梯度标准选择信息性数据子集的方法,以提升 HPO 效率。
  • 在显著减少训练时间与能耗的前提下,实现与完整模型相当的性能。
  • 证明基于梯度的子集选择在 HPO 效率与准确性方面优于随机选择和先前方法。

提出的方法

  • Automata 使用基于梯度的数据子集选择方法,从训练数据中识别具有代表性的样本。
  • 计算模型参数相对于训练样本的梯度,并选择梯度幅值高或具有多样性的数据点。
  • 所选子集用于在超参数搜索过程中训练模型,替代完整数据集训练。
  • 该框架可与现有 HPO 调度器(如 Hyperband 和 ASHA)集成,后者利用早停机制加速搜索过程。
  • 在子集上确定最优超参数后,最终模型在完整数据集上重新训练。
  • 使用 pyJoules 和 MLCO2 计算器估算能耗与二氧化碳排放,以评估环境影响。

实验结果

研究问题

  • RQ1基于梯度的数据子集选择能否在超参数调优效率方面优于随机子集选择?
  • RQ2小型、信息丰富的数据子集在多大程度上能维持超参数搜索期间的模型性能?
  • RQ3与完整数据调优相比,Automata 在加速比、准确率和能效方面表现如何?
  • RQ4使用基于梯度的子集是否能减少超参数调优流程中的二氧化碳排放?
  • RQ5Automata 是否能在多种数据模态中实现速度、准确率与环境成本之间的理想权衡?

主要发现

  • 与完整数据超参数调优相比,Automata 实现了 3× 至 30× 的加速,性能下降极小。
  • 在视觉、文本和表格数据集上,Automata 平均仅比完整数据调优增加 1–2% 的测试误差。
  • 在 CIFAR-100 数据集上,Automata 仅使用 10% 的数据即实现 30× 加速,并将二氧化碳排放减少 90%以上。
  • 在加速比-准确率和能效权衡方面,该框架优于随机选择和 Craig 基于的子集选择方法。
  • 使用 Automata 的小型子集可显著降低能耗与二氧化碳排放——最高达 90% 的减少,尤其在 Hyperband 等激进调度器下效果更明显。
  • 在所有评估设置中,Automata 在加速比与误差权衡图的右下角区域表现最佳,表明其效率显著更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。