[论文解读] Speeding up NAS with Adaptive Subset Selection
该论文提出了一种名为 Adaptive-Dpt 的新型神经架构搜索(NAS)方法,通过将自适应子集选择与单次训练 NAS 相结合,显著降低了训练时间,同时保持了模型精度。通过在搜索过程中动态选择具有代表性的训练子集,该方法在 CIFAR-10 和 ImageNet-1K 上实现了高达 10 倍的加速,同时保持了最先进性能。
A majority of recent developments in neural architecture search (NAS) have been aimed at decreasing the computational cost of various techniques without affecting their final performance. Towards this goal, several low-fidelity and performance prediction methods have been considered, including those that train only on subsets of the training data. In this work, we present an adaptive subset selection approach to NAS and present it as complementary to state-of-the-art NAS approaches. We uncover a natural connection between one-shot NAS algorithms and adaptive subset selection and devise an algorithm that makes use of state-of-the-art techniques from both areas. We use these techniques to substantially reduce the runtime of DARTS-PT (a leading one-shot NAS algorithm), as well as BOHB and DEHB (leading multifidelity optimization algorithms), without sacrificing accuracy. Our results are consistent across multiple datasets, and towards full reproducibility, we release our code at https: //anonymous.4open.science/r/SubsetSelection NAS-B132.
研究动机与目标
- 在保持模型精度的前提下,降低神经架构搜索(NAS)的高计算成本。
- 解决现有单次训练 NAS 方法(如 DARTS-PT)尽管进行了架构优化,但依然效率低下的问题。
- 通过利用双层优化框架,弥合高效训练中的自适应子集选择与 NAS 之间的差距。
- 开发一种可泛化的框架,通过自适应数据子集使用,提升多保真度 NAS 算法(如 BOHB 和 DEHB)的性能。
提出的方法
- 将 DARTS-PT 与 GLISTER 相结合,构建一个混合离散-连续的双层优化问题,实现对架构权重、模型权重和自适应训练子集的联合优化。
- 利用 GLISTER 的自适应子集选择方法,在 NAS 搜索过程中迭代更新具有代表性的训练数据子集,将数据规模减少至完整数据集的 10%。
- 将自适应子集选择集成到多保真度 NAS 流程中,构建 Adaptive-BOHB 和 Adaptive-DEHB,以加速超参数优化。
- 对子集选择过程应用时间调度更新策略,确保模型性能在整个搜索过程中保持稳定。
- 利用单次训练 NAS 与自适应子集选择之间的天然对偶性,二者均被建模为在训练集和验证集上的双层问题。
- 发布一个统一的代码库,将四种子集选择方法(设施选址、熵、随机、GLISTER)整合进单次训练 NAS 中,以支持可复现性和基准测试。
实验结果
研究问题
- RQ1自适应子集选择能否与单次训练 NAS 有效结合,在不降低性能的前提下减少搜索时间?
- RQ2当在动态更新的小型训练数据子集上训练时,NAS 算法的性能如何变化?
- RQ3自适应子集选择在多保真度 NAS 算法(如 BOHB 和 DEHB)中能实现多大程度的加速?
- RQ4在 NAS 中,设施选址是否是一种可行且有效的子集选择基线方法,尤其与基于熵或随机选择相比?
- RQ5自适应子集选择的集成是否能实现 NAS 流程中二氧化碳排放和计算成本的净减少?
主要发现
- 在 CIFAR-10 的 S4 搜索空间上,Adaptive-Dpt 将 GPU 小时数从 33.50 减少至 2.60(减少 92.2%),同时将测试准确率从 35.00% 提升至 36.10%。
- 在 DARTS 搜索空间上,Adaptive-Dpt 将 GPU 小时数从 20.59 减少至 2.75(减少 86.7%),测试准确率保持相当(96.73% ± 0.29 vs. DARTS-PT 的 97.17%)。
- 在 NAS-Bench-201 上,Adaptive-Dpt 仅使用 10% 的训练数据和 0.87 GPU 小时,即在 CIFAR-10 上实现了 88.83% ± 1.09 的测试准确率,达到或超过基线方法。
- Adaptive-BOHB 和 Adaptive-DEHB 分别在 BOHB 和 DEHB 的基础上实现了显著加速,且最终架构性能无下降。
- 实验表明,将设施选址作为 NAS 中的子集选择基线方法是有效的,在多种设置下优于随机选择和基于熵的选择。
- 运行时间减少在多个数据集和搜索空间上均保持一致,证明了自适应子集选择方法的泛化性和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。