[论文解读] TAPAS: Train-less Accuracy Predictor for Architecture Search
TAPAS 是一种无需训练的深度学习精度预测器,通过利用数据集难度表征和先前实验的终身经验,可在不到一秒内预测卷积神经网络(CNN)架构在未见过的数据集上的峰值验证精度。它仅用单张GPU在10分钟内即可完成大规模架构搜索,所发现的模型在CIFAR-10上达到93.67%的准确率,在CIFAR-100上达到81.01%的准确率,性能与最先进方法相当或更优,且在搜索过程中无需任何训练。
In recent years an increasing number of researchers and practitioners have been suggesting algorithms for large-scale neural network architecture search: genetic algorithms, reinforcement learning, learning curve extrapolation, and accuracy predictors. None of them, however, demonstrated high-performance without training new experiments in the presence of unseen datasets. We propose a new deep neural network accuracy predictor, that estimates in fractions of a second classification performance for unseen input datasets, without training. In contrast to previously proposed approaches, our prediction is not only calibrated on the topological network information, but also on the characterization of the dataset-difficulty which allows us to re-tune the prediction without any training. Our predictor achieves a performance which exceeds 100 networks per second on a single GPU, thus creating the opportunity to perform large-scale architecture search within a few minutes. We present results of two searches performed in 400 seconds on a single GPU. Our best discovered networks reach 93.67% accuracy for CIFAR-10 and 81.01% for CIFAR-100, verified by training. These networks are performance competitive with other automatically discovered state-of-the-art networks however we only needed a small fraction of the time to solution and computational resources.
研究动机与目标
- 为解决基于训练的神经架构搜索(NAS)方法因需要数千次训练运行而导致的高计算成本问题。
- 开发一种可泛化的精度预测器,可在无需微调或重新训练的情况下适用于未见过的数据集。
- 通过消除搜索过程中的训练需求,实现计算开销极小的大规模架构搜索。
- 通过整合数据集难度表征和先前实验的终身经验,提升预测精度。
提出的方法
- TAPAS 使用深度神经网络,基于网络拓扑结构和输入数据集的难度,预测CNN架构的峰值精度,而无需在目标数据集上进行任何训练。
- 它引入了一个数据集难度表征(DDC)模块,通过统计和结构特征量化数据集的复杂性,从而实现对未见过数据集的泛化能力。
- 该框架采用一种终身数据集嵌入(LDE)预过滤机制,根据数据集难度的相似性筛选相关的历史实验,提升预测的可靠性。
- 提出一种新颖的无训练自适应机制,仅利用DDC分数和历史实验数据,即可动态调整新数据集的预测结果。
- 模型在涵盖多样化数据集的终身实验数据库上进行训练,实现迁移学习和持续改进,而无需对新数据重新训练。
- TAPAS 可集成至进化搜索流程中,将昂贵的训练评估替换为快速且准确的预测,从而模拟大规模架构搜索。
实验结果
研究问题
- RQ1能否开发一种深度学习精度预测器,使其在无需在目标数据集上进行任何训练的情况下,泛化到未见过的数据集?
- RQ2引入数据集难度表征后,如何提升在多样化数据集上的预测精度?
- RQ3与需要对每个网络进行部分或完整训练的现有方法相比,无训练预测器在多大程度上能实现性能超越?
- RQ4TAPAS 是否能实现计算成本和时间降低数个数量级的大规模架构搜索?
主要发现
- TAPAS 在CIFAR-10上为最佳发现的网络实现了93.67%的top-1准确率,在CIFAR-100上实现了81.01%的准确率,经完整训练验证。
- 该框架在单张GPU上仅用400秒完成大规模架构搜索,性能与最先进NAS方法相当。
- TAPAS 在已见和未见数据集场景下均优于现有方法(如Peephole、LCE、BNN和ν-SVR),尤其在需要泛化能力时表现更优。
- 引入数据集难度表征和LDE预过滤机制显著提升了预测精度,即使在完全新的数据集上也表现优异。
- 使用TAPAS进行模拟进化(20,000次变异)时,每数据集仅需2×10¹¹ FLOPs,而参考工作[16]需9×10¹⁹ FLOPs,运行时间从256小时缩短至10分钟以内。
- TAPAS 在单张GPU上可实现每秒100多个预测,使无需训练的实时大规模架构搜索成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。