[论文解读] Task-Adaptive Neural Network Search with Meta-Contrastive Learning
本文提出任务自适应神经网络搜索(TANS),一种新颖的框架,可从多样化的模型库中为给定目标数据集和约束条件(如参数量)检索最优预训练神经网络。通过在跨模态潜在空间中使用近似元学习与对比损失,TANS 将数据集嵌入与高性能网络嵌入对齐,实现即时检索,其性能显著优于 NAS 和 AutoML 域基准,且训练成本大幅降低。
Most conventional Neural Architecture Search (NAS) approaches are limited in that they only generate architectures without searching for the optimal parameters. While some NAS methods handle this issue by utilizing a supernet trained on a large-scale dataset such as ImageNet, they may be suboptimal if the target tasks are highly dissimilar from the dataset the supernet is trained on. To address such limitations, we introduce a novel problem of \emph{Neural Network Search} (NNS), whose goal is to search for the optimal pretrained network for a novel dataset and constraints (e.g. number of parameters), from a model zoo. Then, we propose a novel framework to tackle the problem, namely \emph{Task-Adaptive Neural Network Search} (TANS). Given a model-zoo that consists of network pretrained on diverse datasets, we use a novel amortized meta-learning framework to learn a cross-modal latent space with contrastive loss, to maximize the similarity between a dataset and a high-performing network on it, and minimize the similarity between irrelevant dataset-network pairs. We validate the effectiveness and efficiency of our method on ten real-world datasets, against existing NAS/AutoML baselines. The results show that our method instantly retrieves networks that outperform models obtained with the baselines with significantly fewer training steps to reach the target performance, thus minimizing the total cost of obtaining a task-optimal network. Our code and the model-zoo are available at https://github.com/wyjeong/TANS.
研究动机与目标
- 为解决传统神经架构搜索(NAS)方法仅搜索架构而未优化参数所带来的局限性,避免在新任务上产生高昂的训练成本。
- 克服基于超网络的 NAS 在目标数据集与源预训练数据差异显著时(如医学图像或工业图像)的次优性能问题。
- 提出一种新的问题形式化——神经网络搜索(NNS),聚焦于在约束条件下,为新数据集检索最佳预训练网络(架构 + 权重)。
- 通过即时检索与任务相关的模型,实现快速、低成本的适应,避免昂贵的架构搜索与微调。
- 构建一个由在多样化真实世界数据集上预训练的最先进网络组成的模型库,以支持高效的跨模态检索。
提出的方法
- 构建一个包含在多样化真实世界数据集上预训练的最先进神经网络的模型库,作为检索的候选模型。
- 使用集合编码器将每个目标数据集嵌入到潜在表征中,以捕捉其功能特性和拓扑特性。
- 通过功能和拓扑嵌入对每个预训练网络进行编码,以表征其性能潜力。
- 训练一个跨模态对比学习目标,最大化数据集与高性能网络之间的相似性,同时最小化与无关配对之间的相似性。
- 引入性能预测器,通过预测模型在未见数据集上的准确率来引导学习过程。
- 采用近似元学习,学习一个共享的、任务自适应的潜在空间,以在多样化数据集和模型类型间实现良好泛化。
实验结果
研究问题
- RQ1在为新数据集搜索最优网络时,基于检索的方法是否能在最终准确率和训练效率方面优于传统 NAS 和 AutoML 方法?
- RQ2所提出的跨模态对比学习框架在对齐数据集与网络嵌入以识别最合适的预训练模型方面,效果如何?
- RQ3与随机采样相比,基于多样化预训练数据的模型库构建策略在多大程度上提升了检索性能?
- RQ4性能预测器的引入在多大程度上提升了检索系统的准确率与泛化能力?
- RQ5与基线方法相比,所提出的 TANS 框架是否能显著减少达到目标性能所需的训练步数?
主要发现
- TANS 在十个真实世界数据集上表现优异,始终在最终准确率上超越现有的 NAS 和 AutoML 基线方法。
- 该方法将达到目标性能所需的训练步数减少了数量级,显著降低了总成本。
- 基于多样化预训练数据构建的模型库,其样本效率高于随机采样数据集-网络配对的方式。
- TANS 实现了无需额外架构搜索或微调的即时任务自适应模型检索,以极低的推理成本实现了最先进性能。
- 对比学习目标有效对齐了数据集与网络嵌入,实现了在异构数据分布下对高性能模型的准确检索。
- 性能预测器通过引导模型优先选择在查询数据集上预测性能更高的网络,提升了检索准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。