[论文解读] Neural Data Server: A Large-Scale Search Engine for Transfer Learning Data
Neural Data Server (NDS) 是一个大规模搜索引擎,通过使用紧凑的专家混合模型(MoE)对主要公开图像数据集进行索引,为迁移学习推荐最优预训练数据。它使客户端仅使用完整数据集20%的规模,即可在下游任务中实现最先进(SOTA)的性能表现——在显著减少训练时间和计算成本的同时,达到与完整图像预训练相当或更优的准确率。
Transfer learning has proven to be a successful technique to train deep learning models in the domains where little training data is available. The dominant approach is to pretrain a model on a large generic dataset such as ImageNet and finetune its weights on the target domain. However, in the new era of an ever-increasing number of massive datasets, selecting the relevant data for pretraining is a critical issue. We introduce Neural Data Server (NDS), a large-scale search engine for finding the most useful transfer learning data to the target domain. NDS consists of a dataserver which indexes several large popular image datasets, and aims to recommend data to a client, an end-user with a target application with its own small labeled dataset. The dataserver represents large datasets with a much more compact mixture-of-experts model, and employs it to perform data search in a series of dataserver-client transactions at a low computational cost. We show the effectiveness of NDS in various transfer learning scenarios, demonstrating state-of-the-art performance on several target datasets and tasks such as image classification, object detection and instance segmentation. Neural Data Server is available as a web-service at http://aidemos.cs.toronto.edu/nds/.
研究动机与目标
- 解决在迁移学习中从海量且持续增长的公开数据集中选择最相关预训练数据的关键挑战。
- 通过实现高效、数据高效的高价值样本选择,减轻大规模数据集预训练带来的计算与财务负担。
- 通过确保客户端数据在推荐过程中不暴露给服务器,保护客户端隐私。
- 最小化服务器端的在线计算量,以支持多客户端并行处理的高吞吐量、可扩展服务。
- 通过利用在所选数据上进行的自监督预训练,即使在低资源场景(包括无标注数据的情况)下,也能实现有效的迁移学习。
提出的方法
- 使用紧凑的专家混合模型(MoE)对多个大型公开图像数据集(如 COCO、OpenImages)进行索引,以捕捉数据分布模式。
- 在索引的数据集中训练 MoE 模型,学习不同视觉概念的专家特定表示。
- 利用客户端的小型标注目标数据集,评估每个专家在目标任务上的准确率,作为数据有用性的代理指标。
- 根据专家在客户端数据上的表现,对服务器索引数据集中的数据样本进行排序并推荐,优先选择高价值样本。
- 通过将 MoE 模型适配到不同掩码任务(如实例判别、旋转预测)来支持监督和自监督预训练。
- 以公开可用数据的链接形式交付推荐结果,避免数据托管,确保符合许可和隐私约束。
实验结果
研究问题
- RQ1一个可扩展且保护隐私的搜索引擎能否有效识别特定目标领域最有效的预训练数据?
- RQ2紧凑的 MoE 模型在多大程度上能准确表示大规模数据集,并指导迁移学习中的数据选择?
- RQ3选择一个小型、高价值的数据子集(如 20%)是否能带来优于随机采样或完整数据集预训练的下游性能?
- RQ4在多样化的下游任务中,NDS 的性能与标准 ImageNet 预训练相比,在准确率和效率方面如何?
- RQ5NDS 框架能否推广到自监督预训练范式?不同掩码任务的选择如何影响数据选择的有效性?
主要发现
- NDS 仅使用完整数据集 20% 的规模,就在图像分类、目标检测和实例分割任务中实现了最先进(SOTA)的性能表现。
- 在 Cityscapes 数据集上,NDS 选择的预训练数据在 23K 张图像下实现了 54.62% 的掩码 AP,优于均匀采样(54.01%),且在显著减少数据量的情况下达到与完整数据集预训练相当的结果。
- 在使用 RotNet 的自监督预训练中,NDS 选择的数据相比均匀采样提升了 0.31%(72.85% vs. 72.59%),证明其在对比学习设置下的有效性。
- 在 MoCo 预训练中,NDS 选择的数据在 Oxford-IIIT Pets 数据集上实现了 61.49% 的 top-1 准确率,优于均匀采样(60.25%),并接近完整数据集预训练的性能(67.54%)。
- NDS 将所需预训练数据从 538 GB 减少至仅 26 GB,同时实现优于或与完整数据集预训练相当的性能,将训练时间从数周缩短至数天。
- 该方法可推广至零样本和自监督设置,在客户端无任何标注数据时仍能通过 MoE 模型上的代理任务表现持续获得性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。