Skip to main content
QUICK REVIEW

[论文解读] Internet Explorer: Targeted Representation Learning on the Open Web

Alexander C. Li, Ellis V. Brown|arXiv (Cornell University)|Feb 27, 2023
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

Internet Explorer 提出了一种自监督、主动学习的框架,通过基于文本的搜索动态查询开放网络,迭代式地为特定视觉任务收集相关训练数据。通过在查询、自监督训练和查询优化之间循环,该方法仅使用单张 GPU 和 30–40 小时的搜索时间,性能即达到或超过 CLIP 原型模型,优于基于图像的检索和无方向的网络搜索方法。

ABSTRACT

Modern vision models typically rely on fine-tuning general-purpose models pre-trained on large, static datasets. These general-purpose models only capture the knowledge within their pre-training datasets, which are tiny, out-of-date snapshots of the Internet -- where billions of images are uploaded each day. We suggest an alternate approach: rather than hoping our static datasets transfer to our desired tasks after large-scale pre-training, we propose dynamically utilizing the Internet to quickly train a small-scale model that does extremely well on the task at hand. Our approach, called Internet Explorer, explores the web in a self-supervised manner to progressively find relevant examples that improve performance on a desired target dataset. It cycles between searching for images on the Internet with text queries, self-supervised training on downloaded images, determining which images were useful, and prioritizing what to search for next. We evaluate Internet Explorer across several datasets and show that it outperforms or matches CLIP oracle performance by using just a single GPU desktop to actively query the Internet for 30--40 hours. Results, visualizations, and videos at https://internet-explorer-ssl.github.io/

研究动机与目标

  • 解决静态预训练视觉模型因过时而无法捕捉动态、现实世界视觉概念的局限性。
  • 通过主动、自监督探索开放网络,而非大规模预训练,克服大模型预训练的低效性,构建轻量级、任务特定的模型。
  • 实现在无标注数据或静态数据集依赖下的高效、低计算量视觉模型适应新任务或细粒度分类任务。
  • 证明有针对性的、迭代式网络查询可实现优于被动数据收集或基于图像的检索的表征学习效果。

提出的方法

  • 该系统作为在线智能体,交替执行文本查询制定、从搜索引擎检索图像,并对收集的数据进行自监督训练。
  • 使用自监督对比学习目标(如 MoCo-v3)对下载的图像进行训练,随时间推移逐步提升特征质量。
  • 通过目标数据集的特征对齐评估检索图像的相关性,指导未来查询的优先级排序。
  • 智能体从预训练模型(如 MoCo-v3)开始,根据哪些图像最能提升下游性能,逐步优化搜索查询。
  • 将互联网视为一个动态、开放的数据集,实现无需人工整理或标注的持续训练数据扩展。
  • 该方法兼容任何基于文本的搜索引擎,无需图像间相似性匹配或付费 API。

实验结果

研究问题

  • RQ1在计算资源极少的情况下,主动的、自监督的开放网络探索是否能优于静态预训练在下游视觉任务上的表现?
  • RQ2与基于图像的检索(如使用 CLIP 特征)相比,有针对性的基于文本的网络查询在特征质量与泛化能力方面表现如何?
  • RQ3通过迭代式网络探索训练的小规模模型能否达到或超越大型预训练原型模型(如 CLIP)的性能?
  • RQ4与直接基于图像相似性的搜索相比,使用文本作为查询瓶颈在多大程度上促进了多样性与泛化?
  • RQ5基于模型性能持续优化查询是否比固定或无方向的搜索策略带来更有效的数据收集?

主要发现

  • Internet Explorer 在 7 个多样化数据集上表现优于或匹配 CLIP 原型模型,包括细粒度数据集和基准数据集(如 PASCAL VOC 和 ImageNet-100)。
  • 在 Flowers、Pets 和 VOC2007 数据集上,Internet Explorer 分别实现了 98.8%、87.0% 和 76.1% 的 k-NN 准确率,超过使用相同数据和超参数的图像间基线模型。
  • 尽管图像间基线模型使用了强大的 CLIP ViT-L/14 特征并下载了 100 万张图像,但其学习到的特征仍劣于 Internet Explorer,可能由于数据冗余和缺乏多样性。
  • Internet Explorer 在 30–40 小时内执行了超过 10,000 次逐步优化的查询,下载了超过 100 万张相关图像,仅使用单张 3090 GPU。
  • 该方法显著优于无方向网络搜索和固定查询方法,证明了反馈驱动、有针对性探索的价值。
  • 从 MoCo-v3 开始并利用检索图像进行自监督学习,显著提升了目标数据集上的性能,验证了迭代优化循环的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。