Skip to main content
QUICK REVIEW

[论文解读] Towards General Purpose Vision Systems

Tanmay Gupta, Amita Kamath|arXiv (Cornell University)|Apr 1, 2021
Multimodal Machine Learning Applications参考文献 56被引用 6
一句话总结

本文提出 GPV-1,一种端到端、任务无关的视觉语言架构,仅使用图像和自然语言任务描述作为输入,即可执行多种视觉任务(如视觉问答、定位、图像字幕和分类)。该模型在指代表达任务上实现了强大的零样本性能,并通过多任务预训练提升了样本效率,展示了在无需架构修改的情况下跨技能和概念的泛化能力。

ABSTRACT

Computer vision systems today are primarily N-purpose systems, designed and trained for a predefined set of tasks. Adapting such systems to new tasks is challenging and often requires non-trivial modifications to the network architecture (e.g. adding new output heads) or training process (e.g. adding new losses). To reduce the time and expertise required to develop new applications, we would like to create general purpose vision systems that can learn and perform a range of tasks without any modification to the architecture or learning process. In this paper, we propose GPV-1, a task-agnostic vision-language architecture that can learn and perform tasks that involve receiving an image and producing text and/or bounding boxes, including classification, localization, visual question answering, captioning, and more. We also propose evaluations of generality of architecture, skill-concept transfer, and learning efficiency that may inform future work on general purpose vision. Our experiments indicate GPV-1 is effective at multiple tasks, reuses some concept knowledge across tasks, can perform the Referring Expressions task zero-shot, and further improves upon the zero-shot performance using a few training samples.

研究动机与目标

  • 开发一种通用视觉系统,可在不修改架构或训练流程的情况下学习并执行多种视觉任务。
  • 通过统一架构和自然语言任务描述,实现新任务的零样本和少样本学习。
  • 从三个维度评估泛化能力:架构、技能间概念迁移,以及学习效率。
  • 减少对任务特定头和定制训练流水线的依赖,这些在专用视觉模型中较为常见。
  • 建立基准和评估协议,用于衡量视觉语言系统中的泛化性能。

提出的方法

  • 该模型使用视觉变换器编码器处理图像,并使用变换器解码器基于自然语言任务描述生成文本和边界框输出。
  • 它在多个任务(VQA、字幕生成、定位和分类)上进行端到端训练,使用单一共享架构且无需任务特定头。
  • 通过自然语言提示(例如:'蓝色汽车的品牌是什么?')提供任务说明,以实现任务无关的推理。
  • 模型利用来自 DETR 风格目标检测器(RoI 特征)和视觉变换器特征的特征,并通过消融研究展示了这些特征对性能的影响。
  • 引入一种新的数据集划分方式 Coco-sce,通过在训练任务中排除某些概念但通过其他任务暴露这些概念,以评估技能-概念迁移。
  • 对微调进行应用,以评估学习效率和灾难性遗忘,特别是在指代表达任务上。

实验结果

研究问题

  • RQ1单一视觉语言架构是否可以在不修改架构的情况下执行多种视觉任务?
  • RQ2该模型在未见过的技能-概念组合(如定位被排除的对象类别)上能实现多大程度的泛化?
  • RQ3多任务预训练在多大程度上提升了新任务上的零样本和少样本性能?
  • RQ4当在新任务上微调时,该模型的学习效率和记忆保持能力与专用模型相比如何?
  • RQ5架构组件(如 RoI 特征)和端到端微调对性能和泛化能力有何影响?

主要发现

  • GPV-1 在指代表达任务上实现了强大的零样本性能,无需在该任务上进行任何微调即可正确地定位对象。
  • 在指代表达任务上微调时,GPV-1 展现出优于仅在定位任务上预训练的模型的样本效率,学习速度更快且初始性能更优。
  • 多任务 GPV-1 在微调 10,000 个指代表达样本后,仍保持其原始在 VQA、字幕生成和定位任务上 85% 的性能,而 GPV-1-Loc(单任务)则表现出显著更快的遗忘速度。
  • 该模型展示了技能-概念迁移能力:即使未显式在该概念上进行定位任务的训练,也能在训练了涉及 'muskrat' 的 VQA 和字幕任务后定位 'muskrat'。
  • 消融研究显示,RoI 特征显著提升了 VQA 性能,略微提升了字幕生成性能,但略微损害了定位和分类性能,表明特征使用存在权衡。
  • 端到端微调在所有任务上均提升了性能,其中 VQA(从 56.4 提升至 58.8 准确率)和字幕生成(BLEU-4 从 0.883 提升至 0.908)的增益最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。