Skip to main content
QUICK REVIEW

[论文解读] PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models

Yuan Yao, Qianyu Chen|arXiv (Cornell University)|May 23, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

PEVL 提出了一种统一的文本建模范式,将离散的对象位置与文本标记相结合,用于无检测器的视觉语言预训练,通过广义掩码语言建模(GMLM)目标实现显式的对象位置建模,并支持灵活的提示调优。该方法在对位置敏感的任务(如指代表达理解与短语定位)上达到最先进性能,同时在使用定位输入的无位置敏感任务上也表现更优。

ABSTRACT

Vision-language pre-training (VLP) has shown impressive performance on a wide range of cross-modal tasks, where VLP models without reliance on object detectors are becoming the mainstream due to their superior computation efficiency and competitive performance. However, the removal of object detectors also deprives the capability of VLP models in explicit object modeling, which is essential to various position-sensitive vision-language (VL) tasks, such as referring expression comprehension and visual commonsense reasoning. To address the challenge, we introduce PEVL that enhances the pre-training and prompt tuning of VLP models with explicit object position modeling. Specifically, PEVL reformulates discretized object positions and language in a unified language modeling framework, which facilitates explicit VL alignment during pre-training, and also enables flexible prompt tuning for various downstream tasks. We show that PEVL enables state-of-the-art performance of detector-free VLP models on position-sensitive tasks such as referring expression comprehension and phrase grounding, and also improves the performance on position-insensitive tasks with grounded inputs. We make the data and code for this paper publicly available at https://github.com/thunlp/PEVL.

研究动机与目标

  • 为解决无检测器视觉语言预训练(VLP)模型中缺乏显式对象位置建模的问题,该问题限制了其在位置敏感任务上的性能表现。
  • 将视觉对象位置与语言标记统一整合到单一语言建模范式中,以支持联合预训练与灵活的提示调优。
  • 通过在多种下游任务中复用相同的 GMLM 头进行提示调优,缓解预训练与微调之间的分布差异。
  • 通过引入一种顺序感知的目标用于掩码位置重建,提升位置学习的鲁棒性,降低对边界框标注噪声的敏感性。

提出的方法

  • 将对象边界框坐标离散化为离散的位置标记,并将其拼接在对应对象描述标记之后,构成输入序列。
  • 将预训练任务表述为广义掩码语言建模(GMLM)任务,模型从跨模态上下文中预测被掩码的文本和位置标记。
  • 引入一种顺序感知的目标用于位置标记重建,为邻近位置分配更高的软标签,即使在离散化后也能保持空间顺序。
  • 通过使用相同的 GMLM 头将下游视觉语言任务重新表述为填空问题,实现提示调优,从而最小化预训练与微调之间的分布偏移。
  • 采用共享的 Transformer 编码器-解码器架构,确保预训练与提示调优之间的一致性,支持位置输入和位置输出任务。
  • 保持文本与位置标记相同的掩码比率(如 BERT 所采用),以确保预训练期间学习的平衡性。

实验结果

研究问题

  • RQ1能否在不依赖对象检测器的前提下,有效将显式对象位置建模整合到无检测器视觉语言预训练中?
  • RQ2如何对离散位置标记进行建模,以保持空间顺序并增强对标注噪声的鲁棒性?
  • RQ3统一的 GMLM 框架能否同时实现语言与位置表征的联合预训练,并支持在多样化视觉语言任务中的灵活提示调优?
  • RQ4与标准掩码方法相比,所提出的用于位置重建的顺序感知目标是否能带来更优的定位与推理性能?
  • RQ5相同的 GMLM 头能否在位置敏感与无位置敏感任务中有效复用于提示调优,从而减少预训练与微调之间的差距?

主要发现

  • 在无检测器 VLP 模型中,PEVL 在指代表达理解与短语定位任务上达到最先进性能,优于缺乏显式位置建模的先前方法。
  • 所提出的用于掩码位置重建的顺序感知目标在中间预训练阶段显著加快了 RefCOCO 任务的收敛速度并提升了性能,如表 7 所示。
  • 当使用定位输入时,PEVL 在无位置敏感任务(如视觉问题回答)上也表现更优,表明其具备更强的鲁棒性与泛化能力。
  • 模型在小对象上的定位结果表现强劲,与基于回归的方法相当,如图 2 所示。
  • 消融实验表明,高掩码比率以及对被掩码位置的全面覆盖对有效的位置学习至关重要。
  • 采用共享 GMLM 头的统一提示调优框架,可在多样化下游任务中实现一致且高效的适应,最小化了预训练与微调之间的分布偏移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。