[论文解读] VoLTA: Vision-Language Transformer with Weakly-Supervised Local-Feature Alignment
VoLTA 提出了一种视觉-语言 Transformer 模型,仅使用图像-标题配对即可实现细粒度的区域级理解,无需昂贵的边界框标注。它利用图最优传输(GOT)结合 Wasserstein 距离与 Gromov-Wasserstein 距离,实现弱监督的局部特征对齐,将多模态融合深度集成于单模态主干网络中,并在下游任务上优于需要大量框标注数据的方法。
Vision-language pre-training (VLP) has recently proven highly effective for various uni- and multi-modal downstream applications. However, most existing end-to-end VLP methods use high-resolution image-text box data to perform well on fine-grained region-level tasks, such as object detection, segmentation, and referring expression comprehension. Unfortunately, such high-resolution images with accurate bounding box annotations are expensive to collect and use for supervision at scale. In this work, we propose VoLTA (Vision-Language Transformer with weakly-supervised local-feature Alignment), a new VLP paradigm that only utilizes image-caption data but achieves fine-grained region-level image understanding, eliminating the use of expensive box annotations. VoLTA adopts graph optimal transport-based weakly-supervised alignment on local image patches and text tokens to germinate an explicit, self-normalized, and interpretable low-level matching criterion. In addition, VoLTA pushes multi-modal fusion deep into the uni-modal backbones during pre-training and removes fusion-specific transformer layers, further reducing memory requirements. Extensive experiments on a wide range of vision- and vision-language downstream tasks demonstrate the effectiveness of VoLTA on fine-grained applications without compromising the coarse-grained downstream performance, often outperforming methods using significantly more caption and box annotations.
研究动机与目标
- 解决在不依赖昂贵边界框标注的情况下实现细粒度区域级视觉-语言理解的挑战。
- 通过仅使用图像-标题对,在统一的预训练框架中整合图像级与区域级视觉-语言任务。
- 开发一种内存、计算和时间效率更高的视觉-语言预训练范式,能够有效扩展至大规模网络采集的图像-标题数据。
- 克服现有方法的局限性:要么仅关注图像级理解(使用全局特征上的对比损失),要么需要区域级监督(边界框)。
提出的方法
- 提出一种图最优传输(GOT)目标,结合 Wasserstein 距离(WD)与 Gromov-Wasserstein 距离(GWD),以弱监督方式对齐局部图像补丁与文本标记。
- 用受 Barlow Twins 启发的冗余减少目标替代标准对比学习,降低数据与计算需求,且无需难负样本挖掘。
- 将多模态融合深度嵌入单模态视觉与语言 Transformer 主干网络(如 Swin Transformer)中,无需专用的融合 Transformer 层。
- 基于 GOT 推导出自归一化的、可解释的匹配准则,生成视觉补丁与文本跨度之间的显式注意力对齐。
- 仅使用图像-文本对在大规模图像-标题数据集(如 COCO)上进行预训练,实现零样本迁移至粗粒度与细粒度下游任务。
- 采用受 FIBER 启发的两阶段训练策略,但减少对标注的依赖,重点聚焦于局部特征对齐而非框预测。
实验结果
研究问题
- RQ1是否可以在不使用边界框标注的情况下实现细粒度区域级视觉-语言理解?
- RQ2与标准 Wasserstein 距离相比,结合 WD 与 GWD 的图最优传输是否能提升弱监督 VLP 中的局部特征对齐效果?
- RQ3与专用融合 Transformer 相比,将融合深度嵌入单模态主干网络是否在效率与性能上更具优势?
- RQ4是否能够通过仅在图像-标题对上预训练的统一 VLP 框架,在图像级与区域级下游任务上均达到最先进性能?
- RQ5与使用显著更多框标注数据的强基线相比,VoLTA 在下游准确率与效率方面表现如何?
主要发现
- VoLTA 在无任何边界框标注的情况下,在指代表达理解(RefCOCO、RefCOCO+、RefCOCOg)任务上达到最先进性能,尤其在存在多个相似物体的困难样本上优于 CLIP 基线模型。
- 在使用语言条件提示的 COCO 目标检测任务中,VoLTA 能够成功预测与文本提示相关的边界框,例如检测 'person' 和 'cup',同时忽略无关对象。
- 在视觉问答(VQAv2)与视觉推理(NLVR2)任务中,VoLTA 展现出强大的泛化能力,能正确回答涉及物体计数、颜色与空间关系的复杂问题。
- VoLTA-B(Swin-B 主干)在图像分类与检索任务上取得具有竞争力的结果,表明细粒度对齐不会损害粗粒度性能。
- 尽管预训练所用的框标注数据远少于其他基线模型,VoLTA 在多个下游任务上仍优于 CLIP 与 FIBER 等强基线,展现出卓越的数据效率。
- 定性注意力图显示,VoLTA 能够基于文本跨度学习关注语义相关的图像区域,例如在指代表达理解中关注 'the slice of cake on the left'。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。