Skip to main content
QUICK REVIEW

[论文解读] End-to-end Knowledge Retrieval with Multi-modal Queries

Man Luo, Zhiyuan Fang|arXiv (Cornell University)|Jun 1, 2023
Multimodal Machine Learning Applications被引用 1
一句话总结

本文提出了 ReMuQ,一个用于多模态查询知识检索的新基准,该查询结合了图像和文本线索。它提出了 ReViz,一种端到端的视觉-语言检索模型,可直接处理原始图像和文本,无需中间模块(如图像字幕生成器),通过一种新颖的预训练任务 VL-ICT,在 ReMuQ 和 OK-VQA 上实现了零样本和微调设置下的最先进性能。

ABSTRACT

We investigate knowledge retrieval with multi-modal queries, i.e. queries containing information split across image and text inputs, a challenging task that differs from previous work on cross-modal retrieval. We curate a new dataset called ReMuQ for benchmarking progress on this task. ReMuQ requires a system to retrieve knowledge from a large corpus by integrating contents from both text and image queries. We introduce a retriever model ``ReViz'' that can directly process input text and images to retrieve relevant knowledge in an end-to-end fashion without being dependent on intermediate modules such as object detectors or caption generators. We introduce a new pretraining task that is effective for learning knowledge retrieval with multimodal queries and also improves performance on downstream tasks. We demonstrate superior performance in retrieval on two datasets (ReMuQ and OK-VQA) under zero-shot settings as well as further improvements when finetuned on these datasets.

研究动机与目标

  • 为解决使用将信息分散在图像和文本中的查询从大规模语料库中检索相关知识的挑战,该任务在以往工作中研究不足。
  • 克服现有两阶段检索方法的局限性,这些方法依赖于中间图像到文本模块(如字幕生成器或目标检测器)。
  • 开发一种端到端的视觉-语言检索模型,直接整合视觉和文本输入以提升知识检索性能。
  • 设计一种弱监督预训练任务 VL-ICT,以在无需完全标注的图文对的情况下提升多模态检索性能。

提出的方法

  • 提出 ReViz,一种视觉-语言检索模型,使用 ViLT 编码原始图像像素,使用 BERT 编码长文本知识,支持端到端训练。
  • 引入一种新颖的预训练任务——视觉-语言掩码对比微调(VL-ICT),通过在文本中掩码关键词来防止信息泄露,同时对齐图像和文本模态。
  • 从 WiT 数据集构建训练三元组,确保图像和文本输入之间互斥,以促进联合理解。
  • 采用双编码器架构,使用模态特定的编码器(视觉Transformer和语言Transformer),并通过对比学习学习模态对齐。
  • 使用 WebQA 的答案选项作为检索语料库,构成 ReMuQ 的知识来源,确保知识跨度的多样性和相关性。
  • 在 ReMuQ 和 OK-VQA 上进行零样本和微调评估,与基于字幕的基线模型及强大的纯文本模型进行比较。

实验结果

研究问题

  • RQ1端到端的视觉-语言检索模型是否能优于依赖中间图像字幕生成或目标检测的两阶段方法?
  • RQ2像 VL-ICT 这样的弱监督预训练任务在提升多模态查询检索性能方面有多有效?
  • RQ3去除对外部模块(如字幕生成器)的依赖是否能提升模型在不同领域的泛化能力?
  • RQ4在 VL-ICT 预训练任务中,最优的掩码比例是多少,以在信息泄露与模型学习之间取得平衡?

主要发现

  • ReViz 在 ReMuQ 和 OK-VQA 数据集上均实现了最先进性能,在零样本和微调设置下均优于所有先前方法。
  • 在 VL-ICT 预训练任务中,掩码 20% 关键词的模型达到最佳检索性能,优于 0% 和更高掩码比例的设置。
  • 使用真实图像字幕相比生成字幕能显著提升检索性能,凸显了先前方法中字幕生成模型的瓶颈。
  • 消融实验证实,ReViz 的端到端设计避免了中间模块带来的信息损失,从而实现更鲁棒的知识检索。
  • 在 ReMuQ 或 OK-VQA 上微调 ReViz 能在所有指标上持续提升性能,证明了其适应性和强泛化能力。
  • 所提出的 VL-ICT 预训练任务能有效提升下游检索性能,即使在训练数据有限或部分重叠的情况下也有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。