Skip to main content
QUICK REVIEW

[论文解读] MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text

Wenhu Chen, Hexiang Hu|arXiv (Cornell University)|Oct 6, 2022
Multimodal Machine Learning Applications被引用 9
一句话总结

MuRAG 首次提出一种多模态检索增强生成模型,通过从外部非参数化记忆中检索并推理图像和文本,以提升开放域问答性能。该模型在图像-文本和纯文本语料库的混合数据上,使用对比损失和生成损失进行预训练,实现了最先进性能,在 WebQA 和 MultimodalQA 数据集上,无论是在有干扰项设置还是全维基设置下,绝对准确率均比现有模型高出 10–20%。

ABSTRACT

While language Models store a massive amount of world knowledge implicitly in their parameters, even very large models often fail to encode information about rare entities and events, while incurring huge computational costs. Recently, retrieval-augmented models, such as REALM, RAG, and RETRO, have incorporated world knowledge into language generation by leveraging an external non-parametric index and have demonstrated impressive performance with constrained model sizes. However, these methods are restricted to retrieving only textual knowledge, neglecting the ubiquitous amount of knowledge in other modalities like images -- much of which contains information not covered by any text. To address this limitation, we propose the first Multimodal Retrieval-Augmented Transformer (MuRAG), which accesses an external non-parametric multimodal memory to augment language generation. MuRAG is pre-trained with a mixture of large-scale image-text and text-only corpora using a joint contrastive and generative loss. We perform experiments on two different datasets that require retrieving and reasoning over both images and text to answer a given query: WebQA, and MultimodalQA. Our results show that MuRAG achieves state-of-the-art accuracy, outperforming existing models by 10-20\% absolute on both datasets and under both distractor and full-wiki settings.

研究动机与目标

  • 为解决现有检索增强语言模型仅依赖文本的局限性,这些模型无法访问仅编码在图像中的知识。
  • 开发一个统一框架,实现在大规模语料库中对多模态知识(图像和文本)进行检索增强的语言生成。
  • 通过从外部记忆中检索到的视觉和文本证据来增强答案的依据,从而提升事实性开放问答性能。
  • 在多样化图像-文本和纯文本数据集上,使用联合对比损失和生成目标对多模态模型进行预训练,以增强检索和生成能力。

提出的方法

  • MuRAG 将预训练的 T5 编码器与 ViT 编码器结合,将图像-文本对、仅图像和仅文本输入联合嵌入到共享的多模态表征空间中。
  • 该模型采用两阶段训练流程:首先使用小规模的批次内记忆进行高效预训练,然后使用大规模、静态编码并索引的全局记忆进行微调。
  • 在预训练阶段,模型通过对比损失学习区分相关与不相关的记忆条目,并通过生成损失学习利用检索到的知识生成准确答案。
  • 在推理阶段,模型使用查询嵌入从外部记忆中检索相关的图像-文本对,然后基于查询和检索到的多模态证据生成答案。
  • 检索过程是可微的且端到端可训练,使生成器可与检索器联合优化。
  • 该模型在下游 QA 数据集上进行微调,使用相同的对比损失和生成损失,输入包括一个问题以及一组带字幕的图像和文本片段组成的记忆。

实验结果

研究问题

  • RQ1检索增强语言模型能否有效检索并推理多模态知识(图像和文本),以提升开放域问答性能?
  • RQ2在多模态 QA 基准测试中,多模态检索增强生成与仅文本的检索增强模型相比,准确率表现如何?
  • RQ3预训练过程中哪些关键组件对多模态检索增强生成性能的提升最为显著?
  • RQ4为何基于图像的查询仍显著难于基于文本的查询?视觉理解中的主要失败模式是什么?

主要发现

  • MuRAG 在 WebQA 和 MultimodalQA 上均达到最先进性能,在有干扰项和全维基设置下,相比现有基线模型,绝对准确率提升 10–20%。
  • 在 WebQA 数据集中,MuRAG 在干扰项设置下对文本查询的准确率为 80%,对图像查询的准确率为 64%;在全维基设置下,分别为 72% 和 54%。
  • 基于图像的查询显著难于基于文本的查询,主要失败模式为误数(52%)和物体识别错误(29.4%)。
  • 模型表现出捷径学习现象,即即使检索到错误的图像,仍可能基于文本线索生成正确答案,表明其更依赖文本信号而非视觉依据。
  • 视觉理解模块仍是瓶颈,尤其在复杂场景、稀有物体或需要从图像中进行光学字符识别的问题上。
  • 尽管使用了 LAION 等大规模预训练数据,模型仍继承了偏见——例如,5% 的错误源于性别识别错误——凸显了在多模态模型中进一步改进去偏化的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。