[论文解读] Visually-Augmented Language Modeling
本文提出 VaLM,一种视觉增强的语言建模范式,通过检索图像增强预训练语言模型,以提升视觉常识推理能力。通过使用基于 CLIP 的图像检索模块和用于文本-图像联合注意力的视觉知识融合层,VaLM 在视觉知识密集型任务上达到最先进性能,在 MemoryColor、RelativeSize 和 ObjectShape 上分别取得 +14.50%、+17.80% 和 +11.68% 的准确率提升。
Human language is grounded on multimodal knowledge including visual knowledge like colors, sizes, and shapes. However, current large-scale pre-trained language models rely on text-only self-supervised training with massive text data, which precludes them from utilizing relevant visual information when necessary. To address this, we propose a novel pre-training framework, named VaLM, to Visually-augment text tokens with retrieved relevant images for Language Modeling. Specifically, VaLM builds on a novel latent text-image alignment method via an image retrieval module to fetch corresponding images given a textual context. With the visually-augmented context, VaLM uses a visual knowledge fusion layer to enable multimodal grounded language modeling by attending to both text context and visual knowledge in images. We evaluate VaLM on various visual knowledge-intensive commonsense reasoning tasks, which require visual information to excel. The experimental results illustrate that VaLM outperforms all strong language-only and vision-language baselines with substantial gains in reasoning object commonsense including color, size, and shape. Our code is available at https://github.com/Victorwz/VaLM.
研究动机与目标
- 为解决大型语言模型因缺乏视觉基础而导致的幻觉问题,通过在预训练过程中整合视觉知识。
- 使预训练语言模型能够在推理阶段有效利用视觉信息,而无需依赖配对的图文数据。
- 设计一种灵活的、动态的机制,实现文本标记与相关图像的对齐,以增强上下文理解能力。
- 通过多模态融合提升对物体属性(如颜色、大小和形状)的推理能力。
提出的方法
- 使用基于 CLIP 的图像检索模块,为预训练文本语料中的每个标记检索 k 个最近邻图像,从而实现对文本上下文的视觉增强。
- 视觉知识融合层支持文本标记与检索图像之间的联合自注意力计算,图像特定的注意力键和值使用独立的线性投影。
- 模型采用共享的上下文权重矩阵进行注意力投影,仅添加图像特定的偏置项以提升效率与性能。
- 该框架支持端到端的预训练与微调,使模型在推理过程中可动态整合视觉知识。
- 图像检索基于 CLIP 缓存的图像嵌入实现,支持在统一的文本-图像嵌入空间中高效可扩展的检索。
- 该架构兼容自回归语言模型,可扩展至仅编码器或编码器-解码器主干网络。
实验结果
研究问题
- RQ1语言模型能否通过检索图像实现有效增强,从而提升对颜色、大小和形状等视觉常识属性的推理能力?
- RQ2与监督视觉-语言预训练相比,动态图像检索在零样本推理性能方面表现如何?
- RQ3在不引入过多参数的前提下,将视觉特征有效融合到语言模型注意力机制中的最优方式是什么?
- RQ4视觉知识的整合是否能减少语言模型预测中的幻觉现象?
- RQ5所提出的框架能否同时提升视觉常识推理与通用自然语言理解任务的性能?
主要发现
- 与强基线相比,VaLM 在 MemoryColor 数据集上实现了 +14.50% 的绝对准确率提升,显著增强了对物体颜色的推理能力。
- 在 RelativeSize 基准上,VaLM 提升了 +17.80%,展现出在相对物体大小推理方面的强大性能。
- 在 ObjectShape 数据集上,VaLM 实现了 +11.68% 的改进,表明其在建模与形状相关的常识知识方面具有高效性。
- 消融实验证实,在注意力投影中引入图像特定偏置项的性能优于参数共享或使用完整图像特定投影。
- 在多个视觉知识密集型推理任务中,该模型均优于仅语言模型和视觉-语言预训练模型。
- VaLM 同样提升了通用自然语言理解任务的性能,表明其优势不仅限于视觉常识推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。