Skip to main content
QUICK REVIEW

[论文解读] Visual Grounding Strategies for Text-Only Natural Language Processing

Damien Sileo|arXiv (Cornell University)|Mar 25, 2021
Multimodal Machine Learning Applications参考文献 41被引用 4
一句话总结

本文提出了两种视觉定位策略——迁移定位与关联定位,通过多模态预训练增强纯文本NLP任务。通过使用占位符或图像检索整合视觉信号,该方法在语言建模和常识推理任务上提升了性能,其中关联定位在多种NLP基准上均表现出一致的性能提升。

ABSTRACT

Visual grounding is a promising path toward more robust and accurate Natural Language Processing (NLP) models. Many multimodal extensions of BERT (e.g., VideoBERT, LXMERT, VL-BERT) allow a joint modeling of texts and images that lead to state-of-the-art results on multimodal tasks such as Visual Question Answering. Here, we leverage multimodal modeling for purely textual tasks (language modeling and classification) with the expectation that the multimodal pretraining provides a grounding that can improve text processing accuracy. We propose possible strategies in this respect. A first type of strategy, referred to as {\it transferred grounding} consists in applying multimodal models to text-only tasks using a placeholder to replace image input. The second one, which we call {\it associative grounding}, harnesses image retrieval to match texts with related images during both pretraining and text-only downstream tasks. We draw further distinctions into both strategies and then compare them according to their impact on language modeling and commonsense-related downstream tasks, showing improvement over text-only baselines.

研究动机与目标

  • 探究使用视觉信号的多模态预训练是否能够提升纯文本NLP任务的性能。
  • 解决将原本为多模态任务设计的视觉语言模型适配至纯文本下游应用的挑战。
  • 系统比较不同视觉定位策略在准确率、效率和内存使用方面的表现。
  • 评估多模态Transformer中图像表示质量与计算成本之间的权衡。
  • 证明视觉定位可超越纯文本预训练的性能,尤其在常识推理任务中提升文本理解能力。

提出的方法

  • 提出‘迁移定位’策略:在纯文本任务上微调多模态模型,使用图像输入的占位符,以保留文本编码器学习到的表示。
  • 引入‘关联定位’策略:在预训练和推理阶段均通过关联模块从大型外部图像集合中检索相关图像。
  • 采用共享的多模态Transformer架构,通过文本与视觉特征之间的交叉注意力机制,使用CNN生成的区域图像表示。
  • 在文本和图像特征上应用联合掩码语言建模(JMLM),使模型在预训练期间能够关注两种模态。
  • 通过优化图像表示尺寸和在关联策略中使用高效检索机制,降低内存使用。
  • 在GLUE、SuperGLUE和SentEval等标准NLP基准上评估策略,重点关注语言建模和常识推理任务。

实验结果

研究问题

  • RQ1使用视觉信号的多模态预训练是否能够提升语言建模和文本分类等纯文本NLP任务的性能?
  • RQ2在准确率和效率方面,迁移定位与关联定位策略有何差异?
  • RQ3图像表示质量和检索准确率对下游NLP性能有何影响?
  • RQ4图像表示尺寸如何影响多模态Transformer中的内存使用和模型性能?
  • RQ5视觉定位在多大程度上能超越纯文本基线,提升常识推理和合理性判断能力?

主要发现

  • 关联定位策略在语言建模、合理性估计、隐喻性检测和话语关系预测任务中均取得最佳整体性能。
  • 迁移定位在下游NLP任务中表现优异,尤其因其在推理阶段无需图像输入。
  • 基于物体的关联定位在准确率和鲁棒性方面均优于基于图像的检索,尤其在零样本和少样本设置下表现更优。
  • 减小图像表示尺寸会导致内存效率与性能之间的可测量权衡,最优平衡点出现在较小的嵌入维度。
  • 联合预训练同时使用图文对和纯文本语料,相比仅使用图文对预训练,能提升泛化能力并减少领域偏差。
  • 视觉定位在常识推理任务中带来一致的性能提升,表明视觉关联能增强语义和上下文理解,超越纯文本监督的局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。