[论文解读] Multi-level Multimodal Common Semantic Space for Image-Phrase Grounding
本文提出了一种用于图像-短语定位的多层级多模态共享语义空间,通过将深层视觉特征与上下文化的文本嵌入(如 ELMo)进行非线性映射,将其映射到一个共享空间,在该空间中利用余弦相似度实现对齐。一种多层级注意力机制可为每个查询选择最相关的视觉-语义层级,从而在三个基准数据集上实现 SOTA 性能,相对提升达 20%–60%。
We address the problem of phrase grounding by lear ing a multi-level common semantic space shared by the textual and visual modalities. We exploit multiple levels of feature maps of a Deep Convolutional Neural Network, as well as contextualized word and sentence embeddings extracted from a character-based language model. Following dedicated non-linear mappings for visual features at each level, word, and sentence embeddings, we obtain multiple instantiations of our common semantic space in which comparisons between any target text and the visual content is performed with cosine similarity. We guide the model by a multi-level multimodal attention mechanism which outputs attended visual features at each level. The best level is chosen to be compared with text content for maximizing the pertinence scores of image-sentence pairs of the ground truth. Experiments conducted on three publicly available datasets show significant performance gains (20%-60% relative) over the state-of-the-art in phrase localization and set a new performance record on those datasets. We provide a detailed ablation study to show the contribution of each element of our approach and release our code on GitHub.
研究动机与目标
- 解决在弱监督设置下定位图像中自然语言短语的挑战。
- 克服先前方法依赖固定边界框提议或全局图像特征的局限性。
- 通过学习视觉与文本特征的非线性、多层级共享语义空间,提升跨模态对齐效果。
- 通过多层级多模态注意力机制实现灵活的逐词视觉特征选择。
- 在弱监督训练范式下,实现图像-短语定位基准上的 SOTA 性能。
提出的方法
- 利用深层卷积神经网络(如 VGG 或 PNASNet)的多层级特征图,捕捉多粒度视觉表征。
- 采用基于字符的语言模型(如 ELMo)生成的上下文化词与句子嵌入,获得更丰富的文本表征。
- 应用专用的非线性映射,将视觉特征与文本嵌入转换到共享的共同语义空间。
- 引入一种多层级多模态注意力机制,在每个视觉与文本层级上计算注意力热力图。
- 基于共同空间中的余弦相似度,为每个查询选择最相关的视觉-语义层级。
- 使用图像-句子对进行弱监督训练,无需边界框标注。
实验结果
研究问题
- RQ1与单层级或线性映射方法相比,多层级共享语义空间是否能提升短语定位性能?
- RQ2对视觉与文本特征采用非线性映射如何影响对齐精度?
- RQ3上下文化文本嵌入(如 ELMo)相比静态或非上下文嵌入,在定位任务中能带来多大程度的性能提升?
- RQ4一种可为每个词或短语选择最优视觉-语义层级的多层级注意力机制,是否能提升定位精度?
- RQ5在注意力热力图中避免使用 Softmax 操作,对性能与灵活性有何影响?
主要发现
- 该模型在 Flickr30k、COCO 和 Visual Genome 上均达到新的 SOTA 性能,相比先前方法相对提升达 20%–60%。
- 消融实验表明,视觉与文本特征的非线性映射至关重要,若替换为线性映射,性能会显著下降。
- 使用上下文化文本嵌入(如 ELMo)相比在词嵌入上训练 BiLSTM,能带来显著的性能提升。
- 对注意力热力图应用 Softmax 会损害性能,因为它强制分布限制了特征选择的灵活性。
- 结合层级选择的多层级注意力机制显著优于固定层级的基线模型,证明了动态层级选择的价值。
- 该模型能成功定位复杂或罕见短语(如 'bronco'),并在具有挑战性的条件下实现良好泛化,尽管在语义相似或过曝区域时偶尔会出现失败。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。