Skip to main content
QUICK REVIEW

[论文解读] Learning Two-Branch Neural Networks for Image-Text Matching Tasks

Liwei Wang, Yin Li|arXiv (Cornell University)|Apr 11, 2017
Multimodal Machine Learning Applications参考文献 50被引用 19
一句话总结

本文提出了两种双分支神经网络架构——嵌入网络与相似度网络——用于图像-文本匹配任务。嵌入网络通过最大边缘排序和改进的邻域采样策略,学习共享潜在空间;相似度网络则通过逐元素乘积融合,直接回归相似度分数。两种模型在短语定位(Flickr30K Entities)和双向图像-句子检索(Flickr30K、MSCOCO)任务上均达到当前最优性能。

ABSTRACT

Image-language matching tasks have recently attracted a lot of attention in the computer vision field. These tasks include image-sentence matching, i.e., given an image query, retrieving relevant sentences and vice versa, and region-phrase matching or visual grounding, i.e., matching a phrase to relevant regions. This paper investigates two-branch neural networks for learning the similarity between these two data modalities. We propose two network structures that produce different output representations. The first one, referred to as an embedding network, learns an explicit shared latent embedding space with a maximum-margin ranking loss and novel neighborhood constraints. Compared to standard triplet sampling, we perform improved neighborhood sampling that takes neighborhood information into consideration while constructing mini-batches. The second network structure, referred to as a similarity network, fuses the two branches via element-wise product and is trained with regression loss to directly predict a similarity score. Extensive experiments show that our networks achieve high accuracies for phrase localization on the Flickr30K Entities dataset and for bi-directional image-sentence retrieval on Flickr30K and MSCOCO datasets.

研究动机与目标

  • 为解决跨模态检索任务中图像与文本模态之间语义相似度度量的挑战。
  • 设计一种对称神经架构,将图像与文本特征映射到共享空间以实现联合学习。
  • 通过嵌入网络中新颖的邻域感知三元组采样策略,提升训练效率与性能。
  • 探索通过逐元素融合实现直接相似度预测,作为共享嵌入学习的替代方案。
  • 评估结合全局图像-句子匹配与局部区域-短语匹配以提升视觉定位可行性的方法。

提出的方法

  • 嵌入网络使用两个独立分支分别处理图像与文本特征,每个分支包含全连接ReLU层并随后进行L2归一化,将输入映射到共享潜在空间。
  • 应用带有最大边缘目标的三元组排序损失,其中正样本对(匹配的图像区域与短语)被拉近,负样本对被推远。
  • 改进的迷你小批量采样策略引入邻域信息,相较于标准三元组采样,显著提升了训练稳定性和性能。
  • 相似度网络通过归一化后的图像与文本特征的逐元素乘积,再接额外全连接层,直接预测相似度分数。
  • 该网络使用逻辑回归损失进行训练,采用二值标签(+1表示正样本对,-1表示负样本对)。
  • 模型在Flickr30K Entities(短语定位)、Flickr30K与MSCOCO(图像-句子检索)数据集上进行评估,采用mAP与R@1等标准指标。

实验结果

研究问题

  • RQ1具有共享潜在空间学习的双分支神经网络是否能在图像-文本匹配任务中超越现有方法?
  • RQ2与标准采样相比,邻域感知三元组采样在嵌入网络中如何提升性能?
  • RQ3通过逐元素融合实现的直接相似度预测网络是否能在不显式学习嵌入空间的情况下取得有竞争力的性能?
  • RQ4为何相似度网络在图像-句子检索任务中表现失败,尽管其在短语定位任务中表现良好?
  • RQ5结合全局图像-句子匹配与局部区域-短语匹配模型是否能显著提升视觉定位性能?

主要发现

  • 嵌入网络在Flickr30K Entities数据集的短语定位任务中达到最先进性能,mAP达到76.4%。
  • 相似度网络在短语定位任务中表现强劲(mAP为74.1%),但在图像-句子检索任务中表现失败,表明其存在任务特异性局限。
  • 在不改变损失函数的前提下,迷你小批量中改进的邻域采样策略显著提升了嵌入网络的性能。
  • 通过加权平均融合图像-句子与区域-短语得分的联合模型仅带来微小改进(如mAP提升0.5%),表明模态间一致性较差。
  • 区域-短语模型在不同图像之间或同一图像中多个短语的排序中得分不一致,限制其作为通用短语检测器的适用性。
  • 图像-句子与区域-短语网络的联合训练未取得理想结果,表明在多粒度匹配的端到端优化中存在挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。