Skip to main content
QUICK REVIEW

[论文解读] Polysemous Visual-Semantic Embedding for Cross-Modal Retrieval

Yale Song, Mohammad Soleymani|arXiv (Cornell University)|Jun 11, 2019
Multimodal Machine Learning Applications参考文献 57被引用 22
一句话总结

该论文提出了一种多义视觉-语义嵌入(Polysemous Visual-Semantic Embedding, PVSE)框架,采用多头自注意力机制与残差学习,实现一对多的实例嵌入,以生成多样且上下文感知的视觉与文本实例表示。通过在多实例学习(Multiple-Instance Learning, MIL)框架中绑定两个多义实例嵌入网络(Polysemous Instance Embedding Networks, PIE-Nets),并引入最大均值差异(Maximum Mean Discrepancy, MMD)正则化,PVSE在图像-文本与视频-文本检索任务中显著提升了对部分关联与多义性问题的鲁棒性,实现在MS-COCO、TGIF以及一个新构建的50K视频-句子数据集(MRW)上的最先进性能。

ABSTRACT

Visual-semantic embedding aims to find a shared latent space where related visual and textual instances are close to each other. Most current methods learn injective embedding functions that map an instance to a single point in the shared space. Unfortunately, injective embedding cannot effectively handle polysemous instances with multiple possible meanings; at best, it would find an average representation of different meanings. This hinders its use in real-world scenarios where individual instances and their cross-modal associations are often ambiguous. In this work, we introduce Polysemous Instance Embedding Networks (PIE-Nets) that compute multiple and diverse representations of an instance by combining global context with locally-guided features via multi-head self-attention and residual learning. To learn visual-semantic embedding, we tie-up two PIE-Nets and optimize them jointly in the multiple instance learning framework. Most existing work on cross-modal retrieval focuses on image-text data. Here, we also tackle a more challenging case of video-text retrieval. To facilitate further research in video-text retrieval, we release a new dataset of 50K video-sentence pairs collected from social media, dubbed MRW (my reaction when). We demonstrate our approach on both image-text and video-text retrieval scenarios using MS-COCO, TGIF, and our new MRW dataset.

研究动机与目标

  • 解决传统单射视觉-语义嵌入在处理具有多重含义的实例时的局限性。
  • 应对文本描述仅指向图像或视频部分区域的局部跨模态关联问题。
  • 开发一种方法,为每个实例生成多个多样化的表示,以更好地捕捉歧义语义。
  • 通过建模不确定性和部分对齐关系,提升图像-文本与视频-文本检索任务的性能。
  • 通过发布一个来自社交媒体的全新50K视频-句子数据集(MRW),推动视频-文本检索领域的研究。

提出的方法

  • 提出多义实例嵌入网络(PIE-Nets),利用多头自注意力机制对不同局部区域或帧进行关注,为每个输入生成K个多样化表示。
  • 通过残差学习将局部表示与全局上下文嵌入相结合,以保留信息特征并避免冗余。
  • 引入多样性正则化损失,防止K个表示坍缩为单一均值或模式。
  • 将两个PIE-Nets(一个用于视觉,一个用于文本)进行参数共享,并在多实例学习(MIL)框架中联合训练,仅要求K×K个嵌入对中的一个实现良好对齐即可。
  • 应用最大均值差异(MMD)以最小化视觉与文本嵌入空间之间的分布差异,提升对齐的鲁棒性。
  • 端到端优化完整模型,采用带有MIL松弛的对比损失与MMD正则化,以处理歧义性和部分关联问题。

实验结果

研究问题

  • RQ1与传统单射映射相比,一对多嵌入方法是否能更有效地表示具有多义性的视觉与文本实例?
  • RQ2在部分或隐式跨模态关联条件下,建模多个多样化表示如何提升跨模态检索性能?
  • RQ3所提出的基于MIL的训练目标在歧义检索场景中,相较于标准对比学习,优势有多大?
  • RQ4多头自注意力与残差学习的结合如何提升视觉-语义嵌入中的表示质量?
  • RQ5该方法能否泛化至具有挑战性的视频-文本检索任务,特别是在关联关系隐含或模糊的情况下?

主要发现

  • 在MS-COCO数据集上,PVSE在图像-文本检索任务中达到最先进性能,R@1与R@5指标均优于先前方法。
  • 在TGIF视频-文本检索基准上,PVSE通过有效捕捉视频内容的时间与语义变化,展现出卓越性能。
  • 所提出的MRW数据集(50K条来自社交媒体的视频-句子对)揭示了视觉-文本关联中存在高度歧义,每个查询存在多个合理匹配。
  • 定性分析表明,PVSE中的视觉与文本注意力图能准确聚焦于显著区域与关键词,且检索结果与注意力模式高度一致。
  • 模型对部分关联的鲁棒性通过其在仅部分视频或句子语义对齐时仍能检索到相关结果得到验证。
  • MMD正则化显著减少了视觉与文本嵌入空间之间的分布差异,提升了泛化能力与对齐质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。