Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Visual and Textual Information Fusion in Multimedia Retrieval - A Graph-based Point of View

Gabriela Csurka, Julien Ah-Pine|arXiv (Cornell University)|Jan 27, 2014
Advanced Image and Video Retrieval Techniques参考文献 61被引用 6
一句话总结

本文提出了一种统一的基于图的框架,用于在多媒体检索中无监督地融合视觉与文本信息,整合了跨媒体相似性与基于随机游走的评分方法。结果表明,这两种方法均为广义模型的特例,在三个真实世界数据集上提升了检索性能,同时通过语义过滤降低了计算复杂度。

ABSTRACT

Multimedia collections are more than ever growing in size and diversity. Effective multimedia retrieval systems are thus critical to access these datasets from the end-user perspective and in a scalable way. We are interested in repositories of image/text multimedia objects and we study multimodal information fusion techniques in the context of content based multimedia information retrieval. We focus on graph based methods which have proven to provide state-of-the-art performances. We particularly examine two of such methods : cross-media similarities and random walk based scores. From a theoretical viewpoint, we propose a unifying graph based framework which encompasses the two aforementioned approaches. Our proposal allows us to highlight the core features one should consider when using a graph based technique for the combination of visual and textual information. We compare cross-media and random walk based results using three different real-world datasets. From a practical standpoint, our extended empirical analysis allow us to provide insights and guidelines about the use of graph based methods for multimodal information fusion in content based multimedia information retrieval.

研究动机与目标

  • 通过在无监督信号下融合视觉与文本模态,解决基于内容的多媒体信息检索(CBMIR)中的语义鸿沟问题。
  • 将两种主流的基于图的融合方法——跨媒体相似性与基于随机游走的评分——统一到一个单一的理论框架中。
  • 通过文本查询的语义过滤,降低基于图模型的计算与存储成本。
  • 在真实世界多媒体数据集上对两种融合方法的性能进行实证评估与比较。

提出的方法

  • 提出一种统一的基于图的框架,将跨媒体相似性与基于随机游走的评分方法作为广义模型的特例进行泛化。
  • 利用条件概率 p(v|u) 进行语义过滤,以优化文本相似性,提升相关性并降低复杂度。
  • 采用Fisher向量(FV)表示法结合高斯混合模型(GMMs)进行视觉特征表示,使用SIFT-like ORH与局部颜色统计(LCS)作为低级描述符。
  • 通过Fisher核计算视觉相似性,并利用Cholesky分解对结果进行归一化,以实现高效的点积计算。
  • 构建一个多模态图,其中节点代表多媒体项目,边编码视觉与文本相似性。
  • 使用空间金字塔池化方法聚合图像区域(1x1、1x3、2x2)的FV表示,增强视觉特征中的空间上下文信息。

实验结果

研究问题

  • RQ1如何在无监督条件下有效融合视觉与文本信息以实现多媒体检索?
  • RQ2在基于图的融合中,跨媒体相似性与基于随机游走的评分方法之间存在何种理论关系?
  • RQ3基于词语蕴含的语义过滤能否改善相似性估计并降低计算负载?
  • RQ4在多样化的现实世界多媒体数据集中,两种基于图的融合方法——跨媒体相似性与随机游走——的性能表现如何?
  • RQ5构建可扩展且高效的基于图的多模态融合模型的关键设计原则是什么?

主要发现

  • 所提出的统一框架表明,跨媒体相似性与基于随机游走的方法均为广义基于图的融合模型的特例。
  • 基于 p(v|u) 的语义过滤显著提升了文本相似性估计的准确性,并降低了图模型的计算负担。
  • 结合空间金字塔与基于GMM的视觉词汇表的Fisher向量表示,能够生成鲁棒的视觉表征并获得高质量的相似性分数。
  • 在三个真实世界数据集上,基于图的融合方法优于基线方法,其中随机游走方法在检索准确率方面表现尤为突出。
  • 在2010年Wikipedia数据集中,文本语义过滤与视觉FV表示的结合实现了26.3%的MAP,优于标准语言模型。
  • 通过语义过滤减少相关连接数量,该框架实现了可扩展的检索,提升了效率,同时未牺牲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。