Skip to main content
QUICK REVIEW

[论文解读] Modeling Text with Graph Convolutional Network for Cross-Modal Information Retrieval

Jing Yu, Yuhang Lu|arXiv (Cornell University)|Feb 3, 2018
Multimodal Machine Learning Applications参考文献 20被引用 15
一句话总结

本文提出 GIN,一种双路径神经网络,通过基于 word2vec 的相似性将文本建模为图以捕捉语义关系,同时使用预训练的 CNN 特征表示图像。该模型通过成对相似性损失联合学习共享语义空间,在文本查询图像检索任务中相比最先进方法实现了 17% 的准确率提升。

ABSTRACT

Cross-modal information retrieval aims to find heterogeneous data of various modalities from a given query of one modality. The main challenge is to map different modalities into a common semantic space, in which distance between concepts in different modalities can be well modeled. For cross-modal information retrieval between images and texts, existing work mostly uses off-the-shelf Convolutional Neural Network (CNN) for image feature extraction. For texts, word-level features such as bag-of-words or word2vec are employed to build deep learning models to represent texts. Besides word-level semantics, the semantic relations between words are also informative but less explored. In this paper, we model texts by graphs using similarity measure based on word2vec. A dual-path neural network model is proposed for couple feature learning in cross-modal information retrieval. One path utilizes Graph Convolutional Network (GCN) for text modeling based on graph representations. The other path uses a neural network with layers of nonlinearities for image modeling based on off-the-shelf features. The model is trained by a pairwise similarity loss function to maximize the similarity of relevant text-image pairs and minimize the similarity of irrelevant pairs. Experimental results show that the proposed model outperforms the state-of-the-art methods significantly, with 17% improvement on accuracy for the best case.

研究动机与目标

  • 解决向量空间文本模型在跨模态检索中忽略词级语义关系的局限性。
  • 通过将文本建模为图以保留结构化和关系语义,提升跨模态检索性能。
  • 通过双路径神经网络,联合学习图像与文本之间的共享语义空间和耦合特征表示。
  • 通过图卷积网络将全局语义结构整合到深度学习中,以增强特征表示。
  • 通过使用英语和中文基准数据集,验证模型在不同语言和模态间的泛化能力。

提出的方法

  • 构建一个文本图,其中节点代表词语,边根据 word2vec 相似性加权,以编码语义关系。
  • 应用图卷积网络(GCN)从图结构中学习上下文感知的、关系感知的文本表示。
  • 使用一个包含多个非线性层的独立深度神经网络处理预训练的 CNN 特征,以生成图像表示。
  • 采用成对相似性损失函数,最大化相关文本-图像对之间的相似性,同时最小化不相关对之间的相似性。
  • 端到端训练整个模型,以联合优化特征学习与语义空间对齐。
  • 为图像使用现成的 ImageNet 预训练 CNN 特征,同时端到端训练 GCN 和全连接层以处理文本。

实验结果

研究问题

  • RQ1通过基于 word2vec 相似性的图结构建模文本,能否提升跨模态检索中的语义表示?
  • RQ2通过 GCN 引入全局语义结构,是否能相比平坦向量模型在未见文本-图像对上实现更好的泛化性能?
  • RQ3采用 GCN 处理文本、前馈网络处理图像的双路径架构,能否在跨模态检索中超越现有最先进模型?
  • RQ4该模型在多样化数据集和模态(如非英语文本(如中文)和异构数据)上的表现如何?
  • RQ5共享语义空间与耦合特征的联合学习,在多大程度上提升了检索准确率?

主要发现

  • 在 Eng-Wiki 数据集上,GIN 在文本查询图像检索任务中相比第二名方法 JFSSL 实现了 17.13% 的平均平均精度(MAP)提升。
  • 在 NUS-WIDE 数据集上,GIN 除 AUSL 和 LGCFL 外优于所有竞争模型,展现出在大规模基准上的强劲性能。
  • 在图像查询文本任务中,GIN 在 Eng-Wiki 数据集上所有召回率下的精度均最高,表明其检索质量稳健。
  • 在 TVGraz 数据集上,GIN 在文本查询和图像查询任务中均取得最佳结果,尤其在图像查询文本检索中提升更大,得益于更优的 CNN 特征。
  • 在中文 Ch-Wiki 数据集上,GIN 在文本查询中提升 6.77%,在图像查询中提升 2.43%,显示出对非英语文本的强大泛化能力。
  • 该模型显著优于向量空间基线方法,通过基于图的文本建模捕捉语义关系,尤其在零样本或罕见词泛化场景中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。